【OpenAI】GPT-5.6 发布:三档模型覆盖不同场景 GPT-5.6 分为 Sol(旗舰推理)、Terra(均衡)、Luna(快速推理)三档,GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5,成本降低 25 倍。已登陆 Microsoft 365 Copilot 和 Amazon Bedrock。[GPT-5.6: Frontier intelligence]
【OpenAI】Codex 与 ChatGPT Work 用户突破 800 万 Codex 周活用户达 700 万+,150+ 更新发布。OpenAI 多次重置使用限制以应对需求激增,并推出 100 美元 Codex 积分奖励活动吸引用户从 Claude 迁移。[Codex update]
【Anthropic】Claude Fable 5 登顶 LM Arena 排行榜 Claude Fable 5 以 1508.62 分位居 LM Arena 总榜第一,Claude Opus 4-6-thinking 排名第二。同期推出 Claude for Teachers,为美国 K-12 教师提供免费高级功能。[Claude Fable 5]
【Thinking Machines】发布开源模型 Inkling Inkling 在 Artificial Analysis Agentic 排行榜位列第 8 名(32.3 分),Coding 排行榜位列第 13 名(52.1 分),展示了开源模型在智能体领域的竞争力。[Inkling: Our Open-Weights Model]
【xAI】Grok Build 开源 xAI 开源 Grok Build,同时在 HN 获得 221 点讨论热度。此举为 AI 编程智能体领域增添新的开源选择。[Grok Build is open source]
LM Arena 总榜新格局
SWE-Bench Verified 排名变动
Artificial Analysis Agentic 新秀
7 月 15 日
7 月 14 日
7 月 10 日
7 月 9 日
7 月 15 日
--forward-subagent-text 标志支持流式 JSON 输出子代理内容7 月 14 日
7 月 9 日
7 月 15 日
7 月 14 日
| 来源 | 新闻 |
|---|---|
| Thinking Machines | Inkling 开源权重模型发布,进入 AA Agentic 榜单第 8 名 |
| xAI | Grok Build 开源,HN 热度 221 分 |
LMArena 总榜变化
Artificial Analysis 智能榜
本期无变动。Top 3:GPT-5.5 (54.8)、Claude Sonnet 5 (53.4)、GPT-5.6 Luna (51.2)
AA Agentic 变化
| 模型 | 变化 |
|---|---|
| Inkling | 新上榜第 8 名(32.3 分) |
| Nex-N2-Pro | 第 8 → 9 |
| Kimi K2.6 | 第 9 → 10 |
本期 Top 3:Claude Sonnet 5 (46.7)、GPT-5.6 Luna (45.6)、GPT-5.5 (44.9)
AA Coding 变化
| 模型 | 变化 |
|---|---|
| Inkling | 新上榜第 13 名(52.1 分) |
本期 Top 3:GPT-5.5 (74.9)、Claude Sonnet 5 (71.5)、GPT-5.6 Luna (71.4)
SWE-bench Verified 变化
Terminal-Bench 2.0 变化
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Fable 5 首日登顶 LMArena 总榜:作为新发布的模型直接超越所有现有模型拿到第一名,且 Top 5 被 Claude 系列包揽,显示 Anthropic 在通用对话能力上的领先优势。
GPT-Red 自动红队系统值得关注:通过自我博弈而非人工红队来发现 prompt 注入漏洞,这种规模化自动化安全测试方式可能是未来模型安全评估的方向。
Inkling 开源模型首秀进入 AA Agentic 榜单前十:新发布的开源权重模型在代理能力上超越 Nex-N2-Pro、Kimi K2.6 等闭源模型,显示开源社区在代理领域的追赶速度。