← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-10

2026-07-10 08:36 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 发布:Sol、Terra、Luna 三版本 OpenAI 推出 GPT-5.6 系列模型,包含旗舰版 Sol、平衡版 Terra 和快速低成本版 Luna。据 Framer 测试,Sol 在其内部最难基准测试中首次达到 100%,Terra 以 0.6 倍成本达到 GPT-5.5 水平,Luna 运行速度是此前最快选项的 2 倍,成本仅 0.4 倍。OpenAI 表示 Sol 已自主完成后训练 Luna,展示了模型自我迭代能力。

【OpenAI】ChatGPT Work 上线:Codex 驱动的自主工作代理 ChatGPT Work 整合 Codex 与 GPT-5.6,可作为自主代理跨应用和文件执行任务,支持长时间项目跟踪。同时新桌面应用在全球推送,Work 和 Codex 对所有计划(含免费用户)开放,Sites 功能进入 Beta。

【Anthropic】Ben Bernanke 加入长期受益信托 前美联储主席 Ben Bernanke 被任命为 Anthropic 长期受益信托新成员,该机构负责监督公司 AI 发展符合长期公益目标。Bernanke 的宏观经济与政策经验将为治理框架提供专业视角。

【Google】AlphaEvolve 在 Google Cloud 正式上线 DeepMind 与 Google Cloud 联合推出 AlphaEvolve,基于 Gemini 的进化代理可自动设计优化代码,解决算法瓶颈问题,面向企业客户提供。

【Anthropic】双用途能力模块化移除研究 Anthropic 与 AE Studio 合作发布 GRAM 训练方法,可将病毒学等既可用于疫苗研发也可用于生物武器的"双用途"能力封装进可移除模块,为安全部署提供新路径。


重大 Benchmark 变化

AA Agentic 基准:GPT-5.6 Luna (max) 新上榜第 2 名(45.6 分),GPT-5.6 Sol (low) 第 4 名(40.0 分),Terra 第 6 名(37.0 分)。 原 GPT-5.5 (xhigh) 从第 2 跌至第 3,Gemini 3.5 Flash (high) 从第 3 跌至第 5。

AA Coding 基准:GPT-5.6 Luna (max) 新上榜第 3 名(71.4 分),Sol 第 5 名(69.7 分),Terra 第 6 名(64.7 分)。 Gemini 3.5 Flash (high) 从第 3 跌至第 4,Kimi K2.6 从第 4 跌至第 7。

AA Intelligence 基准:GPT-5.6 Luna (max) 新上榜第 3 名(51.2 分),Sol 第 5 名(49.4 分),Terra 第 6 名(45.6 分)。 Gemini 3.5 Flash (high) 从第 3 跌至第 4,MiniMax-M3 从第 5 跌至第 8。

SWE-Bench Pro Public:Muse Spark 1.1 新上榜第 1 名(61.5 分),超越原冠军 GPT-5.4 (xHigh) 的 59.1 分。 GPT-5.4 (xHigh) 跌至第 2。

快速预览

  • OpenAI 发布 GPT-5.6 系列,推出 Sol/Terra/Luna 三档模型及 ChatGPT Work 代理
  • Anthropic 任命前美联储主席 Bernanke 加入长期利益信托,Claude Fable 5 恢复访问
  • Google DeepMind AlphaEvolve 在 Google Cloud 正式上线,Gemini API 扩展托管代理功能
  • SWE-bench Pro 公开榜出现新冠军 Muse Spark 1.1,以 61.5 分超越 gpt-5.4
  • OpenAI 应用 CEO Fidji Simo 因健康原因离职,转任兼职顾问

OpenAI

产品发布

生态动态

  • 新版 ChatGPT 桌面应用全球上线,Work 和 Codex 面向所有计划开放,Sites 功能对 Pro/Plus 用户开放测试。
  • OpenAI Build Week 将于 7 月 13 日启动,鼓励开发者用 Codex 构建创意项目。
  • Sam Altman 表示企业对 AI 成本的担忧已被听到,GPT-5.6 在「每任务成本」上有显著进步。

其他


Anthropic

产品更新

  • Claude Fable 5 已在全球恢复访问,付费用户使用期限延长至 7 月 12 日,5 小时/每周用量限制已重置。
  • Claude Cowork 开始向网页和移动端推送,Chat 与 Cowork 合并为单一主页标签。
  • Claude Code 发布多个版本更新,新增会话转录文件篡改防护、登录即将过期提醒、动态工作流规模设置等功能。
  • Claude Code 发布制作历程回顾页面。

公司治理


Google

产品更新


基准测试

行业格局

Intelligence 榜(AA)

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-5.6 Luna (max) 51.2 🆕
4 Gemini 3.5 Flash (high) 50.2
5 GPT-5.6 Sol (low) 49.4 🆕

变化:GPT-5.6 Luna/Terra/Sol 新上榜,分列第 3/6/5 名;Gemini 3.5 Flash (high) 从第 3 跌至第 4。

LMArena 总榜

排名 模型 分数
1 claude-fable-5 1508.5
2 claude-opus-4-6-thinking 1503.6
3 claude-opus-4-7-thinking 1502.0

本期无变动。

干活选型

Agentic 榜(AA)

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.6 Luna (max) 45.6 🆕
3 GPT-5.5 (xhigh) 44.9 ↓
4 GPT-5.6 Sol (low) 40.0 🆕
5 Gemini 3.5 Flash (high) 37.4 ↓

变化:GPT-5.6 Luna/Sol/Terra 新上榜;GPT-5.5 从第 2 跌至第 3,Gemini 3.5 Flash 从第 3 跌至第 5。

Coding 榜(AA)

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 GPT-5.6 Luna (max) 71.4 🆕
4 Gemini 3.5 Flash (high) 70.1
5 GPT-5.6 Sol (low) 69.7 🆕

变化:GPT-5.6 Luna/Sol/Terra 新上榜;Gemini 3.5 Flash 从第 3 跌至第 4。

SWE-bench Pro 公开榜

排名 模型 分数
1 Muse Spark 1.1* 61.5 🆕
2 gpt-5.4 (xHigh)* 59.1 ↓
3 Muse Spark* 55.0 ↓

变化:Muse Spark 1.1 新上榜即夺冠;gpt-5.4 从第 1 跌至第 2。

SWE-bench Verified

排名 模型 分数
1 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2 ↑
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2 ↓
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

变化:Claude 4.5 Opus medium 与 Claude 4.5 Opus 交换第 1/2 名。

Terminal-Bench 2.0

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2 ↑
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2 ↓

变化:Claude Opus 4.7 与 Gemini 3.1 Pro 交换第 2/3 名。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

GPT-5.6 系列发布: Sol 已能自主完成 Luna 的后训练,这比单纯榜单分数更能体现模型在科研流程中的实际生产力,但 Sol 在 AA Coding 榜仅列第 5(69.7 分),落后于 GPT-5.5(74.9 分)和 Claude Sonnet 5(71.5 分),说明「最强」需区分场景。

ChatGPT Work 与 Claude Cowork 的代理竞争: 两者都在整合聊天与执行能力,但命名高度相似(Work vs Cowork、Codex vs Code),已让开发者感到困惑。产品差异化将决定谁能真正占领用户心智。

SWE-bench Pro 公开榜格局变化: Muse Spark 1.1 以 61.5 分超越 gpt-5.4(59.1 分)登顶,是近几个月来首次有非 GPT 模型在该基准夺冠,值得关注其技术细节是否公开。

来源 · 89 条