【OpenAI】GPT-5.6 发布:Sol、Terra、Luna 三版本 OpenAI 推出 GPT-5.6 系列模型,包含旗舰版 Sol、平衡版 Terra 和快速低成本版 Luna。据 Framer 测试,Sol 在其内部最难基准测试中首次达到 100%,Terra 以 0.6 倍成本达到 GPT-5.5 水平,Luna 运行速度是此前最快选项的 2 倍,成本仅 0.4 倍。OpenAI 表示 Sol 已自主完成后训练 Luna,展示了模型自我迭代能力。
【OpenAI】ChatGPT Work 上线:Codex 驱动的自主工作代理 ChatGPT Work 整合 Codex 与 GPT-5.6,可作为自主代理跨应用和文件执行任务,支持长时间项目跟踪。同时新桌面应用在全球推送,Work 和 Codex 对所有计划(含免费用户)开放,Sites 功能进入 Beta。
【Anthropic】Ben Bernanke 加入长期受益信托 前美联储主席 Ben Bernanke 被任命为 Anthropic 长期受益信托新成员,该机构负责监督公司 AI 发展符合长期公益目标。Bernanke 的宏观经济与政策经验将为治理框架提供专业视角。
【Google】AlphaEvolve 在 Google Cloud 正式上线 DeepMind 与 Google Cloud 联合推出 AlphaEvolve,基于 Gemini 的进化代理可自动设计优化代码,解决算法瓶颈问题,面向企业客户提供。
【Anthropic】双用途能力模块化移除研究 Anthropic 与 AE Studio 合作发布 GRAM 训练方法,可将病毒学等既可用于疫苗研发也可用于生物武器的"双用途"能力封装进可移除模块,为安全部署提供新路径。
AA Agentic 基准:GPT-5.6 Luna (max) 新上榜第 2 名(45.6 分),GPT-5.6 Sol (low) 第 4 名(40.0 分),Terra 第 6 名(37.0 分)。 原 GPT-5.5 (xhigh) 从第 2 跌至第 3,Gemini 3.5 Flash (high) 从第 3 跌至第 5。
AA Coding 基准:GPT-5.6 Luna (max) 新上榜第 3 名(71.4 分),Sol 第 5 名(69.7 分),Terra 第 6 名(64.7 分)。 Gemini 3.5 Flash (high) 从第 3 跌至第 4,Kimi K2.6 从第 4 跌至第 7。
AA Intelligence 基准:GPT-5.6 Luna (max) 新上榜第 3 名(51.2 分),Sol 第 5 名(49.4 分),Terra 第 6 名(45.6 分)。 Gemini 3.5 Flash (high) 从第 3 跌至第 4,MiniMax-M3 从第 5 跌至第 8。
SWE-Bench Pro Public:Muse Spark 1.1 新上榜第 1 名(61.5 分),超越原冠军 GPT-5.4 (xHigh) 的 59.1 分。 GPT-5.4 (xHigh) 跌至第 2。
产品发布
生态动态
其他
产品更新
公司治理
产品更新
Intelligence 榜(AA)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 🆕 |
| 4 | Gemini 3.5 Flash (high) | 50.2 |
| 5 | GPT-5.6 Sol (low) | 49.4 🆕 |
变化:GPT-5.6 Luna/Terra/Sol 新上榜,分列第 3/6/5 名;Gemini 3.5 Flash (high) 从第 3 跌至第 4。
LMArena 总榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1508.5 |
| 2 | claude-opus-4-6-thinking | 1503.6 |
| 3 | claude-opus-4-7-thinking | 1502.0 |
本期无变动。
Agentic 榜(AA)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 2 | GPT-5.6 Luna (max) | 45.6 🆕 |
| 3 | GPT-5.5 (xhigh) | 44.9 ↓ |
| 4 | GPT-5.6 Sol (low) | 40.0 🆕 |
| 5 | Gemini 3.5 Flash (high) | 37.4 ↓ |
变化:GPT-5.6 Luna/Sol/Terra 新上榜;GPT-5.5 从第 2 跌至第 3,Gemini 3.5 Flash 从第 3 跌至第 5。
Coding 榜(AA)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
| 3 | GPT-5.6 Luna (max) | 71.4 🆕 |
| 4 | Gemini 3.5 Flash (high) | 70.1 |
| 5 | GPT-5.6 Sol (low) | 69.7 🆕 |
变化:GPT-5.6 Luna/Sol/Terra 新上榜;Gemini 3.5 Flash 从第 3 跌至第 4。
SWE-bench Pro 公开榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 🆕 |
| 2 | gpt-5.4 (xHigh)* | 59.1 ↓ |
| 3 | Muse Spark* | 55.0 ↓ |
变化:Muse Spark 1.1 新上榜即夺冠;gpt-5.4 从第 1 跌至第 2。
SWE-bench Verified
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 ↑ |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 ↓ |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
变化:Claude 4.5 Opus medium 与 Claude 4.5 Opus 交换第 1/2 名。
Terminal-Bench 2.0
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 ↑ |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 ↓ |
变化:Claude Opus 4.7 与 Gemini 3.1 Pro 交换第 2/3 名。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-5.6 系列发布: Sol 已能自主完成 Luna 的后训练,这比单纯榜单分数更能体现模型在科研流程中的实际生产力,但 Sol 在 AA Coding 榜仅列第 5(69.7 分),落后于 GPT-5.5(74.9 分)和 Claude Sonnet 5(71.5 分),说明「最强」需区分场景。
ChatGPT Work 与 Claude Cowork 的代理竞争: 两者都在整合聊天与执行能力,但命名高度相似(Work vs Cowork、Codex vs Code),已让开发者感到困惑。产品差异化将决定谁能真正占领用户心智。
SWE-bench Pro 公开榜格局变化: Muse Spark 1.1 以 61.5 分超越 gpt-5.4(59.1 分)登顶,是近几个月来首次有非 GPT 模型在该基准夺冠,值得关注其技术细节是否公开。