【OpenAI】GPT-5.6 发布,Luna 成本降低 25 倍
GPT-5.6 模型系列正式发布,包含 Sol、Terra、Luna 等版本。GPT-5.6 Luna 在超越 GPT-5.5 最高推理设置性能的同时,成本降低 25 倍;Sol Ultra 成功证明 50 年未解的 Cycle Double Cover 猜想(使用 64 个子智能体,耗时约 1 小时)。GPT-5.6 现已集成至 Microsoft 365 Copilot、Figma Make、JetBrains IDE 等产品。
【OpenAI】ChatGPT Work 上线,Codex 整合
ChatGPT Work 是新的智能体功能,可跨应用和文件执行任务,持续处理项目数小时。Codex 现已整合进 ChatGPT。发布后 3 天内,Codex 和 ChatGPT Work 活跃用户达 700 万。OpenAI 承认发布存在多项问题(默认高计算设置不清晰、桌面应用改版混乱、多智能体工作流回归),已发布多次修复。
【OpenAI】GPT-Live 语音模型上线,Bio Bug Bounty 奖金翻倍
GPT-Live 新一代语音模型现已向全球所有 ChatGPT 用户推送,本周末语音使用限额翻倍。Bio Bug Bounty 演变为持续性私有项目,奖金从 25K 美元翻倍至 50K 美元,邀请研究人员测试前沿模型的生物安全防护。
【Anthropic】Ben Bernanke 加入长期受益信托
前美联储主席 Ben Bernanke 被任命为 Anthropic 长期受益信托最新成员。该信托负责监督 Anthropic 向公共利益方向发展。
【Google DeepMind】AlphaEvolve 正式上线 Google Cloud
AlphaEvolve 是由 Gemini 驱动的进化智能体,可自主设计和发现高度优化的代码,用于解决复杂问题和算法瓶颈。
无符合条件(排名变动≥5 或分数变动≥5%)的重大变化。SWE-Bench Verified 和 Terminal Bench 2 排名变动均为 1-2 位,分数无变化。
GPT-5.6 发布与数学突破。 7 月 9 日,OpenAI 发布 GPT-5.6: Frontier intelligence that scales with your ambition,包含 Sol、Terra、Luna 三个版本。GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5,成本仅为其 1/25。次日,GPT-5.6 Sol Ultra 在约 1 小时内使用 64 个子代理证明了困扰数学界 50 年的 Cycle Double Cover 猜想,并已解决多个 Erdős 问题。
ChatGPT Work 与 Codex 整合。 7 月 9 日推出 ChatGPT Work,可在应用和文件间执行任务、长时间跟进项目。7 月 13 日活跃用户达 700 万。因用户反馈默认设置过于消耗算力、桌面应用改版混乱等问题,团队在 24 小时内修复并承诺下周进一步改进。
其他动态。 GPT-Live 语音模型 7 月 11 日向全球用户开放,周末语音使用额度翻倍。Bio Bug Bounty 演变为常驻私有项目,奖金翻倍至 $50K。ChatGPT 在 EEA 地区 WhatsApp、韩国 Kakao、部分市场 Viber 上恢复可用。
Claude Code 更新。 v2.1.207 版本中 Auto 模式在 Bedrock、Vertex AI、Foundry 上无需 opt-in 即可使用。桌面版新增内置浏览器,Claude 可读取、点击、交互任意网页。v2.1.205 加入规则禁止篡改会话转录文件。
组织与产品。 Long-Term Benefit Trust 任命前美联储主席 Ben Bernanke 为新成员。与 AE Studio 合作研究双用途能力的可移除模块训练方法 GRAM。Claude Cowork 开始向网页和移动端推送,Chat 与 Cowork 共用一个主页签。
AlphaEvolve 上线。 AlphaEvolve 正式登陆 Google Cloud,为 Gemini 驱动的进化代理,可自主设计优化代码解决算法瓶颈。
研究与合作。 发表关于技术收益归属的新论文,论证 AI 等技术进步的收益应属于全世界。与 Apptronik 合作,Apollo 2 人形机器人数据将用于训练 Gemini Robotics。
| 公司 | 动态 |
|---|---|
| Deutsche Telekom | 与 OpenAI 合作转型 AI 原生电信运营商,改造客服、员工工作流、网络运维 |
| MUFG | 使用 ChatGPT Enterprise 构建 AI 原生组织 |
| NVIDIA | 团队使用 ChatGPT Work 自动化工作流,GPT-5.6 在 GB200/GB300 上训练运行 |
| Perplexity | GPT-5.6 家族接入 Agent API,xHigh/High/Medium 预设更准更快更便宜 |
| Figma Make | 集成 GPT-5.6 |
| JetBrains | GPT-5.6 登陆 IDE、Junie、Air |
| Samsung Health | 用户退出 AI 训练将面临数据删除威胁 引发热议 |
本期无变动。
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 |
SWE-bench Verified: Claude 4.5 Opus medium (20251101) 升至第 1,Claude 4.5 Opus 降至第 2(同分 79.2)。
Terminal-Bench 2.0: Claude Opus 4.7 升至第 2,Gemini 3.1 Pro 降至第 3(同分 80.2)。
| 榜单 | Top 3 |
|---|---|
| Agentic | Claude Sonnet 5 (46.7) · GPT-5.6 Luna (45.6) · GPT-5.5 (44.9) |
| Coding | GPT-5.5 (74.9) · Claude Sonnet 5 (71.5) · GPT-5.6 Luna (71.4) |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
点评: GPT-5.6 Sol Ultra 在约 1 小时内以 64 个子代理证明 50 年未解的数学猜想,展示了前沿模型在深度推理上的突破;但 OpenAI 在发布次日即因默认算力设置、桌面改版等问题道歉并紧急修复,说明产品化节奏与模型能力之间存在落差。