【OpenAI】GPT-5.6 发布,性能与成本双突破 OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra、Luna 等型号。GPT-5.6 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍;Sol Ultra 使用 64 个子代理在一小时内证明 50 年未解的 Cycle Double Cover Conjecture 数学难题。该模型现已成为 Microsoft 365 Copilot 首选模型。[GPT-5.6: Frontier intelligence that scales with your ambition]
【OpenAI】ChatGPT Work 与 GPT-Live 语音模型上线 ChatGPT Work 作为可跨应用和文件执行任务的智能代理正式推出,可持续数小时跟进项目。GPT-Live 新一代语音模型已向全球用户推送,支持多任务并行对话,Sam Altman 称其已跨越语音交互阈值。[ChatGPT is now a partner for your most ambitious work] [Introducing GPT-Live]
【Anthropic】Claude for Teachers 免费面向美国 K-12 教师 Anthropic 推出 Claude for Teachers,为美国验证身份的 K-12 教师免费提供 Claude 高级功能,配套教学技能库及对接全美 50 州学术标准的课程资源。同时承诺向加拿大 AI 研究机构投入 1000 万加元。[Claude for Teachers]
【Google】NotebookLM 更名为 Gemini Notebook NotebookLM 正式更名为 Gemini Notebook,反映其在 Google AI 产品矩阵中的定位。该产品 3 年内已服务超过 3000 万用户和 60 万组织,未来将整合至 Gemini App 和 Google Search。Google 同步更新 Weather Lab,开放 AI 气象模型交互网站。[NotebookLM becomes Gemini Notebook]
【Anthropic】Claude Code 持续迭代,新增 /fork 会话分支功能
Claude Code v2.1.212 引入 /fork 命令,可将当前对话复制到后台会话继续运行;v2.1.214 修复 dir/** 权限规则的安全漏洞。Claude Code artifacts 现已支持调用 MCP 连接器构建交互式仪表盘。[Claude Code v2.1.212 released]
SWE-Bench Verified 排名变动
排名变动均为 1 位,未达到 5 位变动阈值,无其他重大变化报告。
/fork 命令现可复制对话到独立后台会话| 日期 | 新闻 |
|---|---|
| 07-17 | CFO Sarah Friar 发布 AI 记分卡,提出用有用功、成功任务成本、可靠性、算力回报四项指标衡量 AI 投资回报 |
| 07-16 | OpenAI 分享青少年安全 AI 措施,包括年龄适当保护、学习工具和家长控制 |
| 07-16 | Cars24 案例:使用 OpenAI 语音和聊天代理处理月均 100 万+对话分钟,挽回 12% 流失线索 |
| 07-15 | 发布 GPT-Red 自动红队测试系统,通过自我博弈提升 AI 安全性和对抗鲁棒性 |
| 07-15 | 提出AI 治理的「反向联邦主义」路径,主张州法律助力构建国家框架 |
| 07-14 | 发布企业 AI 投资管理指南,强调衡量每美元有用功 |
| 07-10 | Deutsche Telekom 案例:转型 AI 原生运营商,改造客服、员工工作流和网络运维 |
| 07-09 | 发布 GPT-5.6 系列模型,Luna 在健康智能领域表现突出,成本降至 GPT-5.5 最高推理设置的 1/25 |
| 07-09 | 推出 ChatGPT Work,可跨应用和文件执行任务,持续数小时完成项目 |
| 07-09 | GPT-5.6 成 为 Microsoft 365 Copilot 首选模型,增强 Word、Excel、PowerPoint 等 |
| 07-09 | 生物安全漏洞赏金计划升级为长期项目,奖励翻倍至 5 万美元 |
| 07-08 | 发布 GPT-Live 语音模型,现已全量推送至全球 ChatGPT 用户 |
| 07-08 | 发布 SWE-Bench Pro 评估分析,指出该编码基准存在可靠性问题 |
产品动态
数学突破
07-10,OpenAI 宣布 GPT-5.6 Sol Ultra 成功证明 50 年未解的 Cycle Double Cover 猜想,使用 64 个子代理在约 1 小时内完成。后续社区反馈显示 GPT-5.6 还用单个 prompt 解决了凸优化领域 30 年的空白问题。
| 日期 | 新闻 |
|---|---|
| 07-14 | 推出 Claude for Teachers,为美国 K-12 认证教师免费提供高级功能,包含教学技能库和课程标准对照 |
| 07-14 | 承诺 1000 万加元资助加拿大 AI 研究 |
| 07-09 | Long-Term Benefit Trust 任命前美联储主席 Ben Bernanke 为新成员 |
| 07-08 | 发布与 AE Studio 合作的 GRAM 研究成果,可将双重用途能力(如病毒学)封装为可移除模块 |
Claude Code 更新
dir/** 允许规则错误授权写入嵌套目录的安全问题/fork 现将对话复制到独立后台会话,原有子代理功能更名为 /subtask--forward-subagent-text 标志,可在 stream-json 输出中包含子代理文本| 日期 | 新闻 |
|---|---|
| 07-16 | Search 新增更多第三方应用连接,扩展搜索能力边界 |
| 07-16 | Google Vids 推出 Gemini Omni 和 Personal Avatars 功能,支持视频创作与数字人出镜 |
| 07-14 | Google Images 迎来 25 周年,回顾视觉搜索演进历程 |
| 07-07 | Gemini API 扩展 Managed Agents,支持后台任务、远程 MCP 和定时触发器 |
NotebookLM 更名
NotebookLM 正式更名为 Gemini Notebook,用户规模达 3000 万+、60 万组织。Demis Hassabis 表示该产品三年前始于帮助用户加速学习的实验,现已集成至 Gemini App 并将登陆 Google Search。
DeepMind 动态
Artificial Analysis 综合能力榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 |
LMArena 榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.5 |
| 2 | claude-opus-4-6-thinking | 1503.8 |
| 3 | claude-opus-4-7-thinking | 1502.3 |
本期无变动。
Agentic 能力榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 2 | GPT-5.6 Luna (max) | 45.6 |
| 3 | GPT-5.5 (xhigh) | 44.9 |
本期无变动。
编码能力榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
| 3 | GPT-5.6 Luna (max) | 71.4 |
本期无变动。
SWE-bench Verified
| 排名 | 模型(脚手架) | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
变化:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换排名,medium 版本升至第 1。
Terminal-Bench 2.0
| 排名 | 模型(脚手架) | 分数 |
|---|---|---|
| 1 | GPT-5.5 (NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (TongAgents) | 80.2 |
变化:Claude Opus 4.7 与 Gemini 3.1 Pro 交换排名,Claude 升至第 2。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-5.6 Sol Ultra 在数学证明上的突破(CDC 猜想、凸优化空白)标志着前沿模型已具备跨领域深度推理能力,这远超传统代码生成的价值。OpenAI CFO 提出的 ROI 记分卡将「有用功」和「成功任务成本」置于核心,直接回应了企业对 AI 投入产出不透明的痛点。Claude 4.5 Opus medium 在 SWE-bench Verified 登顶说明模型效率优化已能匹敌更大参数版本,成本敏感的企业选型时可优先考虑。