【OpenAI】GPT-5.6 发布,三档模型覆盖不同需求 OpenAI 发布 GPT-5.6 系列模型,包含旗舰 Sol、均衡 Terra 和低成本 Luna 三档。GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5,成本降低 25 倍。Sol Ultra 使用 64 个子代理在一小时内证明了 50 年未解的 Cycle Double Cover Conjecture 数学猜想。GPT-5.6 Sol 在 ARC-AGI-3 上达到 7.8%,为首个击败该基准的前沿模型。 原文链接
【OpenAI】ChatGPT Work 发布,Codex 整合进桌面应用 OpenAI 推出 ChatGPT Work,可跨应用和文件执行任务,支持长时间自主工作。Codex 应用与 ChatGPT 桌面应用合并,OpenAI 承认上线后存在默认设置引导用户使用高算力模式、桌面应用布局混乱等问题,将在当天和下周分批修复。 原文链接
【Anthropic】Claude Fable 5 恢复全球访问 美国商务部解除对 Claude Fable 5 和 Mythos 5 的出口管制,Anthropic 已开始恢复访问。新版 Fable 5 新增分类器以阻止更多网络安全任务,部分常规编程调试任务将回退至 Opus 4.8。 原文链接
【Google】AlphaEvolve 在 Google Cloud 正式发布 Google DeepMind 与 Google Cloud 联合推出 AlphaEvolve,这是一款 Gemini 驱动的进化代理,可自主设计和优化代码以解决复杂问题和算法瓶颈。 原文链接
【Apple】苹果起诉 OpenAI,指控前员工窃取商业机密 苹果对 OpenAI 提起诉讼,指控前员工窃取商业机密。案件细节尚未公开。 原文链接
SWE-Bench Verified:Claude 4.5 Opus medium 登顶 Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(79.2 分),Claude 4.5 Opus 从第 1 名降至第 2 名。
Terminal Bench 2.0:Claude Opus 4.7 上升一位 Claude Opus 4.7 从第 3 名升至第 2 名(80.2 分),Gemini 3.1 Pro 从第 2 名降至第 3 名。
7月10日
Apple 起诉 OpenAI,指控前员工窃取商业机密,该新闻在 Hacker News 获得较高关注。
GPT-5.6 Sol Ultra 证明了 50 年数学难题 Cycle Double Cover Conjecture,使用 64 个子智能体在约一小时内完成。
OpenAI 将 Bio Bug Bounty 升级为持续性私有项目,奖金翻倍至 5 万美元,邀请研究者寻找能突破前沿模型生物安全防护的通用越狱方法。
GPT-5.6 Luna 在健康智能领域表现突出,最高推理设置下超越 GPT-5.5,成本降低 25 倍。
产品负责人 Tibo 发布 ChatGPT Work 和 Codex 更新说明:承认发布存在问题,包括高计算设置默认值不明确、桌面应用改版后聊天和项目难以找到、对 Codex 用户传达不清等。当天已推送首批修复,下周将继续改进。
Sam Altman 表示 GPT-5.6 已成为 Microsoft 365 Copilot 首选模型。
7月9日
正式发布 GPT-5.6 系列,包含 Sol(旗舰)、Terra(均衡)、Luna(快速低成本)三个版本。Sol 在 ARC-AGI-2 达到 92.5% SOTA,ARC-AGI-3 达到 7.8%(首个在该基准击败游戏的验证前沿模型),成本比 GPT-5.5 Pro 低一个数量级。
ChatGPT Work 发布:可跨应用和文件执行任务的智能体,可持续数小时处理项目。
7月8日
发布 GPT-Live 语音模型,已用于 ChatGPT Voice。
发表 SWE-Bench Pro 评估问题分析,质疑该流行编程基准的可靠性。
OpenAI Academy 与 Walton Family Foundation 合作,为 K-12 教育者提供 AI 技能培训。
7月7日
MUFG 使用 ChatGPT Enterprise 构建 AI 原生组织。
Australian Payments Plus 使用 ChatGPT 和 Codex 加速支付业务。
7月10日
Claude Code v2.1.206 发布:/cd 命令新增目录路径建议功能。
7月9日
长期利益信托任命 Ben Bernanke 为新成员,Bernanke 为前美联储主席。
7月8日
Claude Code v2.1.205 发布:新增自动模式规则,阻止篡改会话记录文件。
与 AE Studio 合作研究发表:提出 GRAM 训练方法,将双重用途能力(如病毒学)放入可移除模块。
Claude Cowork 开始向网页和移动端推送,Chat 和 Cowork 共用一个主页标签。
7月7日
7月1日
Fable 5 恢复全球访问:与美国政府达成协议后重新部署,新增分类器阻止更多网络安全任务。常规编码和调试任务暂时回退到 Opus 4.8。正在与 Amazon、Microsoft、Google 等制定 AI 越狱严重性评估框架。
6月30日
发布 Claude Sonnet 5:最具代理能力的 Sonnet 版本,可自主规划和使用工具。
7月9日
AlphaEvolve 在 Google Cloud 正式上线:Gemini 驱动的进化智能体,自动设计和发现高度优化的代码。
7月7日
Gemini API 扩展 Managed Agents 功能:支持后台任务、远程 MCP 等。
7月6日
与 Apptronik 扩大研究合作,Apollo 2 人形机器人采集的真实数据将用于训练 Gemini Robotics。
Artificial Analysis Intelligence 榜单 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 |
| 4 | Gemini 3.5 Flash (high) | 50.2 |
| 5 | GPT-5.6 Sol (low) | 49.4 |
LMArena 榜单 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5 | 1508.5 |
| 2 | Claude Opus 4.6 (thinking) | 1503.6 |
| 3 | Claude Opus 4.7 (thinking) | 1502.0 |
| 4 | Claude Opus 4.6 | 1498.9 |
| 5 | Claude Opus 4.7 | 1494.0 |
本期变动:
Artificial Analysis Agentic 榜单 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 2 | GPT-5.6 Luna (max) | 45.6 |
| 3 | GPT-5.5 (xhigh) | 44.9 |
| 4 | GPT-5.6 Sol (low) | 40.0 |
| 5 | Gemini 3.5 Flash (high) | 37.4 |
Artificial Analysis Coding 榜单 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
| 3 | GPT-5.6 Luna (max) | 71.4 |
| 4 | Gemini 3.5 Flash (high) | 70.1 |
| 5 | GPT-5.6 Sol (low) | 69.7 |
SWE-bench Pro Public 榜单 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | GPT-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
| 4 | Claude Opus 4.6 (thinking)* | 51.9 |
| 5 | Gemini 3.1 Pro (thinking)* | 46.1 |
Terminal-Bench 2.0 榜单 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
| 4 | GPT-5.3-Codex (scaffold: SageAgent) | 78.4 |
| 5 | Claude Opus 4.6 (scaffold: Meta-Harness) | 76.4 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
How the terrorist group Boko Haram uses frontier AI:报告探讨恐怖组织如何利用前沿 AI 技术。
AI 2040: Plan A:关于 AI 未来发展的讨论文章。
GPT-5.6 Sol 证明 50 年数学难题 Cycle Double Cover Conjecture:这是继 AI 解决数学竞赛题、编程竞赛题之后,首次公开披露 AI 攻克长期悬而未决的数学猜想,标志着 AI 在需要深度推理和创造性证明的领域取得突破性进展。不过证明的正确性仍需数学界同行评议验证。
GPT-5.6 发布后 OpenAI 快速修复用户体验问题:产品负责人 Tibo 公开承认发布存在默认设置诱导高计算消耗、桌面应用改版让用户迷失、对 Codex 用户传达不清、多智能体工作流回退等问题,并在 24 小时内两次重置使用限制、修改默认值。这种快速响应和透明沟通值得肯定,但也反映出产品在复杂功能整合时对用户体验的测试不足。
Apple 起诉 OpenAI 涉嫌商业机密窃取:前员工跳槽引发的商业机密诉讼在科技行业并不罕见,但考虑到 Apple 自身 AI 战略的敏感性和 OpenAI 的行业地位,此案可能揭示人才竞争的激烈程度以及大公司在 AI 领域的专利和机密争夺态势。