← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-11

2026-07-11 08:34 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 发布,三档模型覆盖不同需求 OpenAI 发布 GPT-5.6 系列模型,包含旗舰 Sol、均衡 Terra 和低成本 Luna 三档。GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5,成本降低 25 倍。Sol Ultra 使用 64 个子代理在一小时内证明了 50 年未解的 Cycle Double Cover Conjecture 数学猜想。GPT-5.6 Sol 在 ARC-AGI-3 上达到 7.8%,为首个击败该基准的前沿模型。 原文链接

【OpenAI】ChatGPT Work 发布,Codex 整合进桌面应用 OpenAI 推出 ChatGPT Work,可跨应用和文件执行任务,支持长时间自主工作。Codex 应用与 ChatGPT 桌面应用合并,OpenAI 承认上线后存在默认设置引导用户使用高算力模式、桌面应用布局混乱等问题,将在当天和下周分批修复。 原文链接

【Anthropic】Claude Fable 5 恢复全球访问 美国商务部解除对 Claude Fable 5 和 Mythos 5 的出口管制,Anthropic 已开始恢复访问。新版 Fable 5 新增分类器以阻止更多网络安全任务,部分常规编程调试任务将回退至 Opus 4.8。 原文链接

【Google】AlphaEvolve 在 Google Cloud 正式发布 Google DeepMind 与 Google Cloud 联合推出 AlphaEvolve,这是一款 Gemini 驱动的进化代理,可自主设计和优化代码以解决复杂问题和算法瓶颈。 原文链接

【Apple】苹果起诉 OpenAI,指控前员工窃取商业机密 苹果对 OpenAI 提起诉讼,指控前员工窃取商业机密。案件细节尚未公开。 原文链接

重大 Benchmark 变化

SWE-Bench Verified:Claude 4.5 Opus medium 登顶 Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(79.2 分),Claude 4.5 Opus 从第 1 名降至第 2 名。

Terminal Bench 2.0:Claude Opus 4.7 上升一位 Claude Opus 4.7 从第 3 名升至第 2 名(80.2 分),Gemini 3.1 Pro 从第 2 名降至第 3 名。

快速预览

  • OpenAI 发布 GPT-5.6 系列,旗舰模型 Sol 在 ARC-AGI-3 创下 7.8% 新 SOTA
  • GPT-5.6 Sol Ultra 证明 50 年数学难题 Cycle Double Cover Conjecture
  • Apple 起诉 OpenAI,指控前员工窃取商业机密
  • OpenAI 快速迭代修复 GPT-5.6 发布后的用户体验问题
  • Anthropic 任命前美联储主席 Ben Bernanke 为长期利益信托新成员

OpenAI

7月10日

Apple 起诉 OpenAI,指控前员工窃取商业机密,该新闻在 Hacker News 获得较高关注。

GPT-5.6 Sol Ultra 证明了 50 年数学难题 Cycle Double Cover Conjecture,使用 64 个子智能体在约一小时内完成。

OpenAI 将 Bio Bug Bounty 升级为持续性私有项目,奖金翻倍至 5 万美元,邀请研究者寻找能突破前沿模型生物安全防护的通用越狱方法。

GPT-5.6 Luna 在健康智能领域表现突出,最高推理设置下超越 GPT-5.5,成本降低 25 倍。

产品负责人 Tibo 发布 ChatGPT Work 和 Codex 更新说明:承认发布存在问题,包括高计算设置默认值不明确、桌面应用改版后聊天和项目难以找到、对 Codex 用户传达不清等。当天已推送首批修复,下周将继续改进。

Sam Altman 表示 GPT-5.6 已成为 Microsoft 365 Copilot 首选模型

7月9日

正式发布 GPT-5.6 系列,包含 Sol(旗舰)、Terra(均衡)、Luna(快速低成本)三个版本。Sol 在 ARC-AGI-2 达到 92.5% SOTA,ARC-AGI-3 达到 7.8%(首个在该基准击败游戏的验证前沿模型),成本比 GPT-5.5 Pro 低一个数量级。

ChatGPT Work 发布:可跨应用和文件执行任务的智能体,可持续数小时处理项目。

GPT-5.5 Bio Bug Bounty 计划公布

7月8日

发布 GPT-Live 语音模型,已用于 ChatGPT Voice。

发表 SWE-Bench Pro 评估问题分析,质疑该流行编程基准的可靠性。

公布政府与国家安全合作原则

OpenAI Academy 与 Walton Family Foundation 合作,为 K-12 教育者提供 AI 技能培训。

7月7日

MUFG 使用 ChatGPT Enterprise 构建 AI 原生组织

Australian Payments Plus 使用 ChatGPT 和 Codex 加速支付业务


Anthropic

7月10日

Claude Code v2.1.206 发布/cd 命令新增目录路径建议功能。

7月9日

长期利益信托任命 Ben Bernanke 为新成员,Bernanke 为前美联储主席。

Claude 5-hour 和每周使用限制已重置

7月8日

Claude Code v2.1.205 发布:新增自动模式规则,阻止篡改会话记录文件。

与 AE Studio 合作研究发表:提出 GRAM 训练方法,将双重用途能力(如病毒学)放入可移除模块。

Claude Cowork 开始向网页和移动端推送,Chat 和 Cowork 共用一个主页标签。

7月7日

Fable 5 使用权限延长至 7 月 12 日

7月1日

Fable 5 恢复全球访问:与美国政府达成协议后重新部署,新增分类器阻止更多网络安全任务。常规编码和调试任务暂时回退到 Opus 4.8。正在与 Amazon、Microsoft、Google 等制定 AI 越狱严重性评估框架。

6月30日

发布 Claude Sonnet 5:最具代理能力的 Sonnet 版本,可自主规划和使用工具。


Google DeepMind

7月9日

AlphaEvolve 在 Google Cloud 正式上线:Gemini 驱动的进化智能体,自动设计和发现高度优化的代码。

7月7日

Gemini API 扩展 Managed Agents 功能:支持后台任务、远程 MCP 等。

7月6日

与 Apptronik 扩大研究合作,Apollo 2 人形机器人采集的真实数据将用于训练 Gemini Robotics。


Benchmark 快照

行业格局

Artificial Analysis Intelligence 榜单 Top 5:

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-5.6 Luna (max) 51.2
4 Gemini 3.5 Flash (high) 50.2
5 GPT-5.6 Sol (low) 49.4

LMArena 榜单 Top 5:

排名 模型 分数
1 Claude Fable 5 1508.5
2 Claude Opus 4.6 (thinking) 1503.6
3 Claude Opus 4.7 (thinking) 1502.0
4 Claude Opus 4.6 1498.9
5 Claude Opus 4.7 1494.0

干活选型

本期变动:

  • Artificial Analysis Coding: MiMo-V2.5 新上榜排名第 11(56.8 分)
  • Artificial Analysis Agentic: MiMo-V2.5 新上榜排名第 15(23.7 分)
  • SWE-bench Verified: Claude 4.5 Opus medium (20251101) 升至第 1,原第 1 Claude 4.5 Opus 降至第 2(同分 79.2)
  • Terminal-Bench 2.0: Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3

Artificial Analysis Agentic 榜单 Top 5:

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.6 Luna (max) 45.6
3 GPT-5.5 (xhigh) 44.9
4 GPT-5.6 Sol (low) 40.0
5 Gemini 3.5 Flash (high) 37.4

Artificial Analysis Coding 榜单 Top 5:

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 GPT-5.6 Luna (max) 71.4
4 Gemini 3.5 Flash (high) 70.1
5 GPT-5.6 Sol (low) 69.7

SWE-bench Pro Public 榜单 Top 5:

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 GPT-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0
4 Claude Opus 4.6 (thinking)* 51.9
5 Gemini 3.1 Pro (thinking)* 46.1

Terminal-Bench 2.0 榜单 Top 5:

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2
4 GPT-5.3-Codex (scaffold: SageAgent) 78.4
5 Claude Opus 4.6 (scaffold: Meta-Harness) 76.4

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


社区热点

How the terrorist group Boko Haram uses frontier AI:报告探讨恐怖组织如何利用前沿 AI 技术。

AI 2040: Plan A:关于 AI 未来发展的讨论文章。


点评

GPT-5.6 Sol 证明 50 年数学难题 Cycle Double Cover Conjecture:这是继 AI 解决数学竞赛题、编程竞赛题之后,首次公开披露 AI 攻克长期悬而未决的数学猜想,标志着 AI 在需要深度推理和创造性证明的领域取得突破性进展。不过证明的正确性仍需数学界同行评议验证。

GPT-5.6 发布后 OpenAI 快速修复用户体验问题:产品负责人 Tibo 公开承认发布存在默认设置诱导高计算消耗、桌面应用改版让用户迷失、对 Codex 用户传达不清、多智能体工作流回退等问题,并在 24 小时内两次重置使用限制、修改默认值。这种快速响应和透明沟通值得肯定,但也反映出产品在复杂功能整合时对用户体验的测试不足。

Apple 起诉 OpenAI 涉嫌商业机密窃取:前员工跳槽引发的商业机密诉讼在科技行业并不罕见,但考虑到 Apple 自身 AI 战略的敏感性和 OpenAI 的行业地位,此案可能揭示人才竞争的激烈程度以及大公司在 AI 领域的专利和机密争夺态势。

来源 · 97 条