← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-12

2026-07-12 08:50 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 正式发布,成为 Microsoft 365 Copilot 首选模型 OpenAI 发布 GPT-5.6 模型家族,包含 Sol、Terra、Luna 等版本,在健康智能、编程等领域显著提升性能。GPT-5.6 Luna 以最低推理成本超越 GPT-5.5 最高推理设置的性能,成本降低 25 倍。Microsoft 365 Copilot 已将 GPT-5.6 设为首选模型,覆盖 Word、Excel、PowerPoint 等产品。GPT-5.6 Sol Ultra 成功证明 50 年未解的 Cycle Double Cover Conjecture 数学猜想,使用 64 个子代理在一小时内完成。 GPT-5.6: Frontier intelligence that scales with your ambition

【OpenAI】ChatGPT Work 发布,集成 Codex 实现跨应用自主执行 ChatGPT Work 是新的代理功能,可跨应用和文件执行任务,可持续数小时跟踪项目进度,将目标转化为完成的工作。Codex 应用已与 ChatGPT 桌面应用合并,OpenAI 承诺 Codex 将长期存在。发布后用户反馈混淆了 Work 与 Codex 的定位,OpenAI 已快速调整默认设置并优化桌面应用界面,承诺下周进行更大规模改进。 ChatGPT is now a partner for your most ambitious work

【OpenAI】GPT-Live 全面上线,语音模型替代 Atlas 浏览器 GPT-Live 是新一代语音模型,现已面向全球所有 ChatGPT 用户推出,周末期间语音使用限制翻倍。该模型取代了 Atlas 浏览器功能,ChatGPT 应用内嵌浏览器提供更自然的交互体验。部分用户担忧浏览器集成带来的安全隐私问题,倾向于 AI 使用独立浏览器环境。 Introducing GPT-Live

【Anthropic】Ben Bernanke 加入长期利益信托,Claude Fable 5 恢复全球访问 前美联储主席 Ben Bernanke 被任命为 Anthropic 长期利益信托新成员,负责监督公司使命执行。Claude Fable 5 和 Mythos 5 出口管制已解除,全球恢复访问,模型新增分类器以阻止更多网络安全任务滥用,日常编码和调试任务暂时回退至 Opus 4.8。Anthropic 与 Amazon、Microsoft、Google 等合作起草 AI 越狱评估共识框架。 Claude Fable 5 将恢复全球访问

【Google DeepMind】AlphaEvolve 正式上线 Google Cloud AlphaEvolve 是 Gemini 驱动的进化代理,可自主设计和发现高度优化的代码,解决算法瓶颈问题。现已正式上线 Google Cloud,面向企业用户开放。Google 同时扩展 Gemini API 的托管代理功能,支持后台任务和远程 MCP。 AlphaEvolve is now GA on Google Cloud

重大 Benchmark 变化

LM Arena 总榜

  • GPT-5.6-Sol-xhigh 新增上榜,排名第 8,得分 1486.31
  • Gemini-3.5-flash-high 新增上榜,排名第 14,得分 1476.43
  • Gemini-3.5-flash-medium 新增上榜,排名第 15,得分 1476.30
  • Muse-Spark-1.1 新增上榜,排名第 6,得分 1489.53(超越 Muse-Spark)
  • Claude-Opus-4-8 排名下降 5 位(13→18),得分下降 1.61 点
  • GLM-5.2 (max) 排名下降 7 位(26→33),得分下降 3.16 点(降幅 0.21%,未达阈值)
  • GPT-5.4 排名下降 6 位(28→34),得分下降 1.75 点

SWE-Bench Verified

  • Claude 4.5 Opus medium (20251101) 超越 Claude 4.5 Opus,升至第 1 名

Terminal Bench 2.0

  • Claude Opus 4.7 超越 Gemini 3.1 Pro,升至第 2 名

快速预览

  • OpenAI 发布 GPT-5.6 模型家族,Sol Ultra 证明 50 年数学猜想,Luna 性价比达 GPT-5.5 的 25 倍
  • ChatGPT Work 上线,整合 Codex 成为跨应用、可持续数小时的 Agent 工作空间
  • Anthropic 任命前美联储主席 Ben Bernanke 加入长期受益信托,并与 AE Studio 合作推出 GRAM 双用途能力移除技术
  • GPT-Live 语音模型全量上线,Claude Code 桌面版新增内置浏览器
  • Google AlphaEvolve 正式商用,Gemini API 扩展 Managed Agents 支持后台任务与远程 MCP

新闻

OpenAI

时间 标题 要点
07-11 GPT-Live 全量上线 所有 ChatGPT 用户已可用,周末语音额度翻倍
07-10 GPT-5.6 Sol Ultra 证明 50 年数学猜想 Cycle Double Cover Conjecture 用 64 个子 Agent 在约 1 小时内完成证明
07-10 Bio Bug Bounty 升级为长期项目 奖金翻倍至 50K 美元,邀请研究人员挑战前沿模型生物安全防线
07-10 ChatGPT Work 与 Codex 发布后快速修复 重置额度、调整默认设置、澄清 Codex 定位,下周继续改进
07-09 GPT-5.6 正式发布 Sol、Terra、Luna 三档,性能/成本双重优化,Luna 低成本档位表现亮眼
07-09 GPT-5.6 成为 Microsoft 365 Copilot 首选模型 Word/Excel/PPT/Chat/Cowork 全面集成
07-09 ChatGPT Work 上线 可跨应用操作、持续数小时跟进项目,整合 Codex
07-08 GPT-Live 发布 新一代语音模型,现已用于 ChatGPT Voice
07-08 SWE-Bench Pro 可靠性分析 指出该基准存在噪声问题,影响模型评估准确性
07-08 政府与国家安全合作原则 公布责任 AI 使用、民主问责与公共安全三大原则
07-07 MUFG 与 Australian Payments Plus 客户案例 三菱 UFJ 与澳洲支付公司用 ChatGPT Enterprise 构建 AI 原生组织
07-10 Deutsche Telekom AI 原生转型 客服、员工流程、网络运营全面 AI 化

Sam Altman 07-11 表示 AI 目前净创造就业,超出其预期。

Anthropic

时间 标题 要点
07-09 Ben Bernanke 加入长期受益信托 前美联储主席任新成员
07-08 GRAM 双用途能力移除技术 与 AE Studio 合作,可将病毒学等双用途能力模块化移除
07-07 Claude Cowork 整合 Chat 与 Cowork Web 与桌面端合并为单一主页签

Claude Code 桌面版新增内置浏览器(07-10),可拉取文档、设计稿并交互。Mike Krieger 07-02 表示 Artifacts 已向 Pro/Max 计划开放。

Google

时间 标题 要点
07-09 AlphaEvolve 正式商用 Gemini 驱动的进化型 Agent,自动优化算法瓶颈
07-07 Gemini API Managed Agents 扩展 支持后台任务、远程 MCP 等
07-10 AI Studio 部署应用支持自定义 URL 免费 apps 可获得 your-own-url.ai.studio 域名

DeepMind 07-08 发布技术收益分配论文,主张 AI 收益应让全球共享。

Claude Code 更新

版本 时间 变化
v2.1.207 07-11 Auto Mode 在 Bedrock/Vertex/Foundry 无需 opt-in 即可使用
v2.1.206 07-10 /cd 增加路径建议
v2.1.205 07-08 Auto Mode 规则禁止篡改会话转录文件

行业动态


行业格局

LMArena 变化

  • muse-spark-1.1 新上榜,排名第 6,分数 1489.5
  • gpt-5.6-sol-xhigh 新上榜,排名第 8,分数 1486.3
  • gemini-3.5-flash-high 新上榜,排名第 14,分数 1476.4
  • gemini-3.5-flash-medium 新上榜,排名第 15,分数 1476.3
  • claude-sonnet-5-high 新上榜,排名第 36,分数 1462.6
  • grok-4.5 新上榜,排名第 29,分数 1468.8
  • glm-5v-turbo 新上榜,排名第 66,分数 1440.1
  • claude-opus-4-8-thinking 排名下降 9→11,分数降至 1482.1
  • gpt-5.4 排名下降 28→34,分数降至 1465.5
  • glm-5.2 (max) 排名下降 26→33,分数降至 1465.5

当前 Top 5(LMArena overall)

  1. claude-fable-5:1508.6
  2. claude-opus-4-6-thinking:1503.7
  3. claude-opus-4-7-thinking:1502.8
  4. claude-opus-4-6:1498.2
  5. claude-opus-4-7:1494.2

Artificial Analysis Intelligence 变化:本期无变动

当前 Top 3(AA Intelligence)

  1. GPT-5.5 (xhigh):54.8
  2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort):53.4
  3. GPT-5.6 Luna (max):51.2

干活选型

SWE-bench Verified 变化

  • Claude 4.5 Opus medium (20251101) 排名上升 2→1
  • Claude 4.5 Opus 排名下降 1→2
  • GPT-5-2 Codex 排名上升 18→16

当前 Top 3(SWE-bench Verified)

  1. Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent):79.2
  2. Claude 4.5 Opus (scaffold: Sonar Foundation Agent):79.2
  3. Doubao-Seed-Code (scaffold: TRAE):78.8

Terminal Bench 2.0 变化

  • Claude Opus 4.7 排名上升 3→2
  • Gemini 3.1 Pro 排名下降 2→3

当前 Top 3(Terminal Bench 2.0)

  1. GPT-5.5 (scaffold: NexAU-AHE):84.7
  2. Claude Opus 4.7 (scaffold: WOZCODE):80.2
  3. Gemini 3.1 Pro (scaffold: TongAgents):80.2

AA Agentic / Coding 变化:本期无变动

当前 Top 3(AA Agentic)

  1. Claude Sonnet 5 (Adaptive Reasoning, Max Effort):46.7
  2. GPT-5.6 Luna (max):45.6
  3. GPT-5.5 (xhigh):44.9

当前 Top 3(AA Coding)

  1. GPT-5.5 (xhigh):74.9
  2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort):71.5
  3. GPT-5.6 Luna (max):71.4

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评:GPT-5.6 Sol Ultra 用 64 个子 Agent 在约 1 小时内证明 Cycle Double Cover Conjecture 这一 50 年悬而未决的数学难题,标志着 frontier 模型已从"辅助工具"进入"独立研究者"区间;Luna 以 25 倍成本优势逼近 GPT-5.5 最高推理档位的表现,说明 OpenAI 正主动下压性价比曲线以扩大覆盖面,而非单纯追逐峰值。

来源 · 97 条