← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-13

2026-07-13 08:33 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 正式发布,性能提升成本大幅下降 GPT-5.6 系列(Sol、Terra、Luna)发布,在 ARC-AGI-3 达到 7.8% SOTA,DeepSWE 榜单 73% 排名第一。GPT-5.6 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍。Sol 模型成功证明 50 年未解的 Cycle Double Cover 猜想,使用 64 个子代理在约 1 小时内完成。

原文链接

【OpenAI】ChatGPT Work 发布,Codex 整合进桌面应用 ChatGPT Work 是可在应用和文件间自动执行任务的新代理,可持续数小时跟踪项目直至完成目标。Codex 应用与新版 ChatGPT 桌面应用合并,统一了侧边栏和搜索体验。发布后用户反馈积极,活跃用户达 700 万。

原文链接

【OpenAI】GPT-Live 语音模型全球上线 新一代语音模型现已向所有 ChatGPT 用户开放,周末期间语音使用额度翻倍。

原文链接

【Anthropic】Claude Fable 5 恢复全球访问 与美国政府对话后重新上线,新增分类器阻止网络安全任务滥用,日常编码调试任务暂由 Opus 4.8 处理。Anthropic 联合亚马逊、微软、Google 等 Glasswing 合作伙伴制定 AI 越狱评估框架。

原文链接

【Google】AlphaEvolve 在 Google Cloud 正式发布 Gemini 驱动的进化代理可自动设计优化代码,解决各行业复杂算法瓶颈问题。

原文链接

重大 Benchmark 变化

本周期无符合条件(排名变动≥5 或分数变动≥5%)的重大 benchmark 变化。排名变动均为 1-2 位,分数无变化。

快速预览

  • OpenAI 发布 GPT-5.6 模型家族,Sol Ultra 证明 50 年数学猜想,Luna 成本降至 1/25
  • ChatGPT Work 上线,整合 Codex 能力,支持跨应用自主工作数小时
  • Claude Fable 5 恢复全球访问,新增网络安全分类器限制滥用
  • GPT-Live 语音模型全量上线,周末双倍使用额度
  • Anthropic 任命前美联储主席伯南克加入长期受益信托

新闻

OpenAI

7月11日

7月10日

7月9日

7月8日

7月7日


Anthropic

7月11日

7月10日

7月9日

7月8日

7月7日

7月1日


Google

7月7日

7月1日

7月9日


行业动态

OpenAI 合作案例

日期 合作伙伴 内容
7月10日 Deutsche Telekom AI 原生电信转型,覆盖客服、员工工作流、网络运维
7月9日 NVIDIA 使用 ChatGPT Work 自动化工作流
7月9日 JetBrains GPT-5.6 集成至 IDE、Junie、Air
7月9日 Figma GPT-5.6 上线 Figma Make

Benchmark 表现


Benchmark

行业格局

Intelligence (Artificial Analysis)

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max) 53.4
3 GPT-5.6 Luna (max) 51.2

LMArena Overall

排名 模型 Elo
1 Claude Fable 5 1509
2 Claude Opus 4.6 Thinking 1504
3 Claude Opus 4.7 Thinking 1503

干活选型

Agentic (Artificial Analysis)

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max) 46.7
2 GPT-5.6 Luna (max) 45.6
3 GPT-5.5 (xhigh) 44.9

Coding (Artificial Analysis)

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max) 71.5
3 GPT-5.6 Luna (max) 71.4

SWE-bench Verified 变化

  • Claude 4.5 Opus medium 升至第 1 名(79.2),原第 1 Claude 4.5 Opus 降至第 2
  • GPT-5-2 Codex 升至第 16 名,GPT-5 降至第 14 名

Terminal-Bench 2.0 变化

  • Claude Opus 4.7 升至第 2 名(80.2),Gemini 3.1 Pro 降至第 3

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

  1. GPT-5.6 Sol Ultra 在一小时内证明 50 年未解的 Cycle Double Cover 猜想,标志着前沿模型在数学推理上已能处理长期悬而未决的学术难题,但这类成果的可复现性和验证流程仍需关注。

  2. ChatGPT Work 发布后 OpenAI 迅速回应多项用户反馈(重置额度、调整默认、修复侧边栏),反映出将 Codex 整合进 ChatGPT 的产品决策执行仓促,用户体验磨合期明显。

  3. Claude Fable 5 在被美国商务部实施出口管制后仅一周即恢复访问,新增网络安全分类器并与政府建立联合评估机制,体现了 Anthropic 在安全合规与产品可用性之间的平衡策略。

来源 · 97 条