【OpenAI】GPT-5.6 正式发布,性能提升成本大幅下降 GPT-5.6 系列(Sol、Terra、Luna)发布,在 ARC-AGI-3 达到 7.8% SOTA,DeepSWE 榜单 73% 排名第一。GPT-5.6 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍。Sol 模型成功证明 50 年未解的 Cycle Double Cover 猜想,使用 64 个子代理在约 1 小时内完成。
【OpenAI】ChatGPT Work 发布,Codex 整合进桌面应用 ChatGPT Work 是可在应用和文件间自动执行任务的新代理,可持续数小时跟踪项目直至完成目标。Codex 应用与新版 ChatGPT 桌面应用合并,统一了侧边栏和搜索体验。发布后用户反馈积极,活跃用户达 700 万。
【OpenAI】GPT-Live 语音模型全球上线 新一代语音模型现已向所有 ChatGPT 用户开放,周末期间语音使用额度翻倍。
【Anthropic】Claude Fable 5 恢复全球访问 与美国政府对话后重新上线,新增分类器阻止网络安全任务滥用,日常编码调试任务暂由 Opus 4.8 处理。Anthropic 联合亚马逊、微软、Google 等 Glasswing 合作伙伴制定 AI 越狱评估框架。
【Google】AlphaEvolve 在 Google Cloud 正式发布 Gemini 驱动的进化代理可自动设计优化代码,解决各行业复杂算法瓶颈问题。
本周期无符合条件(排名变动≥5 或分数变动≥5%)的重大 benchmark 变化。排名变动均为 1-2 位,分数无变化。
7月11日
7月10日
7月9日
7月8日
7月7日
7月11日
7月10日
7月9日
7月8日
7月7日
7月1日
7月7日
7月1日
7月9日
OpenAI 合作案例
| 日期 | 合作伙伴 | 内容 |
|---|---|---|
| 7月10日 | Deutsche Telekom | AI 原生电信转型,覆盖客服、员工工作流、网络运维 |
| 7月9日 | NVIDIA | 使用 ChatGPT Work 自动化工作流 |
| 7月9日 | JetBrains | GPT-5.6 集成至 IDE、Junie、Air |
| 7月9日 | Figma | GPT-5.6 上线 Figma Make |
Benchmark 表现
Intelligence (Artificial Analysis)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 |
LMArena Overall
| 排名 | 模型 | Elo |
|---|---|---|
| 1 | Claude Fable 5 | 1509 |
| 2 | Claude Opus 4.6 Thinking | 1504 |
| 3 | Claude Opus 4.7 Thinking | 1503 |
Agentic (Artificial Analysis)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 46.7 |
| 2 | GPT-5.6 Luna (max) | 45.6 |
| 3 | GPT-5.5 (xhigh) | 44.9 |
Coding (Artificial Analysis)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 71.5 |
| 3 | GPT-5.6 Luna (max) | 71.4 |
SWE-bench Verified 变化
Terminal-Bench 2.0 变化
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-5.6 Sol Ultra 在一小时内证明 50 年未解的 Cycle Double Cover 猜想,标志着前沿模型在数学推理上已能处理长期悬而未决的学术难题,但这类成果的可复现性和验证流程仍需关注。
ChatGPT Work 发布后 OpenAI 迅速回应多项用户反馈(重置额度、调整默认、修复侧边栏),反映出将 Codex 整合进 ChatGPT 的产品决策执行仓促,用户体验磨合期明显。
Claude Fable 5 在被美国商务部实施出口管制后仅一周即恢复访问,新增网络安全分类器并与政府建立联合评估机制,体现了 Anthropic 在安全合规与产品可用性之间的平衡策略。