← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-30

2026-07-30 08:33 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 两项设置改动使 ARC-AGI-3 分数提升三倍

OpenAI 披露,通过启用 reasoning retention 和 compaction 两项 API 设置,GPT-5.6 在 ARC-AGI-3 benchmark 上的分数提升至原来的三倍。关键在于允许模型跨多个上下文窗口进行推理,并使用官方 compaction 实现。这证明推理能力与效率优化可显著提升模型在复杂抽象推理任务上的表现。

原文链接:How enabling two settings tripled our scores on the ARC-AGI-3 benchmark


【OpenAI】GPT-5.6 实现前沿智能与效率的融合

GPT-5.6 发布后,团队将其用于优化自身推理栈,实现 20% 服务成本下降(GPU kernel 优化)和 15%+ token 生成效率提升(推测解码改进)。模型同时推进智能与效率边界,以更低成本提供更强能力。

原文链接:How GPT-5.6 fuses frontier intelligence with frontier efficiency


【Anthropic】Claude Opus 5 发布:接近 Fable 5 智力水平,价格减半

Claude Opus 5 是一个主动且有思想的模型,在多项编码和知识工作评估中达到新的 SOTA。Boris Cherny 披露,Opus 5 是目前最抗提示注入的模型,结合防御措施后提示注入攻击成功率接近零。在 OSWorld v2 上,Opus 5 从 55.7% 提升至 70.6%。

原文链接:Claude Opus 5 发布推文


【OpenAI】ChatGPT for Academic Researchers 面向学术研究者免费开放

OpenAI 向学术研究者免费提供前沿模型访问,首批覆盖 10,000 名研究人员,2027 年前扩展至 100,000 名。该项目旨在加速科学发现,覆盖数学、工程等多个学科领域。

原文链接:Accelerating scientific discovery with ChatGPT for Academic Researchers


【OpenAI & Anthropic】两大实验室支持 AI 发展节奏调控倡议

OpenAI 和 Anthropic 均公开支持 "Pacing the Frontier" 请愿书,由两大公司 CEO 及创始团队成员签署。倡议呼吁开发工具以审慎控制前沿 AI 发展速度,让社会有足够时间准备应对更强 AI 系统。

原文链接:OpenAI 支持声明 | Anthropic 支持声明


重大 Benchmark 变化

本周 benchmark 排名变化均未达到"重大变化"阈值(排名变动≥5 或分数变动≥5%)。所有记录的变化均为排名微调(1-2 位),分数未发生实质性变动。

快速预览

  • OpenAI 发布 GPT-5.6 效率突破:两个 API 设置让 ARC-AGI-3 分数提升三倍
  • Claude Opus 5 正式发布,以一半价格接近 Fable 5 的前沿智能
  • OpenAI 向 10 万学术研究者免费开放 ChatGPT 前沿模型
  • Anthropic 与 OpenAI 联署「节奏前沿」请愿书,呼吁为 AI 发展降速
  • Google 推出 Gemini Managed Agents API 更新,支持 3.6 Flash 和环境钩子

新闻

OpenAI(7 月 29 日)

标题 要点
How enabling two settings tripled our scores on the ARC-AGI-3 benchmark 启用「保留推理」和「压缩」两个 API 设置后,GPT-5.6 在 ARC-AGI-3 基准测试上分数提升三倍
Accelerating scientific discovery with ChatGPT for Academic Researchers 向 10 万学术研究者免费开放 ChatGPT 最先进模型,2026 年首期 1 万人并逐年扩展
How GPT-5.6 fuses frontier intelligence with frontier efficiency GPT-5.6 通过自优化推理栈实现 20% 服务成本降低和 15%+ token 生成效率提升

OpenAI(7 月 28 日)

标题 要点
Scientific computing in the age of agentic AI 新领域报告展示科学家如何用 AI 编码代理加速基因组学等科学计算

OpenAI(7 月 27 日)

标题 要点
How AI is expanding what people do at work 研究显示 ChatGPT 用户跨越角色边界承担任务,重新定义工作边界

Anthropic(7 月 28-29 日)

来源 内容
官方 X 账号 CEO 及多位联合创始人签署「节奏前沿」请愿书,呼吁开发工具让 AI 发展降速以便社会适应
官方 X 账号 发布关于开源权重模型的完整立场声明

Anthropic(7 月 24 日)

来源 内容
Claude Opus 5 发布 新模型「深思熟虑且主动」,以 Fable 5 一半价格接近其前沿智能;在 OSWorld v2 上从 55.7% 提升至 70.6%,是「最难被提示注入攻击的模型」

Google(7 月 28-29 日)

标题 要点
Gemini API Managed Agents: 3.6 Flash, hooks, and more Managed Agents API 更新:支持 Gemini 3.6 Flash、环境钩子、免费层支持
Lyria 3.5 音乐模型发布 更富表现力的人声、更丰富的编曲、BPM 控制和可导出分轨

Google(7 月 22 日)

标题 要点
Genesis Mission 扩展 向美国能源部国家实验室承诺 4000 万美元 AI token 和云积分

安全与研究

来源 内容
HN 热门:Document-borne AI worms AI 蠕虫可通过 Copilot for Word 文档自我传播(335 pts)
HN 热门:Anatomy of a Frontier Lab Agent Intrusion 2026 年 7 月前沿实验室代理入侵事件时间线(274 pts)
OpenAI 与 Hugging Face 安全事件 模型评估期间发生安全事件,公布早期发现与防御教训

工具更新

来源 更新内容
Claude Code v2.1.220 Bug 修复与可靠性改进
Claude Code v2.1.219 新增 Claude Opus 5 为默认 Opus 模型,100 万上下文,fast mode $10/$50/Mtok
Claude Code v2.1.218 /code-review 改为后台子代理运行
OpenAI Codex Security 发布 CLI 和 TypeScript SDK 用于发现、验证、修复代码安全漏洞

行业格局

本期变动:LMArena 榜单前五无变化;Artificial Analysis 智能榜单 Claude Opus 5 (Xhigh) 以 60.1 分居首。

当前 Top 3(Artificial Analysis / intelligence)

  1. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) — 60.1
  2. GPT-5.5 (xhigh) — 54.8
  3. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 53.4

当前 Top 3(LMArena / overall)

  1. claude-fable-5 — 1507.6
  2. claude-opus-4-6-thinking — 1504.9
  3. claude-opus-4-7-thinking — 1502.2

数据来源:Artificial Analysis (artificialanalysis.ai) · LMArena

干活选型

本期变动:SWE-bench Verified 排名微调,Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换前两名位置;Terminal-Bench 2.0 中 Claude Opus 4.7 与 Gemini 3.1 Pro 交换第 2、3 位。

当前 Top 3(Artificial Analysis / agentic)

  1. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) — 54.5
  2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 46.7
  3. GPT-5.6 Luna (max) — 45.6

当前 Top 3(Artificial Analysis / coding)

  1. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) — 77.0
  2. GPT-5.5 (xhigh) — 74.9
  3. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 71.5

当前 Top 3(SWE-bench Verified)

  1. Claude 4.5 Opus medium (20251101) (live-SWE-agent) — 79.2
  2. Claude 4.5 Opus (Sonar Foundation Agent) — 79.2
  3. Doubao-Seed-Code (TRAE) — 78.8

当前 Top 3(Terminal-Bench 2.0)

  1. GPT-5.5 (NexAU-AHE) — 84.7
  2. Claude Opus 4.7 (WOZCODE) — 80.2
  3. Gemini 3.1 Pro (TongAgents) — 80.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

GPT-5.6 仅靠启用「保留推理」和「压缩」两个 API 设置就在 ARC-AGI-3 上实现三倍分数提升,说明模型能力瓶颈往往不在架构而在推理配置——这对开发者是重要信号:合理使用推理时设置可能比换更强模型更划算。Claude Opus 5 以「一半价格接近 Fable 5 智能」定位发布,配合其在 OSWorld v2 上 55.7%→70.6% 的跃升,显示出 Anthropic 正在用性价比策略争夺企业级知识工作市场。OpenAI 与 Anthropic 罕见地共同签署「节奏前沿」请愿书,两家前沿实验室在竞争白热化时刻联合呼吁为 AI 发展「踩刹车」,是监管层面的重要信号。

来源 · 92 条