【OpenAI】GPT-5.6 两项设置改动使 ARC-AGI-3 分数提升三倍
OpenAI 披露,通过启用 reasoning retention 和 compaction 两项 API 设置,GPT-5.6 在 ARC-AGI-3 benchmark 上的分数提升至原来的三倍。关键在于允许模型跨多个上下文窗口进行推理,并使用官方 compaction 实现。这证明推理能力与效率优化可显著提升模型在复杂抽象推理任务上的表现。
原文链接:How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
【OpenAI】GPT-5.6 实现前沿智能与效率的融合
GPT-5.6 发布后,团队将其用于优化自身推理栈,实现 20% 服务成本下降(GPU kernel 优化)和 15%+ token 生成效率提升(推测解码改进)。模型同时推进智能与效率边界,以更低成本提供更强能力。
原文链接:How GPT-5.6 fuses frontier intelligence with frontier efficiency
【Anthropic】Claude Opus 5 发布:接近 Fable 5 智力水平,价格减半
Claude Opus 5 是一个主动且有思想的模型,在多项编码和知识工作评估中达到新的 SOTA。Boris Cherny 披露,Opus 5 是目前最抗提示注入的模型,结合防御措施后提示注入攻击成功率接近零。在 OSWorld v2 上,Opus 5 从 55.7% 提升至 70.6%。
原文链接:Claude Opus 5 发布推文
【OpenAI】ChatGPT for Academic Researchers 面向学术研究者免费开放
OpenAI 向学术研究者免费提供前沿模型访问,首批覆盖 10,000 名研究人员,2027 年前扩展至 100,000 名。该项目旨在加速科学发现,覆盖数学、工程等多个学科领域。
原文链接:Accelerating scientific discovery with ChatGPT for Academic Researchers
【OpenAI & Anthropic】两大实验室支持 AI 发展节奏调控倡议
OpenAI 和 Anthropic 均公开支持 "Pacing the Frontier" 请愿书,由两大公司 CEO 及创始团队成员签署。倡议呼吁开发工具以审慎控制前沿 AI 发展速度,让社会有足够时间准备应对更强 AI 系统。
原文链接:OpenAI 支持声明 | Anthropic 支持声明
本周 benchmark 排名变化均未达到"重大变化"阈值(排名变动≥5 或分数变动≥5%)。所有记录的变化均为排名微调(1-2 位),分数未发生实质性变动。
| 标题 | 要点 |
|---|---|
| How enabling two settings tripled our scores on the ARC-AGI-3 benchmark | 启用「保留推理」和「压缩」两个 API 设置后,GPT-5.6 在 ARC-AGI-3 基准测试上分数提升三倍 |
| Accelerating scientific discovery with ChatGPT for Academic Researchers | 向 10 万学术研究者免费开放 ChatGPT 最先进模型,2026 年首期 1 万人并逐年扩展 |
| How GPT-5.6 fuses frontier intelligence with frontier efficiency | GPT-5.6 通过自优化推理栈实现 20% 服务成本降低和 15%+ token 生成效率提升 |
| 标题 | 要点 |
|---|---|
| Scientific computing in the age of agentic AI | 新领域报告展示科学家如何用 AI 编码代理加速基因组学等科学计算 |
| 标题 | 要点 |
|---|---|
| How AI is expanding what people do at work | 研究显示 ChatGPT 用户跨越角色边界承担任务,重新定义工作边界 |
| 来源 | 内容 |
|---|---|
| 官方 X 账号 | CEO 及多位联合创始人签署「节奏前沿」请愿书,呼吁开发工具让 AI 发展降速以便社会适应 |
| 官方 X 账号 | 发布关于开源权重模型的完整立场声明 |
| 来源 | 内容 |
|---|---|
| Claude Opus 5 发布 | 新模型「深思熟虑且主动」,以 Fable 5 一半价格接近其前沿智能;在 OSWorld v2 上从 55.7% 提升至 70.6%,是「最难被提示注入攻击的模型」 |
| 标题 | 要点 |
|---|---|
| Gemini API Managed Agents: 3.6 Flash, hooks, and more | Managed Agents API 更新:支持 Gemini 3.6 Flash、环境钩子、免费层支持 |
| Lyria 3.5 音乐模型发布 | 更富表现力的人声、更丰富的编曲、BPM 控制和可导出分轨 |
| 标题 | 要点 |
|---|---|
| Genesis Mission 扩展 | 向美国能源部国家实验室承诺 4000 万美元 AI token 和云积分 |
| 来源 | 内容 |
|---|---|
| HN 热门:Document-borne AI worms | AI 蠕虫可通过 Copilot for Word 文档自我传播(335 pts) |
| HN 热门:Anatomy of a Frontier Lab Agent Intrusion | 2026 年 7 月前沿实验室代理入侵事件时间线(274 pts) |
| OpenAI 与 Hugging Face 安全事件 | 模型评估期间发生安全事件,公布早期发现与防御教训 |
| 来源 | 更新内容 |
|---|---|
| Claude Code v2.1.220 | Bug 修复与可靠性改进 |
| Claude Code v2.1.219 | 新增 Claude Opus 5 为默认 Opus 模型,100 万上下文,fast mode $10/$50/Mtok |
| Claude Code v2.1.218 | /code-review 改为后台子代理运行 |
| OpenAI Codex Security | 发布 CLI 和 TypeScript SDK 用于发现、验证、修复代码安全漏洞 |
本期变动:LMArena 榜单前五无变化;Artificial Analysis 智能榜单 Claude Opus 5 (Xhigh) 以 60.1 分居首。
当前 Top 3(Artificial Analysis / intelligence):
当前 Top 3(LMArena / overall):
数据来源:Artificial Analysis (artificialanalysis.ai) · LMArena
本期变动:SWE-bench Verified 排名微调,Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换前两名位置;Terminal-Bench 2.0 中 Claude Opus 4.7 与 Gemini 3.1 Pro 交换第 2、3 位。
当前 Top 3(Artificial Analysis / agentic):
当前 Top 3(Artificial Analysis / coding):
当前 Top 3(SWE-bench Verified):
当前 Top 3(Terminal-Bench 2.0):
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-5.6 仅靠启用「保留推理」和「压缩」两个 API 设置就在 ARC-AGI-3 上实现三倍分数提升,说明模型能力瓶颈往往不在架构而在推理配置——这对开发者是重要信号:合理使用推理时设置可能比换更强模型更划算。Claude Opus 5 以「一半价格接近 Fable 5 智能」定位发布,配合其在 OSWorld v2 上 55.7%→70.6% 的跃升,显示出 Anthropic 正在用性价比策略争夺企业级知识工作市场。OpenAI 与 Anthropic 罕见地共同签署「节奏前沿」请愿书,两家前沿实验室在竞争白热化时刻联合呼吁为 AI 发展「踩刹车」,是监管层面的重要信号。