【Google DeepMind】Gemini 4 Argon 登顶 Text Arena 与 Vals Index
Google DeepMind 发布 Gemini 4 Argon,在 Text Arena 以 1525 分登顶 #1,领先第二名 Claude Opus 4.6 (High) 20 分;在 Code Arena: WebDev 从 #29 跃升至 #8(+96 分),混合成本 $8/MToken,为当前性价比最高模型。在 Vals Index 同样拿下 #1(68.9%),系 Gemini 首次登顶该榜。该模型目前通过 Fairwind Program 向受信任测试者开放。
【OpenAI】DevDay 2026:20+ 项公告集中发布
DevDay 2026 公布超过 20 项公告,涵盖 GPT-6 Astra、Dots 主动式 AI 助手、Codex 更新、Decisions API、UltraFast 推理(8x 速度)、Computer Use 及 B2B Marketplace 等。GPT-6.1 Sol 同步发布,提供接近 Astra 的能力,API 价格仅为 Astra 的 1/5,并支持 95% 缓存读取折扣。GPT-6 Astra 在多家企业客户中已验证效率提升:Basis 税务工作簿完成速度较 GPT-5.6 Sol 快 2 倍,Parallel 研究时间与成本均减半。
【OpenAI】Dots:24/7 主动式 AI 助手上线
Dots 是可跨复杂项目和日常任务持续工作的主动式 AI 助手,具备自主操作计算机的能力(用户可查看 dot 的操作过程并保持控制)。Sam Altman 称其目标是让用户将注意力收回至更高层级的工作。开发者 Tibo Louis-Étienne 已展示 dot 自主搜索网络图片并进行绘制的演示。
【Anthropic】Claude Sonnet 5.5 发布,成为 Claude Code 默认模型
Claude Sonnet 5.5 为 Claude 5.5 家族第二款模型,较 Sonnet 5 速度提升 30%+,多数场景成本降低 30%,支持 1M 上下文,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。已作为 Claude Code v2.1.284 的默认 Sonnet 模型上线。Opus 5.5 于一周前发布,性能对标 Fable 5.1,成本较 Opus 5 降低 40%。
🔗 Sonnet 5.5 公告 | Claude Code v2.1.284
| Benchmark | 模型 | 变动 |
|---|---|---|
| Text Arena | Gemini 4 Argon (High) | 新登顶 #1(1525 分),领先 #2 Claude Opus 4.6 (High) 20 分;在编程、硬提示、指令遵循、长查询、创意写作均列 #1 |
| Code Arena: WebDev | Gemini 4 Argon (High) | #29 → #8(+96 分),系排名变动≥5 的重大跃升 |
| Vals Index | Gemini 4 Argon | #1(68.9%),Gemini 首次登顶该榜 |
| AA Agentic | GPT-6 Astra (Max) | 新入榜 #3(51.0 分);Grok 4.6 (Medium) 新入榜 #5(50.6 分) |
| AA Coding | GPT-6 Astra (Max) | 新入榜 #4(76.9 分);GPT-6 Astra (Xhigh) #5(75.9 分) |
| AA Intelligence | GPT-6 Astra (Max) | 新入榜 #3(52.7 分);GPT-6.1 Sol (Xhigh) #5(51.0 分) |
Gemini 4 Argon 在 Text Arena 以 +20 分优势压制 Claude Opus 4.6,同时混合成本仅 $8/MToken,直接重写了性价比 Pareto 前沿。GPT-6 Astra (Max) 在 AA 三项子榜均进入前 5,但未能超越 Argon 在 Text Arena 的表现。
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-30 | Gemini 4 Argon | Text Arena #1(1525 分),领先 #2 Claude Opus 4.6 (High) 达 20 分;Code Arena: WebDev #8(1679 分,较前版 +96 分)。在 coding、hard prompts、instruction following、creative writing 等全部细分领域拿下第一;Vals Index #1(68.9%)。blended $8/MToken,为当前最成本高效模型。HN 热帖 899 points |
| 09-30 | SynthID Bio 开源 | 在《Nature》发表论文,实现 AI 生成蛋白质的水印标记;开源 SynthID Bio 工具供研究社区使用 |
| 09-28 | Future Vision XPRIZE 获奖短片 The Gifted | 展示 AI 视频生成能力 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-30 | 挫败协同蒸馏行动 | 披露有人试图提取受保护模型推理,OpenAI 正加强对抗性蒸馏防御 |
| 09-30 | 帮助小企业用上 AI | 与美国 SBDC 合作推广 AI 培训,发布小企业 AI 使用报告 |
| 09-29 | GPT-6.1 Sol | 近 Astra 级智能,API 输入/输出 token 价格为 Astra 的 1/5,95% cache read discount |
| 09-29 | DevDay 2026 回顾 | 超过 20 项公告:GPT-6 Astra、ChatGPT、Codex、API、安全工具等 |
| 09-29 | Dots 发布 | 24/7 主动型 agent,可跨复杂项目和日常任务持续工作,用户保持控制权 |
| 09-29 | Codex Security Cloud 升级 | Daybreak Blue 默认包含;扫描整个 GitHub repo,持续审查新 commit,调查并去重发现,准备修复方案 |
| 09-28 | 澳大利亚政府网站事件致歉与整改 | 就涉及澳大利亚政府网站的事件道歉,提出更严格的安全防护和支持 |
| 09-28 | 前沿 AI 训练安全案例指南 | 涵盖技术防护、操作实践和错位事件调查的早期指南 |
| 09-28 | Basis 用 GPT-6 Astra 完成税务工作簿快 2 倍 | 50 个 tab 的税务工作簿,Astra 完成速度为 GPT-5.6 Sol 的 2 倍 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-30 | Claude Code v2.1.286 | 权限提示堆积时显示计数(如 "2 of 5") |
| 09-29 | Claude Code v2.1.285 | 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch 工具 |
| 09-28 | Claude Sonnet 5.5 发布 | Claude 5.5 家族第二个模型;比 Sonnet 5 快 30%+、成本低 30%;1M context,$2/$10 per Mtok,$0.20/Mtok cache reads |
| 09-28 | Claude Code v2.1.284 | 默认 Sonnet 模型切换为 claude-sonnet-5-5 |
| 09-25 | Claude 完成九环计算 | 在 planar N=4 super-Yang-Mills 模型中将散射振幅推至九环(此前记录为八环),单 prompt 运行数天,总成本数千万美元,SLAC 的 Lance Dixon 独立验证 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-30 | ChatGPT Sites 支持 MCP 服务器 | Sites 可托管 MCP 服务器并转为插件,跨 web/mobile/desktop 安装 |
| 09-30 | Latent.Space 解读 OpenAI Agent Stack | Computer Use、Dots、Decisions API、UltraFast、AI Cloud 组成新 agent 栈 |
| 09-22 | Claude Opus 5.5 发布 | Claude 5.5 家族首个模型;多数任务达 Fable 5.1 水平,成本比 Opus 5 低 40% |
AA Intelligence — 本期有变动
新进入模型:
| 模型 | 排名 | 分数 |
|---|---|---|
| GPT-6 Astra (Max) | 3 | 52.7 |
| GPT-6 Astra (Xhigh) | 4 | 52.4 |
| GPT-6.1 Sol (Xhigh) | 5 | 51.0 |
| GPT-6.1 Sol (High) | 6 | 50.2 |
| Grok 4.7 (High) | 12 | 46.3 |
| Grok 4.6 (Medium) | 14 | 42.8 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Adaptive Reasoning, Max Effort) | 57.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-6 Astra (Max) | 52.7 |
LMArena Overall — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-opus-5.5-high | 1508.6 |
| 2 | claude-opus-4-6-high | 1505.4 |
| 3 | claude-fable-5-high | 1503.8 |
AA Agentic — 本期有变动
新进入模型:
| 模型 | 排名 | 分数 |
|---|---|---|
| GPT-6 Astra (Max) | 3 | 51.0 |
| Grok 4.6 (Medium) | 5 | 50.6 |
| GPT-6 Astra (Xhigh) | 6 | 50.2 |
| Muse Spark 1.2 (Xhigh) | 10 | 43.2 |
| GPT-5.6 Luna (Max) | 11 | 42.1 |
| GPT-5.5 (Xhigh) | 12 | 36.4 |
| GPT-5.6 Sol (Low) | 14 | 31.6 |
| GPT-5.6 Terra (Medium) | 15 | 30.4 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 57.9 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 55.6 |
| 3 | GPT-6 Astra (Max) | 51.0 |
AA Coding — 本期有变动
新进入模型:
| 模型 | 排名 | 分数 |
|---|---|---|
| GPT-6 Astra (Max) | 4 | 76.9 |
| GPT-6 Astra (Xhigh) | 5 | 75.9 |
| GPT-5.5 (Xhigh) | 7 | 74.9 |
| Grok 4.6 (Medium) | 8 | 74.4 |
| Muse Spark 1.2 (Xhigh) | 9 | 72.2 |
| GPT-5.6 Luna (Max) | 12 | 71.4 |
| Gemini 3.5 Flash (High) | 13 | 70.1 |
| GPT-5.6 Sol (Low) | 14 | 69.7 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) | 77.1 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
SWE-bench Verified — 本期有微调
排名变化:
| 模型 | 原排名 | 新排名 | 分数 |
|---|---|---|---|
| Claude 3.5 Haiku | 34 | 33 | 40.6 |
| Claude 4 Sonnet + o4-mini | 10 | 9 | 74.4 |
| GPT-5 | 9 | 10 | 74.4 |
| LLama 3.1 70B Critic | 33 | 34 | 40.6 |
当前 Top 3:
| 排名 | 模型(scaffold) | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Gemini 4 Argon 是本期最大变量。 它以 1525 分登顶 Text Arena,领先第二名 Claude Opus 4.6 (High) 达 20 分,且在 coding、hard prompts、instruction following、creative writing 全部细分领域拿下第一;相比 Google 上一版 Gemini 3.8 Flash (High) 仅排第 11,这是一次跨代跃升,配合 $8/MToken 的 blended 定价直接重写了 Pareto 前沿。
OpenAI DevDay 2026 是一次系统性产品栈扩张。 超过 20 项公告中,GPT-6.1 Sol 以 Astra 1/5 的价格和 95% cache read discount 压低前沿模型使用门槛,Dots 将 AI 从对话扩展为 24/7 自主 agent,Codex Security Cloud 将安全扫描嵌入开发流程——三者合在一起构成 OpenAI 对"AI 即云计算"叙事的完整押注。