【Google DeepMind】Gemini 4 Argon 发布,空降 lmarena 第一
Google DeepMind 发布新前沿模型 Gemini 4 Argon,在 lmarena overall 以 1524 分直接登顶 #1,领先第二名约 20 分。幻觉率仅 15%(GPT-6 Astra 45%、Opus 5.5 59%),已在 Google 数据中心释放 300+ TiB 内存、完成 80 万行 C/C++ → Rust 迁移。通过 Fairwind 程序向受信测试者开放。Argon 在幻觉率上的优势可能改变对事实准确性敏感的企业选型方向。
【OpenAI】DevDay 2026:20+ 项公告集中发布
OpenAI DevDay 2026 发布超过 20 项公告,包括 GPT-6 Astra、Dots 主动代理、Codex、新 API 及安全工具。Dots 可跨复杂项目 24/7 持续工作;ChatGPT Sites 现可托管 MCP 服务器并支持插件扩展;Codex Security Cloud 升级,默认包含 Daybreak Blue 网安模型,可扫描整库并自动修复。
【Anthropic】Claude Sonnet 5.5 上线
Claude Sonnet 5.5 发布,相较 Sonnet 5 速度提升 30%+、成本降低 30%。已作为 Claude Code v2.1.284 默认 Sonnet 模型,支持 1M 上下文,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。
【Anthropic】Claude Code v2.1.287:Mods 插件系统上线
Claude Code 新增 Mods 功能,插件可修改更深层行为与 UI。用户可用几行 TypeScript 编写或让 Claude 自动生成,通过 /plugin 安装,并作为插件分享给他人。
| 模型 | Benchmark | 变动 |
|---|---|---|
| gemini-4-argon-high | lmarena overall | 🆕 新上榜直登 #1,分数 1524.84 |
| deepseek-v4.1-flash-max | lmarena overall | 排名 29→40(−11),分数 1476.51→1472.77 |
| gemini-3.5-flash-medium | lmarena overall | 排名 36→29(+7),分数 1474.0→1476.2 |
| gpt-6-sol-max | lmarena overall | 排名 60→66(−6),分数 1457.48→1455.82 |
| gemini-3.5-flash-lite | lmarena overall | 排名 65→70(−5),分数 1456.03→1454.11 |
Gemini 4 Argon 以 1524 分空降 lmarena 第一,比此前 #1 的 Claude Opus 5.5 High(1503.98)高出约 21 分,直接将 Opus 5.5 High 挤至第四。这是本周榜单最大变动。
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-01 | The eternal complement | 探讨 AI 对突破性想法背后日常执行工作的价值 |
| 10-01 | How Albertsons Companies is reimagining retail | Albertsons 使用 ChatGPT Enterprise 和 OpenAI API 加速团队工作 |
| 10-01 | The Den frees up 10-15 hours a week | 社交俱乐部用 ChatGPT Work 将拨款申请从 3 天缩至 2 小时 |
| 09-30 | Disrupting a coordinated model-distillation campaign | OpenAI 披露挫败一起提取受保护模型推理的蒸馏攻击,正在加强防御 |
| 09-30 | Helping small businesses put AI to work | 与 America's SBDC 合作提供 AI 培训,发布小企业 AI 使用报告 |
| 09-29 | Introducing GPT-6.1 Sol | 近 Astra 级编码/计算机使用能力,API 价格为 Astra 的五分之一 |
| 09-29 | DevDay 2026 Recap | 超过 20 项公告:GPT-6 Astra、Codex、API、安全工具等 |
| 09-29 | Introducing dots | 主动式助手,可跨复杂项目和日常任务持续工作 |
Sam Altman 在 X 上表示 Sign in with ChatGPT 的初衷是让用户在任何地方使用 AI 订阅;并称 GPT-6.1 Sol 是史上增长最快模型,此前负载偏慢已改善。
OpenAI Developers 账号在 X 上大量转发 DevDay 后续:ChatGPT Sites 可托管 MCP 服务器、可分享的个人资料页、Latent.Space 对 OpenAI Agent Stack 的深度分析(涵盖 Computer Use、Dots、Decisions API、UltraFast 推理等)。Codex Security Cloud 升级,默认包含 Daybreak Blue 网络安全模型,可扫描整个 GitHub 仓库并持续审查新提交。
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-01 | Claude Code v2.1.287 | Claude Mods:插件可修改更深层行为,支持 TypeScript 编写、/plugin 安装 |
| 09-30 | Claude Code v2.1.286 | 权限请求堆积时显示计数(如 "2 of 5") |
| 09-29 | Claude Code v2.1.285 | 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch |
| 09-28 | Claude Code v2.1.284 | 新增 Claude Sonnet 5.5 为默认 Sonnet 模型;1M 上下文,$2/$10 per Mtok |
Anthropic X 发布 Science Blog 客座文章:哈佛物理学家 Matthew Schwartz 指出 LLM 与科学之间存在"阻抗失配",他构建精确计算工具包后,Claude 发现了与生态学、群体遗传学等十余个领域的关联。
Boris Cherny 在 X 上称 Mods 非常强大,可仅通过提示词自定义 Claude 的工作方式和外观,并以插件形式分享。
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-30 | Demis Hassabis 转发 Gemini 4 Argon 发布 | Gemini 4 Argon 登顶 Text Arena #1(1525 分),在编码、硬提示、指令遵循等子项均排第一 |
| 09-30 | Demis 转发 hallucination 数据 | Gemini 4 Argon 幻觉率 15%,远低于 GPT-6 Astra(45%)和 Opus 5.5(59%) |
| 09-30 | Demis 转发 Argon agent 基础设施应用 | Argon agent 已在 Google 数据中心释放超 300 TiB 内存,完成 80 万行 C/C++→Rust 迁移 |
| 09-28 | Future Vision XPRIZE 获奖短片 | 公布获奖作品 The Gifted |
Google DeepMind 还在 X 上转发了 Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中 GA,支持视频头像、流畅对话和工具调用。
Andrej Karpathy(10-02):分享了理解 LLM 输出的技巧——从 ASD-STE100 受控语言写作,到图表、HTML 网页,再到可弃用的定制讲解视频,强调随着智能和代码变得充沛,可以索取大规模一次性软件制品来辅助理解。
Simon Willison(09-29):在 OpenAI DevDay 现场进行直播博客。
Artificial Analysis / Intelligence(综合智能指数)
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Adaptive, Max, Default Fallback) | 57.6 |
| 2 | Claude Fable 5.1 (Adaptive, Max, Default Fallback) | 53.4 |
| 3 | GPT-6 Astra (Max) | 52.7 |
LMArena / Overall(人类偏好总榜)
本期有重大变动:
| 变化 | 模型 | 上期 → 本期 | 上期分数 → 本期分数 |
|---|---|---|---|
| 🆕 新入榜 #1 | gemini-4-argon-high | — → #1 | — → 1524.84 |
| ⬇️ #1→#4 | claude-opus-5.5-high | #1 → #4 | 1508.55 → 1503.98 |
| ⬆️ #36→#29 | gemini-3.5-flash-medium | #36 → #29 | 1474.00 → 1476.20 |
| ⬇️ #29→#40 | deepseek-v4.1-flash-max | #29 → #40 | 1476.51 → 1472.77 |
| ⬇️ #26→#30 | gpt-6-astra-max | #26 → #30 | 1477.72 → 1476.18 |
| ⬆️ #92→#88 | grok-4.7-xhigh | #92 → #88 | 1439.07 → 1442.45 |
| ⬆️ #25→#24 | qwen3.8-max | #25 → #24 | 1479.37 → 1480.86 |
| — 分数变 | claude-fable-5-high | #3 → #3 | 1503.82 → 1504.87 |
仅列出显著变动,完整变更含 60 余项排名微调。
当前 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gemini-4-argon-high | 1524.84 |
| 2 | claude-opus-4-6-high | 1505.49 |
| 3 | claude-fable-5-high | 1504.87 |
| 4 | claude-opus-5.5-high | 1503.98 |
| 5 | claude-opus-4-7-high | 1501.69 |
Artificial Analysis / Agentic(智能体能力)
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive, Max, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Adaptive, Xhigh Effort) | 55.6 |
| 3 | GPT-6 Astra (Max) | 51.0 |
Artificial Analysis / Coding(编码能力)
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive, Max, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive, Medium, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Adaptive, Xhigh Effort) | 77.0 |
SWE-bench Verified(软件工程基准)
本期有微调(同分换位):
| 变化 | 模型 | 上期 → 本期 |
|---|---|---|
| ⬆️ #10→#9 | Claude 4 Sonnet + o4-mini | #10 → #9(分数不变 74.4) |
| ⬇️ #9→#10 | GPT-5 | #9 → #10(分数不变 74.4) |
| ⬆️ #34→#33 | Claude 3.5 Haiku | #34 → #33(分数不变 40.6) |
| ⬇️ #33→#34 | LLama 3.1 70B Critic | #33 → #34(分数不变 40.6) |
当前 Top 3:
| 排名 | 模型 + 框架 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Gemini 4 Argon (High) 首日即登顶 LMArena #1:以 1524.84 分直接超越此前 #1 的 Claude Opus 5.5-high(后者降至 1503.98),并据 Arena.ai 数据在编码、硬提示、指令跟随等所有子项均排第一,同时幻觉率仅 15%(GPT-6 Astra 为 45%)。这是 LMArena 近期最大的一次榜单震动,Google 在 Argon agent 上已实现 300 TiB 内存释放和 80 万行 Rust 迁移的内部生产应用,说明该模型不仅刷榜,已在 Google 自有基础设施中产出工程价值。
Claude Code 推出 Mods 插件系统:v2.1.287 允许用几行 TypeScript 修改 Claude Code 的行为、UI 和功能,并通过 /plugin 安装。这使 Claude Code 从封闭工具转向可扩展平台,配合同日 Claude.dev 开发者门户上线,Anthropic 正在围绕开发者生态构建壁垒。
OpenAI 披露挫败蒸馏攻击:Disrupting a coordinated model-distillation campaign 明确表示有对手试图提取 GPT 模型的受保护推理能力,OpenAI 已采取反制措施并加固防御。这表明前沿模型的 IP 保护已从理论讨论进入实战阶段。