【Google DeepMind】Gemini 4 Argon 登顶 Text Arena 第一
Gemini 4 Argon (High) 以 1525 分登顶 Text Arena 第一,领先第二名 Claude Opus 4.6 (High) 20 分,同时在编码、硬提示、指令遵循等子项均排第一,成本仅 $8/MToken,成为最具性价比的模型。这是 Google 从上一代 Gemini 3.8 Flash (第 11 名) 到榜首的巨大跨越。
【OpenAI】DevDay 2026 回顾:20+ 项公告
DevDay 2026 为史上最大规模,涵盖 GPT-6 Astra、ChatGPT、Codex、API 安全更新及开发者新工具等超过 20 项公告。同期发布 GPT-6.1 Sol,提供接近 Astra 的编码和计算机操控能力,API 价格仅为 Astra 标准价的五分之一。
DevDay 2026 Recap | GPT-6.1 Sol
【Anthropic】Claude Sonnet 5.5 发布:提速 30%,降价 30%
Claude 5.5 家族第二款模型 Sonnet 5.5 发布,较 Sonnet 5 推理速度提升 30%+,多数场景成本降低 30%。1M 上下文窗口,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。已设为 Anthropic API 默认 Sonnet 模型。
【Anthropic】Claude Code 推出 Mods 插件系统
Claude Code v2.1.287 引入 Mods 功能,允许开发者通过 TypeScript 自定义 Claude 的行为、UI 和功能,并可作为插件分享。v2.1.288 补充了 $.ui.selection() API 用于获取全屏模式下选中文本。
【DeepSeek】DeepSeek Harness 桌面版发布
DeepSeek 发布 macOS 和 Windows 桌面版 Harness 工具,Linux 用户可通过 npm 包 @deepseek-ai/dsh 获取。该工具面向本地 LLM 运行场景。
| Benchmark | 模型 | 变化 | 详情 |
|---|---|---|---|
| Text Arena | Gemini 4 Argon (High) | 新登顶 #1 | 1525 分,领先第二名 Claude Opus 4.6 (High) +20 分;Coding/Hard Prompts/指令遵循/创意写作均为 #1 |
| Code Arena: WebDev | Gemini 4 Argon (High) | #29 → #8(+21 位) | 1679 分,较前代 Gemini 3.8 Flash (High) +96 分 |
| aa Agentic | Claude Fable 5.1 (Max) | 新模型 #1 | 57.9 分,领先第二名 Claude Opus 5 (Xhigh) 2.3 分 |
| aa Coding | Claude Fable 5.1 (Max) | 新模型 #1 | 81.6 分,领先第二名 Fable 5.1 (Medium) 4.5 分 |
| aa Intelligence | Claude Opus 5.5 (Max) | 新模型 #1 | 57.6 分,领先第二名 Fable 5.1 (Max) 4.2 分 |
关键判断:Gemini 4 Argon 以 $8/MToken 的成本同时拿下 Text Arena 榜首和 Code Arena 大幅跃升(+21 位),在性价比维度上对 OpenAI GPT-6 系列和 Anthropic Claude 5.5 系列形成直接定价压力。与此同时,Anthropic 通过 Fable 5.1 和 Opus 5.5 分别在 agentic/coding 和 intelligence 榜单拿下第一,三家头部模型在各细分赛道上已无明显短板。
$.ui.selection() API;v2.1.287 引入可修改深层行为的 Claude Mods| 日期 | 标题 | 要点 |
|---|---|---|
| 10-03 | Building with the Agents API? Catch up on what's new | Agents API 周更新:Computer use 一行 API 启动浏览器+agent;Bedrock Managed Agents 上线;GPT-6.1 Sol 接入;环境尺寸可选轻量/高配;Dashboard 支持子 agent 配置;环境可跨 session 复用;99.97% 轮次可靠性 |
| 10-02 | A model guide for the GPT-6 family | 面向初创企业的 GPT-6 模型选择指南:模型选型、推理力度调节、提示与技能改进、工具协调、生产工作流准备 |
| 10-02 | Chatham scales its capital markets expertise with OpenAI | Chatham Financial 使用 Codex 和 GPT-5.6,将交易验证从 30 分钟缩短至 4 分钟以内 |
| 10-02 | Sam Altman on Cerebras partnership | Altman 确认 Cerebras 是密切合作伙伴,双方在推进速度前沿方面有深度合作 |
| 10-02 | Sam Altman: dot is my favorite OpenAI product | Altman 称 dot 每天都有可感知的进步,已接管他不愿做的任务 |
| 10-02 | Tibo: Reset all propagated | 全量付费 ChatGPT 账户全局重置已生效;GPT-6.1 Sol 在前两天负载激增后已恢复正常速度 |
| 10-02 | dots + Codex 协同使用 | dots 可跨应用保持上下文、协调 Codex 任务并标记需关注事项;开发者反馈 dots 是最喜欢的 Codex 使用方式 |
| 10-02 | Plugin extensions DevDay 演讲要点 | 插件可从 ChatGPT 侧栏/侧面板/自定义文件查看器启动;支持 Sign in with ChatGPT;自定义 onboarding skill |
| 10-01 | The eternal complement | 探讨 AI 在突破性想法背后的常规执行中可能最为重要 |
| 10-01 | Albertsons reimagining retail | Albertsons 使用 ChatGPT Enterprise 和 OpenAI API 提升团队效率和购物体验 |
| 10-01 | The Den frees up 10-15 hours a week | 社交俱乐部用 ChatGPT Work 将拨款申请从 3 天缩短至 2 小时,酒牌材料从 4 天缩短至 3 小时 |
| 10-01 | Sam Altman: AI subscription should work wherever you need | 阐述 Sign in with ChatGPT 的初衷 |
| 09-30 | Disrupting a coordinated model-distillation campaign | OpenAI 中断了一起提取受保护模型推理的蒸馏活动,加强防御 |
| 09-30 | Helping small businesses put AI to work | 与 America's SBDC 合作扩展小企业 AI 培训 |
| 09-29 | DevDay 2026 Recap | 20+ 项公告:GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具 |
| 09-29 | Introducing GPT-6.1 Sol | 近 Astra 级编码/计算机使用/专业工作能力,价格为 Astra 标准 API 的五分之一 |
| 09-29 | Introducing dots | 跨复杂项目和日常任务持续工作的主动式助手 |
| 09-28 | How we will do better for Australia | 就澳大利亚政府网站相关事件道歉并公布强化措施 |
| 09-28 | Towards safety cases for frontier AI training | 前沿 AI 训练安全案例早期指南:技术保障、运营实践、错配调查 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | Claude Code v2.1.288 released | Mods 新增 $.ui.selection():返回全屏模式下最近选中的文本,选中范围在单行内时返回该行 |
| 10-01 | Claude Code v2.1.287 released | Claude Mods 上线:插件可修改更深层的 Claude Code 行为 |
| 10-01 | Boris: Mods are absolutely insane | 通过 prompt 即可自定义 Claude 的工作方式和外观;Mods 以插件形式分享,/plugin 安装;可用少量 TypeScript 编写或让 Claude 构建 |
| 10-01 | Anthropic Science Blog: Claude-shaped science | 哈佛物理学家 Matthew Schwartz 用 Claude 做精确科学计算工具包,Claude 发现了生态学、群体遗传学等十余个领域的关联 |
| 09-30 | Claude.dev 开发者门户上线 | Claude.dev 成为面向开发者的新主页,含工程深度文章、Claude Code/API 指南、团队经验分享 |
| 09-28 | Claude Code v2.1.284 released | 新增 Claude Sonnet 5.5(claude-sonnet-5-5),成为 Anthropic API 默认 Sonnet 模型;1M 上下文,$2/$10 per Mtok,缓存读 $0.20/Mtok |
| 09-28 | Claude Sonnet 5.5 发布 | Claude 5.5 家族第二个模型;比 Sonnet 5 快 30%+,多数工作成本低 30% |
| 09-25 | Yes, Claude can do Nine Loops | Claude 在简化模型中完成九圈散射振幅计算(此前纪录为八圈),总成本数千美元;Lance Dixon 独立验证 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | The latest AI news we announced in September 2026 | 9 月 AI 更新视频汇总 |
| 10-01 | Project Suncatcher 卫星发射 | Google 与 Planet 合作,在 SpaceX Transporter-18 上发射搭载 4 颗 TPU 的原型卫星,研究太空 ML 基础设施可行性 |
| 09-30 | Gemini 4 Argon 内部基础设施优化 | Argon agents 已为 Google 数据中心释放 300+ TiB 内存;C/C++ → Rust 迁移达 80 万行内核代码;视频解码器用安全 Rust 替换 3.2 万行 SIMD,提速 2.7 倍 |
| 09-30 | Gemini 4 Argon 登顶 Text Arena | 1525 分排名 Text Arena #1;比 #2 的 Claude Opus 4.6 (High) 高 20 分;混合成本 $8/MToken,为最具性价比模型 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | DeepSeek Harness 桌面版发布 | macOS 和 Windows 打包桌面版上线;Linux 用户可通过 npm @deepseek-ai/dsh 安装 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | AI finally beat the best Stratego player in history | 在信息不完全对等游戏 Stratego 中 AI 首次击败人类最佳玩家,且预算有限 |
| 10-02 | Greg Kroah-Hartman – Security in the LLM Age | Linux 内核安全维护者谈 LLM 时代的安全挑战 |
| 10-02 | From the creator of Redis; run LLM locally with ds4 | Redis 作者新项目 ds4,本地运行 LLM |
| 日期 | 人物 | 要点 |
|---|---|---|
| 10-02 | Andrej Karpathy — "Land or Water?" eval | 给 LLM 经纬度文本问"陆地还是水面",16,200 次测试画图,模型从压缩互联网中学到了地理 |
| 10-02 | Andrej Karpathy — 理解 LLM 输出的方法 | 建议用 ASD-STE100 受控语言、图表、HTML 网页、定制解释视频等方式理解 LLM 输出 |
| 09-29 | Simon Willison — DevDay 2026 live blog | 现场 live blog 记录 DevDay 主题演讲 |
AA / Intelligence — 本期有变动(新模型入榜)
| 变化 | 模型 | 分数 | 排名 |
|---|---|---|---|
| 🆕 新入榜 | Claude Opus 5.5 (Max, Default Fallback) | 57.6 | #1 |
| 🆕 新入榜 | Claude Fable 5.1 (Max, Default Fallback) | 53.4 | #2 |
| 🆕 新入榜 | Claude Opus 5 (Xhigh) | 49.7 | #7 |
| 🆕 新入榜 | Claude Fable 5.1 (Medium, Default Fallback) | 48.9 | #8 |
| 🆕 新入榜 | Claude Fable 5.1 (Low, Default Fallback) | 46.8 | #9 |
| 🆕 新入榜 | Claude Sonnet 5.5 (High, Default Fallback) | 46.8 | #10 |
| 🆕 新入榜 | Claude Opus 5.5 (Low, Default Fallback) | 42.3 | #15 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| #1 | Claude Opus 5.5 (Max, Default Fallback) | 57.6 |
| #2 | Claude Fable 5.1 (Max, Default Fallback) | 53.4 |
| #3 | GPT-6 Astra (Max) | 52.7 |
LMArena / Overall — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| #1 | gemini-4-argon-high | 1524.8 |
| #2 | claude-opus-4-6-high | 1505.5 |
| #3 | claude-fable-5-high | 1504.9 |
AA / Agentic — 本期有变动(新模型入榜)
| 变化 | 模型 | 分数 | 排名 |
|---|---|---|---|
| 🆕 新入榜 #1 | Claude Fable 5.1 (Max, Default Fallback) | 57.9 | #1 |
| 🆕 新入榜 | Claude Opus 5 (Xhigh) | 55.6 | #2 |
| 🆕 新入榜 | Claude Fable 5.1 (Medium, Default Fallback) | 50.2 | #7 |
| 🆕 新入榜 | Claude Fable 5.1 (Low, Default Fallback) | 47.1 | #8 |
| 🆕 新入榜 | Claude Sonnet 5 (Max) | 43.6 | #9 |
| 🆕 新入榜 | Claude Opus 5 (Low) | 36.0 | #13 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| #1 | Claude Fable 5.1 (Max, Default Fallback) | 57.9 |
| #2 | Claude Opus 5 (Xhigh) | 55.6 |
| #3 | GPT-6 Astra (Max) | 51.0 |
AA / Coding — 本期有变动(新模型入榜)
| 变化 | 模型 | 分数 | 排名 |
|---|---|---|---|
| 🆕 新入榜 #1 | Claude Fable 5.1 (Max, Default Fallback) | 81.6 | #1 |
| 🆕 新入榜 | Claude Fable 5.1 (Medium, Default Fallback) | 77.1 | #2 |
| 🆕 新入榜 | Claude Opus 5 (Xhigh) | 77.0 | #3 |
| 🆕 新入榜 | Claude Fable 5.1 (Low, Default Fallback) | 75.2 | #6 |
| 🆕 新入榜 | Claude Sonnet 5 (Max) | 71.5 | #11 |
| 🆕 新入榜 | Claude Opus 5 (Low) | 66.9 | #15 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| #1 | Claude Fable 5.1 (Max, Default Fallback) | 81.6 |
| #2 | Claude Fable 5.1 (Medium, Default Fallback) | 77.1 |
| #3 | Claude Opus 5 (Xhigh) | 77.0 |
SWE-bench Verified — 本期有变动(排名调整)
| 变化 | 模型 | 分数 | 排名变化 |
|---|---|---|---|
| ↑ | Claude 4 Sonnet + o4-mini | 74.4 | #10 → #9 |
| ↓ | GPT-5 | 74.4 | #9 → #10 |
| ↑ | Claude 3.5 Haiku | 40.6 | #34 → #33 |
| ↓ | LLama 3.1 70B Critic | 40.6 | #33 → #34 |
当前 Top 3:
| 排名 | 模型 + scaffold | 分数 |
|---|---|---|
| #1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| #2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| #3 | Doubao-Seed-Code (TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Fable 5.1 系列集中入榜并直接登顶 aa coding (81.6) 和 aa agentic (57.9):Anthropic 一次性将 Fable 5.1 的 Max / Medium / Low 三个档位投入榜单,Max 档在 coding 和 agentic 两个实战维度均超过 GPT-6 Astra (Max)(coding 76.9、agentic 51.0),说明 Anthropic 当前在"干活"场景的模型性价比策略具有明显优势——但 intelligence 榜首仍被自家 Opus 5.5 (57.6) 占据而非 Fable,表明天花板和主力之间存在刻意分层。
Tibo 确认 GPT-6.1 Sol "back to running at expected speeds after the massive load spike in the first two days":这意味着 Sol 发布前两天的实际体验劣于预期,并非模型能力问题而是基础设施容量问题;全局 reset 已对全量付费账户生效,可作为 GPT-6.1 Sol 正式可用的实际时间节点。
Sam Altman 确认与 Cerebras "a deep engagement pushing on the frontiers of speed":结合 GPT-6.1 Sol 刚经历负载激增后恢复这一背景,OpenAI 在推理基础设施层面对第三方芯片厂商的依赖正在加深,Altman 选择在 Sol 速度恢复同日公开表态,信号明确。