← 返回列表
SILASCODING · AI 情报

AI 日报 2026-10-03

2026-10-03 08:51 CST
快速版 完整版

核心速览

【Google DeepMind】Gemini 4 Argon 登顶 Text Arena 第一

Gemini 4 Argon (High) 以 1525 分登顶 Text Arena 第一,领先第二名 Claude Opus 4.6 (High) 20 分,同时在编码、硬提示、指令遵循等子项均排第一,成本仅 $8/MToken,成为最具性价比的模型。这是 Google 从上一代 Gemini 3.8 Flash (第 11 名) 到榜首的巨大跨越。

Gemini 4 Argon 发布


【OpenAI】DevDay 2026 回顾:20+ 项公告

DevDay 2026 为史上最大规模,涵盖 GPT-6 Astra、ChatGPT、Codex、API 安全更新及开发者新工具等超过 20 项公告。同期发布 GPT-6.1 Sol,提供接近 Astra 的编码和计算机操控能力,API 价格仅为 Astra 标准价的五分之一。

DevDay 2026 Recap | GPT-6.1 Sol


【Anthropic】Claude Sonnet 5.5 发布:提速 30%,降价 30%

Claude 5.5 家族第二款模型 Sonnet 5.5 发布,较 Sonnet 5 推理速度提升 30%+,多数场景成本降低 30%。1M 上下文窗口,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。已设为 Anthropic API 默认 Sonnet 模型。

Claude Sonnet 5.5


【Anthropic】Claude Code 推出 Mods 插件系统

Claude Code v2.1.287 引入 Mods 功能,允许开发者通过 TypeScript 自定义 Claude 的行为、UI 和功能,并可作为插件分享。v2.1.288 补充了 $.ui.selection() API 用于获取全屏模式下选中文本。

Claude Code v2.1.287


【DeepSeek】DeepSeek Harness 桌面版发布

DeepSeek 发布 macOS 和 Windows 桌面版 Harness 工具,Linux 用户可通过 npm 包 @deepseek-ai/dsh 获取。该工具面向本地 LLM 运行场景。

DeepSeek Harness


重大 Benchmark 变化

Benchmark 模型 变化 详情
Text Arena Gemini 4 Argon (High) 新登顶 #1 1525 分,领先第二名 Claude Opus 4.6 (High) +20 分;Coding/Hard Prompts/指令遵循/创意写作均为 #1
Code Arena: WebDev Gemini 4 Argon (High) #29 → #8(+21 位) 1679 分,较前代 Gemini 3.8 Flash (High) +96 分
aa Agentic Claude Fable 5.1 (Max) 新模型 #1 57.9 分,领先第二名 Claude Opus 5 (Xhigh) 2.3 分
aa Coding Claude Fable 5.1 (Max) 新模型 #1 81.6 分,领先第二名 Fable 5.1 (Medium) 4.5 分
aa Intelligence Claude Opus 5.5 (Max) 新模型 #1 57.6 分,领先第二名 Fable 5.1 (Max) 4.2 分

关键判断:Gemini 4 Argon 以 $8/MToken 的成本同时拿下 Text Arena 榜首和 Code Arena 大幅跃升(+21 位),在性价比维度上对 OpenAI GPT-6 系列和 Anthropic Claude 5.5 系列形成直接定价压力。与此同时,Anthropic 通过 Fable 5.1 和 Opus 5.5 分别在 agentic/coding 和 intelligence 榜单拿下第一,三家头部模型在各细分赛道上已无明显短板。

快速预览

  • Anthropic 的 Claude Fable 5.1 新进入 aa coding / agentic / intelligence 多个榜单,coding 和 agentic 均直接登顶
  • OpenAI 发布 GPT-6 家族模型选择指南;Tibo 确认 GPT-6.1 Sol 已恢复正常速度,全量付费账户完成全局重置
  • Claude Code v2.1.288 发布,Mods 系统新增 $.ui.selection() API;v2.1.287 引入可修改深层行为的 Claude Mods
  • DeepSeek Harness 桌面版上线 macOS / Windows;Sam Altman 确认与 Cerebras 深度合作推进推理速度
  • Google 发布 9 月 AI 更新回顾;Demis Hassabis 转发 Gemini 4 Argon 内部基础设施优化成果

新闻

OpenAI

日期 标题 要点
10-03 Building with the Agents API? Catch up on what's new Agents API 周更新:Computer use 一行 API 启动浏览器+agent;Bedrock Managed Agents 上线;GPT-6.1 Sol 接入;环境尺寸可选轻量/高配;Dashboard 支持子 agent 配置;环境可跨 session 复用;99.97% 轮次可靠性
10-02 A model guide for the GPT-6 family 面向初创企业的 GPT-6 模型选择指南:模型选型、推理力度调节、提示与技能改进、工具协调、生产工作流准备
10-02 Chatham scales its capital markets expertise with OpenAI Chatham Financial 使用 Codex 和 GPT-5.6,将交易验证从 30 分钟缩短至 4 分钟以内
10-02 Sam Altman on Cerebras partnership Altman 确认 Cerebras 是密切合作伙伴,双方在推进速度前沿方面有深度合作
10-02 Sam Altman: dot is my favorite OpenAI product Altman 称 dot 每天都有可感知的进步,已接管他不愿做的任务
10-02 Tibo: Reset all propagated 全量付费 ChatGPT 账户全局重置已生效;GPT-6.1 Sol 在前两天负载激增后已恢复正常速度
10-02 dots + Codex 协同使用 dots 可跨应用保持上下文、协调 Codex 任务并标记需关注事项;开发者反馈 dots 是最喜欢的 Codex 使用方式
10-02 Plugin extensions DevDay 演讲要点 插件可从 ChatGPT 侧栏/侧面板/自定义文件查看器启动;支持 Sign in with ChatGPT;自定义 onboarding skill
10-01 The eternal complement 探讨 AI 在突破性想法背后的常规执行中可能最为重要
10-01 Albertsons reimagining retail Albertsons 使用 ChatGPT Enterprise 和 OpenAI API 提升团队效率和购物体验
10-01 The Den frees up 10-15 hours a week 社交俱乐部用 ChatGPT Work 将拨款申请从 3 天缩短至 2 小时,酒牌材料从 4 天缩短至 3 小时
10-01 Sam Altman: AI subscription should work wherever you need 阐述 Sign in with ChatGPT 的初衷
09-30 Disrupting a coordinated model-distillation campaign OpenAI 中断了一起提取受保护模型推理的蒸馏活动,加强防御
09-30 Helping small businesses put AI to work 与 America's SBDC 合作扩展小企业 AI 培训
09-29 DevDay 2026 Recap 20+ 项公告:GPT-6 Astra、ChatGPT、Codex、API、安全及开发者工具
09-29 Introducing GPT-6.1 Sol 近 Astra 级编码/计算机使用/专业工作能力,价格为 Astra 标准 API 的五分之一
09-29 Introducing dots 跨复杂项目和日常任务持续工作的主动式助手
09-28 How we will do better for Australia 就澳大利亚政府网站相关事件道歉并公布强化措施
09-28 Towards safety cases for frontier AI training 前沿 AI 训练安全案例早期指南:技术保障、运营实践、错配调查

Anthropic

日期 标题 要点
10-02 Claude Code v2.1.288 released Mods 新增 $.ui.selection():返回全屏模式下最近选中的文本,选中范围在单行内时返回该行
10-01 Claude Code v2.1.287 released Claude Mods 上线:插件可修改更深层的 Claude Code 行为
10-01 Boris: Mods are absolutely insane 通过 prompt 即可自定义 Claude 的工作方式和外观;Mods 以插件形式分享,/plugin 安装;可用少量 TypeScript 编写或让 Claude 构建
10-01 Anthropic Science Blog: Claude-shaped science 哈佛物理学家 Matthew Schwartz 用 Claude 做精确科学计算工具包,Claude 发现了生态学、群体遗传学等十余个领域的关联
09-30 Claude.dev 开发者门户上线 Claude.dev 成为面向开发者的新主页,含工程深度文章、Claude Code/API 指南、团队经验分享
09-28 Claude Code v2.1.284 released 新增 Claude Sonnet 5.5(claude-sonnet-5-5),成为 Anthropic API 默认 Sonnet 模型;1M 上下文,$2/$10 per Mtok,缓存读 $0.20/Mtok
09-28 Claude Sonnet 5.5 发布 Claude 5.5 家族第二个模型;比 Sonnet 5 快 30%+,多数工作成本低 30%
09-25 Yes, Claude can do Nine Loops Claude 在简化模型中完成九圈散射振幅计算(此前纪录为八圈),总成本数千美元;Lance Dixon 独立验证

Google

日期 标题 要点
10-02 The latest AI news we announced in September 2026 9 月 AI 更新视频汇总
10-01 Project Suncatcher 卫星发射 Google 与 Planet 合作,在 SpaceX Transporter-18 上发射搭载 4 颗 TPU 的原型卫星,研究太空 ML 基础设施可行性
09-30 Gemini 4 Argon 内部基础设施优化 Argon agents 已为 Google 数据中心释放 300+ TiB 内存;C/C++ → Rust 迁移达 80 万行内核代码;视频解码器用安全 Rust 替换 3.2 万行 SIMD,提速 2.7 倍
09-30 Gemini 4 Argon 登顶 Text Arena 1525 分排名 Text Arena #1;比 #2 的 Claude Opus 4.6 (High) 高 20 分;混合成本 $8/MToken,为最具性价比模型

DeepSeek

日期 标题 要点
10-02 DeepSeek Harness 桌面版发布 macOS 和 Windows 打包桌面版上线;Linux 用户可通过 npm @deepseek-ai/dsh 安装

Hacker News 热门

日期 标题 要点
10-02 AI finally beat the best Stratego player in history 在信息不完全对等游戏 Stratego 中 AI 首次击败人类最佳玩家,且预算有限
10-02 Greg Kroah-Hartman – Security in the LLM Age Linux 内核安全维护者谈 LLM 时代的安全挑战
10-02 From the creator of Redis; run LLM locally with ds4 Redis 作者新项目 ds4,本地运行 LLM

个人观点

日期 人物 要点
10-02 Andrej Karpathy — "Land or Water?" eval 给 LLM 经纬度文本问"陆地还是水面",16,200 次测试画图,模型从压缩互联网中学到了地理
10-02 Andrej Karpathy — 理解 LLM 输出的方法 建议用 ASD-STE100 受控语言、图表、HTML 网页、定制解释视频等方式理解 LLM 输出
09-29 Simon Willison — DevDay 2026 live blog 现场 live blog 记录 DevDay 主题演讲

Benchmark 快照

行业格局

AA / Intelligence — 本期有变动(新模型入榜)

变化 模型 分数 排名
🆕 新入榜 Claude Opus 5.5 (Max, Default Fallback) 57.6 #1
🆕 新入榜 Claude Fable 5.1 (Max, Default Fallback) 53.4 #2
🆕 新入榜 Claude Opus 5 (Xhigh) 49.7 #7
🆕 新入榜 Claude Fable 5.1 (Medium, Default Fallback) 48.9 #8
🆕 新入榜 Claude Fable 5.1 (Low, Default Fallback) 46.8 #9
🆕 新入榜 Claude Sonnet 5.5 (High, Default Fallback) 46.8 #10
🆕 新入榜 Claude Opus 5.5 (Low, Default Fallback) 42.3 #15

当前 Top 3:

排名 模型 分数
#1 Claude Opus 5.5 (Max, Default Fallback) 57.6
#2 Claude Fable 5.1 (Max, Default Fallback) 53.4
#3 GPT-6 Astra (Max) 52.7

LMArena / Overall — 本期无变动

排名 模型 分数
#1 gemini-4-argon-high 1524.8
#2 claude-opus-4-6-high 1505.5
#3 claude-fable-5-high 1504.9

干活选型

AA / Agentic — 本期有变动(新模型入榜)

变化 模型 分数 排名
🆕 新入榜 #1 Claude Fable 5.1 (Max, Default Fallback) 57.9 #1
🆕 新入榜 Claude Opus 5 (Xhigh) 55.6 #2
🆕 新入榜 Claude Fable 5.1 (Medium, Default Fallback) 50.2 #7
🆕 新入榜 Claude Fable 5.1 (Low, Default Fallback) 47.1 #8
🆕 新入榜 Claude Sonnet 5 (Max) 43.6 #9
🆕 新入榜 Claude Opus 5 (Low) 36.0 #13

当前 Top 3:

排名 模型 分数
#1 Claude Fable 5.1 (Max, Default Fallback) 57.9
#2 Claude Opus 5 (Xhigh) 55.6
#3 GPT-6 Astra (Max) 51.0

AA / Coding — 本期有变动(新模型入榜)

变化 模型 分数 排名
🆕 新入榜 #1 Claude Fable 5.1 (Max, Default Fallback) 81.6 #1
🆕 新入榜 Claude Fable 5.1 (Medium, Default Fallback) 77.1 #2
🆕 新入榜 Claude Opus 5 (Xhigh) 77.0 #3
🆕 新入榜 Claude Fable 5.1 (Low, Default Fallback) 75.2 #6
🆕 新入榜 Claude Sonnet 5 (Max) 71.5 #11
🆕 新入榜 Claude Opus 5 (Low) 66.9 #15

当前 Top 3:

排名 模型 分数
#1 Claude Fable 5.1 (Max, Default Fallback) 81.6
#2 Claude Fable 5.1 (Medium, Default Fallback) 77.1
#3 Claude Opus 5 (Xhigh) 77.0

SWE-bench Verified — 本期有变动(排名调整)

变化 模型 分数 排名变化
↑ Claude 4 Sonnet + o4-mini 74.4 #10 → #9
↓ GPT-5 74.4 #9 → #10
↑ Claude 3.5 Haiku 40.6 #34 → #33
↓ LLama 3.1 70B Critic 40.6 #33 → #34

当前 Top 3:

排名 模型 + scaffold 分数
#1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
#2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
#3 Doubao-Seed-Code (TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Claude Fable 5.1 系列集中入榜并直接登顶 aa coding (81.6) 和 aa agentic (57.9):Anthropic 一次性将 Fable 5.1 的 Max / Medium / Low 三个档位投入榜单,Max 档在 coding 和 agentic 两个实战维度均超过 GPT-6 Astra (Max)(coding 76.9、agentic 51.0),说明 Anthropic 当前在"干活"场景的模型性价比策略具有明显优势——但 intelligence 榜首仍被自家 Opus 5.5 (57.6) 占据而非 Fable,表明天花板和主力之间存在刻意分层。

  2. Tibo 确认 GPT-6.1 Sol "back to running at expected speeds after the massive load spike in the first two days":这意味着 Sol 发布前两天的实际体验劣于预期,并非模型能力问题而是基础设施容量问题;全局 reset 已对全量付费账户生效,可作为 GPT-6.1 Sol 正式可用的实际时间节点。

  3. Sam Altman 确认与 Cerebras "a deep engagement pushing on the frontiers of speed":结合 GPT-6.1 Sol 刚经历负载激增后恢复这一背景,OpenAI 在推理基础设施层面对第三方芯片厂商的依赖正在加深,Altman 选择在 Sol 速度恢复同日公开表态,信号明确。

来源 · 111 条