← 返回列表
SILASCODING · AI 情报

AI 日报 2026-10-02

2026-10-02 08:41 CST
快速版 完整版

核心速览

【Google DeepMind】Gemini 4 Argon 发布,空降 lmarena 第一

Google DeepMind 发布新前沿模型 Gemini 4 Argon,在 lmarena overall 以 1524 分直接登顶 #1,领先第二名约 20 分。幻觉率仅 15%(GPT-6 Astra 45%、Opus 5.5 59%),已在 Google 数据中心释放 300+ TiB 内存、完成 80 万行 C/C++ → Rust 迁移。通过 Fairwind 程序向受信测试者开放。Argon 在幻觉率上的优势可能改变对事实准确性敏感的企业选型方向。

原文链接

【OpenAI】DevDay 2026:20+ 项公告集中发布

OpenAI DevDay 2026 发布超过 20 项公告,包括 GPT-6 Astra、Dots 主动代理、Codex、新 API 及安全工具。Dots 可跨复杂项目 24/7 持续工作;ChatGPT Sites 现可托管 MCP 服务器并支持插件扩展;Codex Security Cloud 升级,默认包含 Daybreak Blue 网安模型,可扫描整库并自动修复。

DevDay 2026 Recap

【Anthropic】Claude Sonnet 5.5 上线

Claude Sonnet 5.5 发布,相较 Sonnet 5 速度提升 30%+、成本降低 30%。已作为 Claude Code v2.1.284 默认 Sonnet 模型,支持 1M 上下文,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。

原文链接

【Anthropic】Claude Code v2.1.287:Mods 插件系统上线

Claude Code 新增 Mods 功能,插件可修改更深层行为与 UI。用户可用几行 TypeScript 编写或让 Claude 自动生成,通过 /plugin 安装,并作为插件分享给他人。

原文链接


重大 Benchmark 变化

模型 Benchmark 变动
gemini-4-argon-high lmarena overall 🆕 新上榜直登 #1,分数 1524.84
deepseek-v4.1-flash-max lmarena overall 排名 29→40(−11),分数 1476.51→1472.77
gemini-3.5-flash-medium lmarena overall 排名 36→29(+7),分数 1474.0→1476.2
gpt-6-sol-max lmarena overall 排名 60→66(−6),分数 1457.48→1455.82
gemini-3.5-flash-lite lmarena overall 排名 65→70(−5),分数 1456.03→1454.11

Gemini 4 Argon 以 1524 分空降 lmarena 第一,比此前 #1 的 Claude Opus 5.5 High(1503.98)高出约 21 分,直接将 Opus 5.5 High 挤至第四。这是本周榜单最大变动。

快速预览

  • Gemini 4 Argon (High) 新入 LMArena 总榜即登顶 #1(1525 分),Claude Opus 5.5-high 从 #1 跌至 #4
  • Claude Code v2.1.287 发布 Mods 插件系统,可用 TypeScript 自定义行为与 UI
  • OpenAI 披露挫败一起针对模型推理能力的蒸馏攻击,并加固防御
  • Sam Altman 称 GPT-6.1 Sol 为史上增长最快模型,已扩容解决负载问题
  • Anthropic Science Blog:哈佛物理学家用 Claude 做精确计算,发现跨学科关联

详细正文

OpenAI

日期 标题 要点
10-01 The eternal complement 探讨 AI 对突破性想法背后日常执行工作的价值
10-01 How Albertsons Companies is reimagining retail Albertsons 使用 ChatGPT Enterprise 和 OpenAI API 加速团队工作
10-01 The Den frees up 10-15 hours a week 社交俱乐部用 ChatGPT Work 将拨款申请从 3 天缩至 2 小时
09-30 Disrupting a coordinated model-distillation campaign OpenAI 披露挫败一起提取受保护模型推理的蒸馏攻击,正在加强防御
09-30 Helping small businesses put AI to work 与 America's SBDC 合作提供 AI 培训,发布小企业 AI 使用报告
09-29 Introducing GPT-6.1 Sol 近 Astra 级编码/计算机使用能力,API 价格为 Astra 的五分之一
09-29 DevDay 2026 Recap 超过 20 项公告:GPT-6 Astra、Codex、API、安全工具等
09-29 Introducing dots 主动式助手,可跨复杂项目和日常任务持续工作

Sam Altman 在 X 上表示 Sign in with ChatGPT 的初衷是让用户在任何地方使用 AI 订阅;并称 GPT-6.1 Sol 是史上增长最快模型,此前负载偏慢已改善。

OpenAI Developers 账号在 X 上大量转发 DevDay 后续:ChatGPT Sites 可托管 MCP 服务器、可分享的个人资料页、Latent.Space 对 OpenAI Agent Stack 的深度分析(涵盖 Computer Use、Dots、Decisions API、UltraFast 推理等)。Codex Security Cloud 升级,默认包含 Daybreak Blue 网络安全模型,可扫描整个 GitHub 仓库并持续审查新提交。

Anthropic / Claude Code

日期 标题 要点
10-01 Claude Code v2.1.287 Claude Mods:插件可修改更深层行为,支持 TypeScript 编写、/plugin 安装
09-30 Claude Code v2.1.286 权限请求堆积时显示计数(如 "2 of 5")
09-29 Claude Code v2.1.285 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch
09-28 Claude Code v2.1.284 新增 Claude Sonnet 5.5 为默认 Sonnet 模型;1M 上下文,$2/$10 per Mtok

Anthropic X 发布 Science Blog 客座文章:哈佛物理学家 Matthew Schwartz 指出 LLM 与科学之间存在"阻抗失配",他构建精确计算工具包后,Claude 发现了与生态学、群体遗传学等十余个领域的关联。

Boris Cherny 在 X 上称 Mods 非常强大,可仅通过提示词自定义 Claude 的工作方式和外观,并以插件形式分享。

Google / DeepMind

日期 标题 要点
09-30 Demis Hassabis 转发 Gemini 4 Argon 发布 Gemini 4 Argon 登顶 Text Arena #1(1525 分),在编码、硬提示、指令遵循等子项均排第一
09-30 Demis 转发 hallucination 数据 Gemini 4 Argon 幻觉率 15%,远低于 GPT-6 Astra(45%)和 Opus 5.5(59%)
09-30 Demis 转发 Argon agent 基础设施应用 Argon agent 已在 Google 数据中心释放超 300 TiB 内存,完成 80 万行 C/C++→Rust 迁移
09-28 Future Vision XPRIZE 获奖短片 公布获奖作品 The Gifted

Google DeepMind 还在 X 上转发了 Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中 GA,支持视频头像、流畅对话和工具调用。

其他声音

Andrej Karpathy(10-02):分享了理解 LLM 输出的技巧——从 ASD-STE100 受控语言写作,到图表、HTML 网页,再到可弃用的定制讲解视频,强调随着智能和代码变得充沛,可以索取大规模一次性软件制品来辅助理解。

Simon Willison(09-29):在 OpenAI DevDay 现场进行直播博客。


Benchmark 快照与榜单变化

行业格局

Artificial Analysis / Intelligence(综合智能指数)

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5.5 (Adaptive, Max, Default Fallback) 57.6
2 Claude Fable 5.1 (Adaptive, Max, Default Fallback) 53.4
3 GPT-6 Astra (Max) 52.7

LMArena / Overall(人类偏好总榜)

本期有重大变动:

变化 模型 上期 → 本期 上期分数 → 本期分数
🆕 新入榜 #1 gemini-4-argon-high — → #1 — → 1524.84
⬇️ #1→#4 claude-opus-5.5-high #1 → #4 1508.55 → 1503.98
⬆️ #36→#29 gemini-3.5-flash-medium #36 → #29 1474.00 → 1476.20
⬇️ #29→#40 deepseek-v4.1-flash-max #29 → #40 1476.51 → 1472.77
⬇️ #26→#30 gpt-6-astra-max #26 → #30 1477.72 → 1476.18
⬆️ #92→#88 grok-4.7-xhigh #92 → #88 1439.07 → 1442.45
⬆️ #25→#24 qwen3.8-max #25 → #24 1479.37 → 1480.86
— 分数变 claude-fable-5-high #3 → #3 1503.82 → 1504.87

仅列出显著变动,完整变更含 60 余项排名微调。

当前 Top 5:

排名 模型 分数
1 gemini-4-argon-high 1524.84
2 claude-opus-4-6-high 1505.49
3 claude-fable-5-high 1504.87
4 claude-opus-5.5-high 1503.98
5 claude-opus-4-7-high 1501.69

干活选型

Artificial Analysis / Agentic(智能体能力)

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive, Max, Default Fallback) 57.9
2 Claude Opus 5 (Adaptive, Xhigh Effort) 55.6
3 GPT-6 Astra (Max) 51.0

Artificial Analysis / Coding(编码能力)

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive, Max, Default Fallback) 81.6
2 Claude Fable 5.1 (Adaptive, Medium, Default Fallback) 77.1
3 Claude Opus 5 (Adaptive, Xhigh Effort) 77.0

SWE-bench Verified(软件工程基准)

本期有微调(同分换位):

变化 模型 上期 → 本期
⬆️ #10→#9 Claude 4 Sonnet + o4-mini #10 → #9(分数不变 74.4)
⬇️ #9→#10 GPT-5 #9 → #10(分数不变 74.4)
⬆️ #34→#33 Claude 3.5 Haiku #34 → #33(分数不变 40.6)
⬇️ #33→#34 LLama 3.1 70B Critic #33 → #34(分数不变 40.6)

当前 Top 3:

排名 模型 + 框架 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Gemini 4 Argon (High) 首日即登顶 LMArena #1:以 1524.84 分直接超越此前 #1 的 Claude Opus 5.5-high(后者降至 1503.98),并据 Arena.ai 数据在编码、硬提示、指令跟随等所有子项均排第一,同时幻觉率仅 15%(GPT-6 Astra 为 45%)。这是 LMArena 近期最大的一次榜单震动,Google 在 Argon agent 上已实现 300 TiB 内存释放和 80 万行 Rust 迁移的内部生产应用,说明该模型不仅刷榜,已在 Google 自有基础设施中产出工程价值。

  2. Claude Code 推出 Mods 插件系统:v2.1.287 允许用几行 TypeScript 修改 Claude Code 的行为、UI 和功能,并通过 /plugin 安装。这使 Claude Code 从封闭工具转向可扩展平台,配合同日 Claude.dev 开发者门户上线,Anthropic 正在围绕开发者生态构建壁垒。

  3. OpenAI 披露挫败蒸馏攻击:Disrupting a coordinated model-distillation campaign 明确表示有对手试图提取 GPT 模型的受保护推理能力,OpenAI 已采取反制措施并加固防御。这表明前沿模型的 IP 保护已从理论讨论进入实战阶段。

来源 · 106 条