← 返回列表
SILASCODING · AI 情报

AI 日报 2026-10-01

2026-10-01 08:38 CST
快速版 完整版

核心速览

【Google DeepMind】Gemini 4 Argon 登顶 Text Arena 与 Vals Index

Google DeepMind 发布 Gemini 4 Argon,在 Text Arena 以 1525 分登顶 #1,领先第二名 Claude Opus 4.6 (High) 20 分;在 Code Arena: WebDev 从 #29 跃升至 #8(+96 分),混合成本 $8/MToken,为当前性价比最高模型。在 Vals Index 同样拿下 #1(68.9%),系 Gemini 首次登顶该榜。该模型目前通过 Fairwind Program 向受信任测试者开放。

🔗 HN 讨论 | Demis Hassabis 转发


【OpenAI】DevDay 2026:20+ 项公告集中发布

DevDay 2026 公布超过 20 项公告,涵盖 GPT-6 Astra、Dots 主动式 AI 助手、Codex 更新、Decisions API、UltraFast 推理(8x 速度)、Computer Use 及 B2B Marketplace 等。GPT-6.1 Sol 同步发布,提供接近 Astra 的能力,API 价格仅为 Astra 的 1/5,并支持 95% 缓存读取折扣。GPT-6 Astra 在多家企业客户中已验证效率提升:Basis 税务工作簿完成速度较 GPT-5.6 Sol 快 2 倍,Parallel 研究时间与成本均减半。

🔗 DevDay Recap | GPT-6.1 Sol


【OpenAI】Dots:24/7 主动式 AI 助手上线

Dots 是可跨复杂项目和日常任务持续工作的主动式 AI 助手,具备自主操作计算机的能力(用户可查看 dot 的操作过程并保持控制)。Sam Altman 称其目标是让用户将注意力收回至更高层级的工作。开发者 Tibo Louis-Étienne 已展示 dot 自主搜索网络图片并进行绘制的演示。

🔗 Introducing Dots


【Anthropic】Claude Sonnet 5.5 发布,成为 Claude Code 默认模型

Claude Sonnet 5.5 为 Claude 5.5 家族第二款模型,较 Sonnet 5 速度提升 30%+,多数场景成本降低 30%,支持 1M 上下文,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。已作为 Claude Code v2.1.284 的默认 Sonnet 模型上线。Opus 5.5 于一周前发布,性能对标 Fable 5.1,成本较 Opus 5 降低 40%。

🔗 Sonnet 5.5 公告 | Claude Code v2.1.284


重大 Benchmark 变化

Benchmark 模型 变动
Text Arena Gemini 4 Argon (High) 新登顶 #1(1525 分),领先 #2 Claude Opus 4.6 (High) 20 分;在编程、硬提示、指令遵循、长查询、创意写作均列 #1
Code Arena: WebDev Gemini 4 Argon (High) #29 → #8(+96 分),系排名变动≥5 的重大跃升
Vals Index Gemini 4 Argon #1(68.9%),Gemini 首次登顶该榜
AA Agentic GPT-6 Astra (Max) 新入榜 #3(51.0 分);Grok 4.6 (Medium) 新入榜 #5(50.6 分)
AA Coding GPT-6 Astra (Max) 新入榜 #4(76.9 分);GPT-6 Astra (Xhigh) #5(75.9 分)
AA Intelligence GPT-6 Astra (Max) 新入榜 #3(52.7 分);GPT-6.1 Sol (Xhigh) #5(51.0 分)

Gemini 4 Argon 在 Text Arena 以 +20 分优势压制 Claude Opus 4.6,同时混合成本仅 $8/MToken,直接重写了性价比 Pareto 前沿。GPT-6 Astra (Max) 在 AA 三项子榜均进入前 5,但未能超越 Argon 在 Text Arena 的表现。

快速预览

  • Google DeepMind 发布 Gemini 4 Argon,以 1525 分登顶 Text Arena #1,同时拿下 Vals Index #1(68.9%)
  • OpenAI DevDay 2026 发布 20+ 项公告:GPT-6.1 Sol(Astra 1/5 价格)、Dots 自主 agent、Codex Security Cloud 升级
  • Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 快 30%、成本低 30%,1M context,$2/$10 per Mtok
  • OpenAI 披露挫败一起针对受保护模型推理的协同蒸馏行动,正加强反蒸馏防御
  • Benchmark 多项新增:GPT-6 Astra/GPT-6.1 Sol/Grok 4.6 等新模型进入 AA 智能体/编码/智能榜单

新闻详情

Google DeepMind

日期 新闻 要点
09-30 Gemini 4 Argon Text Arena #1(1525 分),领先 #2 Claude Opus 4.6 (High) 达 20 分;Code Arena: WebDev #8(1679 分,较前版 +96 分)。在 coding、hard prompts、instruction following、creative writing 等全部细分领域拿下第一;Vals Index #1(68.9%)。blended $8/MToken,为当前最成本高效模型。HN 热帖 899 points
09-30 SynthID Bio 开源 在《Nature》发表论文,实现 AI 生成蛋白质的水印标记;开源 SynthID Bio 工具供研究社区使用
09-28 Future Vision XPRIZE 获奖短片 The Gifted 展示 AI 视频生成能力

OpenAI

日期 新闻 要点
09-30 挫败协同蒸馏行动 披露有人试图提取受保护模型推理,OpenAI 正加强对抗性蒸馏防御
09-30 帮助小企业用上 AI 与美国 SBDC 合作推广 AI 培训,发布小企业 AI 使用报告
09-29 GPT-6.1 Sol 近 Astra 级智能,API 输入/输出 token 价格为 Astra 的 1/5,95% cache read discount
09-29 DevDay 2026 回顾 超过 20 项公告:GPT-6 Astra、ChatGPT、Codex、API、安全工具等
09-29 Dots 发布 24/7 主动型 agent,可跨复杂项目和日常任务持续工作,用户保持控制权
09-29 Codex Security Cloud 升级 Daybreak Blue 默认包含;扫描整个 GitHub repo,持续审查新 commit,调查并去重发现,准备修复方案
09-28 澳大利亚政府网站事件致歉与整改 就涉及澳大利亚政府网站的事件道歉,提出更严格的安全防护和支持
09-28 前沿 AI 训练安全案例指南 涵盖技术防护、操作实践和错位事件调查的早期指南
09-28 Basis 用 GPT-6 Astra 完成税务工作簿快 2 倍 50 个 tab 的税务工作簿,Astra 完成速度为 GPT-5.6 Sol 的 2 倍

Anthropic

日期 新闻 要点
09-30 Claude Code v2.1.286 权限提示堆积时显示计数(如 "2 of 5")
09-29 Claude Code v2.1.285 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch 工具
09-28 Claude Sonnet 5.5 发布 Claude 5.5 家族第二个模型;比 Sonnet 5 快 30%+、成本低 30%;1M context,$2/$10 per Mtok,$0.20/Mtok cache reads
09-28 Claude Code v2.1.284 默认 Sonnet 模型切换为 claude-sonnet-5-5
09-25 Claude 完成九环计算 在 planar N=4 super-Yang-Mills 模型中将散射振幅推至九环(此前记录为八环),单 prompt 运行数天,总成本数千万美元,SLAC 的 Lance Dixon 独立验证

其他

日期 来源 要点
09-30 ChatGPT Sites 支持 MCP 服务器 Sites 可托管 MCP 服务器并转为插件,跨 web/mobile/desktop 安装
09-30 Latent.Space 解读 OpenAI Agent Stack Computer Use、Dots、Decisions API、UltraFast、AI Cloud 组成新 agent 栈
09-22 Claude Opus 5.5 发布 Claude 5.5 家族首个模型;多数任务达 Fable 5.1 水平,成本比 Opus 5 低 40%

Benchmark 快照

行业格局

AA Intelligence — 本期有变动

新进入模型:

模型 排名 分数
GPT-6 Astra (Max) 3 52.7
GPT-6 Astra (Xhigh) 4 52.4
GPT-6.1 Sol (Xhigh) 5 51.0
GPT-6.1 Sol (High) 6 50.2
Grok 4.7 (High) 12 46.3
Grok 4.6 (Medium) 14 42.8

当前 Top 3:

排名 模型 分数
1 Claude Opus 5.5 (Adaptive Reasoning, Max Effort) 57.6
2 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-6 Astra (Max) 52.7

LMArena Overall — 本期无变动

当前 Top 3:

排名 模型 分数
1 claude-opus-5.5-high 1508.6
2 claude-opus-4-6-high 1505.4
3 claude-fable-5-high 1503.8

干活选型

AA Agentic — 本期有变动

新进入模型:

模型 排名 分数
GPT-6 Astra (Max) 3 51.0
Grok 4.6 (Medium) 5 50.6
GPT-6 Astra (Xhigh) 6 50.2
Muse Spark 1.2 (Xhigh) 10 43.2
GPT-5.6 Luna (Max) 11 42.1
GPT-5.5 (Xhigh) 12 36.4
GPT-5.6 Sol (Low) 14 31.6
GPT-5.6 Terra (Medium) 15 30.4

当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 57.9
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 55.6
3 GPT-6 Astra (Max) 51.0

AA Coding — 本期有变动

新进入模型:

模型 排名 分数
GPT-6 Astra (Max) 4 76.9
GPT-6 Astra (Xhigh) 5 75.9
GPT-5.5 (Xhigh) 7 74.9
Grok 4.6 (Medium) 8 74.4
Muse Spark 1.2 (Xhigh) 9 72.2
GPT-5.6 Luna (Max) 12 71.4
Gemini 3.5 Flash (High) 13 70.1
GPT-5.6 Sol (Low) 14 69.7

当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 81.6
2 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) 77.1
3 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0

SWE-bench Verified — 本期有微调

排名变化:

模型 原排名 新排名 分数
Claude 3.5 Haiku 34 33 40.6
Claude 4 Sonnet + o4-mini 10 9 74.4
GPT-5 9 10 74.4
LLama 3.1 70B Critic 33 34 40.6

当前 Top 3:

排名 模型(scaffold) 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Gemini 4 Argon 是本期最大变量。 它以 1525 分登顶 Text Arena,领先第二名 Claude Opus 4.6 (High) 达 20 分,且在 coding、hard prompts、instruction following、creative writing 全部细分领域拿下第一;相比 Google 上一版 Gemini 3.8 Flash (High) 仅排第 11,这是一次跨代跃升,配合 $8/MToken 的 blended 定价直接重写了 Pareto 前沿。

  2. OpenAI DevDay 2026 是一次系统性产品栈扩张。 超过 20 项公告中,GPT-6.1 Sol 以 Astra 1/5 的价格和 95% cache read discount 压低前沿模型使用门槛,Dots 将 AI 从对话扩展为 24/7 自主 agent,Codex Security Cloud 将安全扫描嵌入开发流程——三者合在一起构成 OpenAI 对"AI 即云计算"叙事的完整押注。

来源 · 104 条