← 返回列表
SILASCODING · AI 情报

AI 日报 2026-10-04

2026-10-04 08:36 CST
快速版 完整版

核心速览

【Google DeepMind】Gemini 4 Argon 发布,登顶 Text Arena #1

Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第一,领先第二名 Claude Opus 4.6 (High) 20 分,同时以 $8/MToken 混合成本成为最具性价比模型。Code Arena: WebDev 中从 #29 跃升至 #8(+96 分)。通过 Fairwind Program 向受信任测试者开放。该模型还已在 Google 数据中心优化基础设施,Argon agents 完成 C/C++→Rust 迁移超 80 万行内核代码,视频解码器 Rust 替换后速度提升 2.7 倍。

Introducing Gemini 4 Argon


【OpenAI】GPT-6.1 Sol 发布:近 Astra 级能力,1/5 价格

GPT-6.1 Sol 面向编码、计算机使用和专业工作,智能水平接近 GPT-6 Astra,API 输入输出 token 价格仅为 Astra 标准价的五分之一。在 LM Arena 空降第 21 名(1483 分),与 gemini-3.6-flash-high(#22)和 gpt-5.5-high(#25)直接竞争,验证了"近 Astra 级能力"的定位。

Introducing GPT-6.1 Sol


【Anthropic】Claude Sonnet 5.5 发布:速度提升 30%+,成本降低 30%

Claude 5.5 家族第二个模型,较 Sonnet 5 性能显著提升,运行速度提升 30% 以上,多数工作场景成本降低 30%。Opus 5.5 已于 9 月 22 日先行发布,性能对标 Fable 5.1,成本较 Opus 5 降低 40%。

Claude Sonnet 5.5


【OpenAI】DevDay 2026 回顾:20+ 项公告

DevDay 2026 发布超过 20 项公告,包括 GPT-6 Astra、GPT-6.1 Sol、dots 主动助手、Codex 安全云升级、Agents API 新功能等。Agents API 达到 99.97% 轮次可靠性,工具调用速度提升 20%,新增一键启动浏览器+agent 的 computer use。

DevDay 2026 Recap


【Anthropic】Claude Code v2.1.287:Mods 插件系统上线

Claude Code 推出 Mods 功能,插件可修改更深层次行为,支持用几行 TypeScript 编写或让 Claude 自动生成。Mods 通过 /plugin 命令安装,可在 CLI 和桌面端使用,允许自定义 UI 和功能替换。

Claude Code v2.1.287


重大 Benchmark 变化

LM Arena (Overall)

模型 变化类型 排名变动 分数
gpt-6.1-sol-max 新上榜 → #21 1483.21
claude-sonnet-5.5-xhigh 新上榜 → #45 1471.01
gpt-6-luna-max 排名下降 #85 → #90(-5) 1442.88
inkling 排名下降 #89 → #95(-6) 1441.38
mimo-v2.6-flash 排名下降 #71 → #77(-6) 1451.78
hy3 排名下降 #62 → #67(-5) 1455.98
qwen3.8-27b 排名下降 #94 → #99(-5) 1437.70

gpt-6.1-sol-max 空降 #21,直接进入 gpt-5.5-high(#25)和 gemini-3.6-flash-high(#22)所在区间,以 Astra 1/5 价格提供接近前者的性能。claude-sonnet-5.5-xhigh 以 1471 分进入 #45,与 claude-opus-4-5-20251101(#47,1469.77)和 ernie-5.1(#48,1467.58)形成竞争。

SWE-bench Verified:本周无排名变动 ≥5 或分数变动 ≥5% 的变化。Claude 4 Sonnet + o4-mini 与 GPT-5 在 #9/#10 位置互换,分数均为 74.4,无实质变化。

快速预览

  • OpenAI Agents API 周更新:单次调用即可启动浏览器+agent,Bedrock 托管代理支持 GPT-6.1 Sol,轮次可靠性达 99.97%
  • Claude Code 推出 Mods 插件系统(v2.1.287),开发者可用 TypeScript 自定义行为与 UI
  • Aleph Alpha 发布 Kolibri 主权开源权重模型,HN 热度 490 分
  • DeepSeek Harness 桌面版上线 macOS / Windows
  • LMArena 新入榜:GPT-6.1 Sol Max #21、Claude Sonnet 5.5 XHigh #45、Step 5 Preview #74

新闻

OpenAI

日期 标题 要点
10-02 A model guide for the GPT-6 family 面向初创团队的 GPT-6 选型指南,覆盖推理强度调优、提示改进、技能编排与生产化流程
10-02 Chatham scales its capital markets expertise with OpenAI Chatham Financial 用 Codex + GPT-5.6 将交易验证从 30 分钟压缩至 4 分钟以内
10-01 The eternal complement 探讨 AI 在突破性想法背后的执行性常规工作中可能发挥的最大价值
10-01 How Albertsons Companies is reimagining retail Albertsons 用 ChatGPT Enterprise 和 OpenAI API 加速内部流程、改善购物体验
10-01 The Den frees up 10-15 hours a week with ChatGPT Work 社交俱乐部用 ChatGPT Work 将拨款申请从 3 天缩至 2 小时、酒类许可证材料从 4 天缩至 3 小时
09-30 Disrupting a coordinated model-distillation campaign OpenAI 粉碎了一起提取受保护模型推理数据的蒸馏攻击,正加强防御
09-30 Helping small businesses put AI to work 与美国 SBDC 合作推广 AI 实操培训,发布小团队 AI 使用报告
09-29 DevDay 2026 Recap 超 20 项公告:GPT-6 Astra、ChatGPT、Codex、API、安全工具等
09-29 Introducing GPT-6.1 Sol 近 Astra 级编码/计算机使用/专业工作能力,价格为 Astra 标准 API 的 1/5
09-29 Introducing dots 跨复杂项目与日常任务的主动式助手,保持上下文、协调 Codex 任务

OpenAI 开发者动态(X @OpenAIDevs / @OpenAI)

日期 标题 要点
10-03 Agents API 周更新 Computer use 单调用启动浏览器+agent;Bedrock Managed Agents 支持 GPT-6.1 Sol;环境尺寸可选;99.97% 轮次可靠性、工具调用提速 20%
10-02 Dots 与 Codex 协同 Dots 学习用户工作方式,跨应用保持上下文、协调 Codex 任务、标记待办
10-02 Plugin extensions 演讲 DevDay 主台分享:插件可从 ChatGPT 侧边栏/侧面板/文件查看器打开,支持 Sign in with ChatGPT
10-01 GPT-6.1 Astra 创建 Gaussian Splats 结合 Blender MCP + Lichtfeld Studio,GPT-6.1 Astra 生成高精度 3D 场景
09-29 Codex Security Cloud 升级 Daybreak Blue 网络安全模型默认接入,支持全仓库扫描、持续审查提交、自动去重与修复准备

Anthropic / Claude

日期 标题 要点
10-01 AI 与科学的"阻抗失配" 哈佛物理学家 Matthew Schwartz 用 Claude 构建定量科学计算工具包,发现跨学科关联(生态学、群体遗传学等)
09-28 Claude Sonnet 5.5 发布 Claude 5.5 家族第二款模型,较 Sonnet 5 提升 30%+ 速度、多数场景成本降低 30%
09-25 Claude 完成 Nine Loops 计算 Claude 在简化模型中将散射振幅计算推至 9 loop,超越此前 8 loop 记录,总成本数千美元
09-22 Claude Opus 5.5 发布 Claude 5.5 家族首款模型,多数任务达 Fable 5.1 水平,运行成本较 Opus 5 降低 40%

Claude Code 版本发布

版本 日期 变更
v2.1.289 10-03 修复托管机器上用户安装 mod 的审批覆盖嵌套 compound shell 命令 deny/ask 规则的问题
v2.1.288 10-02 新增 $.ui.selection() for mods:返回全屏模式下最后选中文本及对应 transcript 行
v2.1.287 10-01 Claude Mods 上线:插件可修改更深层次行为,支持 TypeScript 编写、/plugin 安装
v2.1.286 09-30 权限请求堆积时显示 "2 of 5" 计数
v2.1.285 09-29 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch 工具

DeepSeek

日期 标题 要点
10-02 DeepSeek Harness 桌面版发布 macOS 和 Windows 打包版上线,Linux 用户可通过 npm @deepseek-ai/dsh 安装

Google / DeepMind

日期 标题 要点
10-02 September AI updates 回顾 9 月 Google AI 更新汇总视频
10-01 Project Suncatcher:TPU 送入太空 Google 联合 Planet 在 SpaceX Transporter-18 上发射搭载 4 颗 TPU 的原型卫星,研究太空 ML 可行性
09-30 Gemini 4 Argon 内部应用 Argon agent 已在 Google 数据中心释放超 300 TiB 内存;C/C++→Rust 迁移达 80 万+ 行;视频解码器 3.2 万行 SIMD 替换为安全 Rust,提速 2.7x
09-30 Gemini 4 Argon 登顶 Text Arena Arena #1 文本 1525 分、#8 代码 WebDev 1679 分, blended $8/MToken,为当前最高性价比模型

Sam Altman(X @sama)

日期 内容
10-03 对 AI 宗教化倾向的安全担忧 — 认为将宗教力量或人类判断的让渡归于 AI 模型是真实的安全问题
10-02 关于 Cerebras 合作 — 确认 Cerebras 为紧密合作伙伴,双方在速度前沿有深度合作

Tibo(OpenAI Codex 团队,X @thsottiaux)

日期 内容
10-03 未来模型将更擅长代码删除与简化
10-03 征询 Codex 缺失功能
10-03 征询新侧边栏建议

Andrej Karpathy

日期 标题 要点
10-02 Land or Water 评估 给 LLM 16,200 个经纬度坐标判断"陆地或水域",模型从互联网压缩中习得地理知识
10-02 理解 LLM 输出的方法 建议用 ASD-STE100 受控语言、图表、HTML 网页、3b1b 风格解说视频等逐步升级输出可读性

Simon Willison

日期 标题 要点
10-03 Default hard budget caps 呼吁对几乎所有 AI 工具设置默认硬性预算上限
10-03 Dot vs ChatGPT 使用困惑 难以区分何时应使用 Dot(单一对话)vs ChatGPT(多线程控制上下文)

Boris Cherny(Anthropic,X @bcherny)

日期 内容
10-01 Mods 非常强大 — 可通过提示自定义 Claude 行为和外观,Mods 以插件形式打包,/plugin 安装
09-30 Claude.dev 上线 — 面向 Claude 开发者的新主页,含工程深度文章、API 指南等

Hacker News 热门

日期 标题 要点
10-03 Kolibri: A Sovereign Open-Weight Model Aleph Alpha 发布主权重开源权重模型,HN 490 分
10-03 Getting the most out of Opus 5.5 Claude 官方 Opus 5.5 使用技巧,HN 150 分

Benchmark 快照

行业格局

[Artificial Analysis / Intelligence]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5.5 (Max, Default Fallback) 57.6
2 Claude Fable 5.1 (Max, Default Fallback) 53.4
3 GPT-6 Astra (Max) 52.7

[LMArena / Overall]

本期变动(择要):

模型 变化类型 旧排名 新排名 旧分数 新分数
GPT-6.1 Sol Max 新入榜 — 21 — 1483.21
Claude Sonnet 5.5 XHigh 新入榜 — 45 — 1471.01
Step 5 Preview 新入榜 — 74 — 1453.68
Gemini 3.8 Flash High ↑ 11 8 1494.09 1494.77
GPT-6 Astra Max ↑ 30 29 1476.18 1477.11
DeepSeek V4.1 Flash Max ↑ 40 38 1472.77 1474.44
Qwen 3.8 Max ↑ 24 23 1480.86 1481.62
Kimi K3 Max ↑ 17 16 1488.03 1488.36
GPT-6 Sol Max ↑ 66 64 1455.82 1457.21
GPT-6 Luna Max ↓ 85 90 1443.84 1442.88
GLM 5.3 Flash ↓ 38 41 1473.67 1473.00
hy3 ↓ 62 67 1457.44 1455.98
Mimo V2.6 Flash ↓ 71 77 1453.73 1451.78

当前 Top 5(快照):

排名 模型 分数
1 Gemini 4 Argon (High) 1525.22
2 Claude Opus 4.6 (High) 1504.73
3 Claude Fable 5 (High) 1504.27
4 Claude Opus 5.5 (High) 1503.70
5 Claude Opus 4.7 (High) 1501.30

干活选型

[Artificial Analysis / Agentic]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Max, Default Fallback) 57.9
2 Claude Opus 5 (Xhigh) 55.6
3 GPT-6 Astra (Max) 51.0

[Artificial Analysis / Coding]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Max, Default Fallback) 81.6
2 Claude Fable 5.1 (Medium, Default Fallback) 77.1
3 Claude Opus 5 (Xhigh) 77.0

[SWE-bench Verified]

本期变动:

模型 变化 旧排名→新排名 分数
Claude 4 Sonnet + o4-mini ↑ 10 → 9 74.4
GPT-5 ↓ 9 → 10 74.4
Claude 3.5 Haiku ↑ 34 → 33 40.6
LLama 3.1 70B Critic ↓ 33 → 34 40.6

当前 Top 3(快照):

排名 模型 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI Agents API 周更新 — Computer use 从多步简化为单次 API 调用,叠加 Bedrock 托管代理上线 GPT-6.1 Sol 和 99.97% 轮次可靠性,实质上降低了多 agent 编排的工程门槛;这对依赖 SSE 长连接的实时场景(断连减少、工具调用提速 20%)尤其有体感。

  2. Aleph Alpha 发布 Kolibri 主权开源权重模型(HN 490 分) — 在欧盟 AI 法案合规压力下,"主权"定位(数据不出境、权重开放)是一个差异化叙事;但最终能否立足取决于下游 benchmark 和生态采用量,当前材料中尚无 Kolibri 的任何 benchmark 数据。

  3. Claude Code Mods(v2.1.287) — 插件可修改"更深层次行为"并支持 TypeScript 编写和 /plugin 安装,等于把 Claude Code 从封闭 CLI 变为可扩展平台;结合 v2.1.288 的 $.ui.selection() API,Anthropic 正在以每周一个开发者能力的节奏补齐插件生态短板。

来源 · 110 条