【Google DeepMind】Gemini 4 Argon 发布,登顶 Text Arena #1
Gemini 4 Argon (High) 在 Text Arena 以 1525 分排名第一,领先第二名 Claude Opus 4.6 (High) 20 分,同时以 $8/MToken 混合成本成为最具性价比模型。Code Arena: WebDev 中从 #29 跃升至 #8(+96 分)。通过 Fairwind Program 向受信任测试者开放。该模型还已在 Google 数据中心优化基础设施,Argon agents 完成 C/C++→Rust 迁移超 80 万行内核代码,视频解码器 Rust 替换后速度提升 2.7 倍。
【OpenAI】GPT-6.1 Sol 发布:近 Astra 级能力,1/5 价格
GPT-6.1 Sol 面向编码、计算机使用和专业工作,智能水平接近 GPT-6 Astra,API 输入输出 token 价格仅为 Astra 标准价的五分之一。在 LM Arena 空降第 21 名(1483 分),与 gemini-3.6-flash-high(#22)和 gpt-5.5-high(#25)直接竞争,验证了"近 Astra 级能力"的定位。
【Anthropic】Claude Sonnet 5.5 发布:速度提升 30%+,成本降低 30%
Claude 5.5 家族第二个模型,较 Sonnet 5 性能显著提升,运行速度提升 30% 以上,多数工作场景成本降低 30%。Opus 5.5 已于 9 月 22 日先行发布,性能对标 Fable 5.1,成本较 Opus 5 降低 40%。
【OpenAI】DevDay 2026 回顾:20+ 项公告
DevDay 2026 发布超过 20 项公告,包括 GPT-6 Astra、GPT-6.1 Sol、dots 主动助手、Codex 安全云升级、Agents API 新功能等。Agents API 达到 99.97% 轮次可靠性,工具调用速度提升 20%,新增一键启动浏览器+agent 的 computer use。
【Anthropic】Claude Code v2.1.287:Mods 插件系统上线
Claude Code 推出 Mods 功能,插件可修改更深层次行为,支持用几行 TypeScript 编写或让 Claude 自动生成。Mods 通过 /plugin 命令安装,可在 CLI 和桌面端使用,允许自定义 UI 和功能替换。
LM Arena (Overall)
| 模型 | 变化类型 | 排名变动 | 分数 |
|---|---|---|---|
| gpt-6.1-sol-max | 新上榜 | → #21 | 1483.21 |
| claude-sonnet-5.5-xhigh | 新上榜 | → #45 | 1471.01 |
| gpt-6-luna-max | 排名下降 | #85 → #90(-5) | 1442.88 |
| inkling | 排名下降 | #89 → #95(-6) | 1441.38 |
| mimo-v2.6-flash | 排名下降 | #71 → #77(-6) | 1451.78 |
| hy3 | 排名下降 | #62 → #67(-5) | 1455.98 |
| qwen3.8-27b | 排名下降 | #94 → #99(-5) | 1437.70 |
gpt-6.1-sol-max 空降 #21,直接进入 gpt-5.5-high(#25)和 gemini-3.6-flash-high(#22)所在区间,以 Astra 1/5 价格提供接近前者的性能。claude-sonnet-5.5-xhigh 以 1471 分进入 #45,与 claude-opus-4-5-20251101(#47,1469.77)和 ernie-5.1(#48,1467.58)形成竞争。
SWE-bench Verified:本周无排名变动 ≥5 或分数变动 ≥5% 的变化。Claude 4 Sonnet + o4-mini 与 GPT-5 在 #9/#10 位置互换,分数均为 74.4,无实质变化。
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | A model guide for the GPT-6 family | 面向初创团队的 GPT-6 选型指南,覆盖推理强度调优、提示改进、技能编排与生产化流程 |
| 10-02 | Chatham scales its capital markets expertise with OpenAI | Chatham Financial 用 Codex + GPT-5.6 将交易验证从 30 分钟压缩至 4 分钟以内 |
| 10-01 | The eternal complement | 探讨 AI 在突破性想法背后的执行性常规工作中可能发挥的最大价值 |
| 10-01 | How Albertsons Companies is reimagining retail | Albertsons 用 ChatGPT Enterprise 和 OpenAI API 加速内部流程、改善购物体验 |
| 10-01 | The Den frees up 10-15 hours a week with ChatGPT Work | 社交俱乐部用 ChatGPT Work 将拨款申请从 3 天缩至 2 小时、酒类许可证材料从 4 天缩至 3 小时 |
| 09-30 | Disrupting a coordinated model-distillation campaign | OpenAI 粉碎了一起提取受保护模型推理数据的蒸馏攻击,正加强防御 |
| 09-30 | Helping small businesses put AI to work | 与美国 SBDC 合作推广 AI 实操培训,发布小团队 AI 使用报告 |
| 09-29 | DevDay 2026 Recap | 超 20 项公告:GPT-6 Astra、ChatGPT、Codex、API、安全工具等 |
| 09-29 | Introducing GPT-6.1 Sol | 近 Astra 级编码/计算机使用/专业工作能力,价格为 Astra 标准 API 的 1/5 |
| 09-29 | Introducing dots | 跨复杂项目与日常任务的主动式助手,保持上下文、协调 Codex 任务 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-03 | Agents API 周更新 | Computer use 单调用启动浏览器+agent;Bedrock Managed Agents 支持 GPT-6.1 Sol;环境尺寸可选;99.97% 轮次可靠性、工具调用提速 20% |
| 10-02 | Dots 与 Codex 协同 | Dots 学习用户工作方式,跨应用保持上下文、协调 Codex 任务、标记待办 |
| 10-02 | Plugin extensions 演讲 | DevDay 主台分享:插件可从 ChatGPT 侧边栏/侧面板/文件查看器打开,支持 Sign in with ChatGPT |
| 10-01 | GPT-6.1 Astra 创建 Gaussian Splats | 结合 Blender MCP + Lichtfeld Studio,GPT-6.1 Astra 生成高精度 3D 场景 |
| 09-29 | Codex Security Cloud 升级 | Daybreak Blue 网络安全模型默认接入,支持全仓库扫描、持续审查提交、自动去重与修复准备 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-01 | AI 与科学的"阻抗失配" | 哈佛物理学家 Matthew Schwartz 用 Claude 构建定量科学计算工具包,发现跨学科关联(生态学、群体遗传学等) |
| 09-28 | Claude Sonnet 5.5 发布 | Claude 5.5 家族第二款模型,较 Sonnet 5 提升 30%+ 速度、多数场景成本降低 30% |
| 09-25 | Claude 完成 Nine Loops 计算 | Claude 在简化模型中将散射振幅计算推至 9 loop,超越此前 8 loop 记录,总成本数千美元 |
| 09-22 | Claude Opus 5.5 发布 | Claude 5.5 家族首款模型,多数任务达 Fable 5.1 水平,运行成本较 Opus 5 降低 40% |
| 版本 | 日期 | 变更 |
|---|---|---|
| v2.1.289 | 10-03 | 修复托管机器上用户安装 mod 的审批覆盖嵌套 compound shell 命令 deny/ask 规则的问题 |
| v2.1.288 | 10-02 | 新增 $.ui.selection() for mods:返回全屏模式下最后选中文本及对应 transcript 行 |
| v2.1.287 | 10-01 | Claude Mods 上线:插件可修改更深层次行为,支持 TypeScript 编写、/plugin 安装 |
| v2.1.286 | 09-30 | 权限请求堆积时显示 "2 of 5" 计数 |
| v2.1.285 | 09-29 | 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch 工具 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | DeepSeek Harness 桌面版发布 | macOS 和 Windows 打包版上线,Linux 用户可通过 npm @deepseek-ai/dsh 安装 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | September AI updates 回顾 | 9 月 Google AI 更新汇总视频 |
| 10-01 | Project Suncatcher:TPU 送入太空 | Google 联合 Planet 在 SpaceX Transporter-18 上发射搭载 4 颗 TPU 的原型卫星,研究太空 ML 可行性 |
| 09-30 | Gemini 4 Argon 内部应用 | Argon agent 已在 Google 数据中心释放超 300 TiB 内存;C/C++→Rust 迁移达 80 万+ 行;视频解码器 3.2 万行 SIMD 替换为安全 Rust,提速 2.7x |
| 09-30 | Gemini 4 Argon 登顶 Text Arena | Arena #1 文本 1525 分、#8 代码 WebDev 1679 分, blended $8/MToken,为当前最高性价比模型 |
| 日期 | 内容 |
|---|---|
| 10-03 | 对 AI 宗教化倾向的安全担忧 — 认为将宗教力量或人类判断的让渡归于 AI 模型是真实的安全问题 |
| 10-02 | 关于 Cerebras 合作 — 确认 Cerebras 为紧密合作伙伴,双方在速度前沿有深度合作 |
| 日期 | 内容 |
|---|---|
| 10-03 | 未来模型将更擅长代码删除与简化 |
| 10-03 | 征询 Codex 缺失功能 |
| 10-03 | 征询新侧边栏建议 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | Land or Water 评估 | 给 LLM 16,200 个经纬度坐标判断"陆地或水域",模型从互联网压缩中习得地理知识 |
| 10-02 | 理解 LLM 输出的方法 | 建议用 ASD-STE100 受控语言、图表、HTML 网页、3b1b 风格解说视频等逐步升级输出可读性 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-03 | Default hard budget caps | 呼吁对几乎所有 AI 工具设置默认硬性预算上限 |
| 10-03 | Dot vs ChatGPT 使用困惑 | 难以区分何时应使用 Dot(单一对话)vs ChatGPT(多线程控制上下文) |
| 日期 | 内容 |
|---|---|
| 10-01 | Mods 非常强大 — 可通过提示自定义 Claude 行为和外观,Mods 以插件形式打包,/plugin 安装 |
| 09-30 | Claude.dev 上线 — 面向 Claude 开发者的新主页,含工程深度文章、API 指南等 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-03 | Kolibri: A Sovereign Open-Weight Model | Aleph Alpha 发布主权重开源权重模型,HN 490 分 |
| 10-03 | Getting the most out of Opus 5.5 | Claude 官方 Opus 5.5 使用技巧,HN 150 分 |
[Artificial Analysis / Intelligence]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Max, Default Fallback) | 57.6 |
| 2 | Claude Fable 5.1 (Max, Default Fallback) | 53.4 |
| 3 | GPT-6 Astra (Max) | 52.7 |
[LMArena / Overall]
本期变动(择要):
| 模型 | 变化类型 | 旧排名 | 新排名 | 旧分数 | 新分数 |
|---|---|---|---|---|---|
| GPT-6.1 Sol Max | 新入榜 | — | 21 | — | 1483.21 |
| Claude Sonnet 5.5 XHigh | 新入榜 | — | 45 | — | 1471.01 |
| Step 5 Preview | 新入榜 | — | 74 | — | 1453.68 |
| Gemini 3.8 Flash High | ↑ | 11 | 8 | 1494.09 | 1494.77 |
| GPT-6 Astra Max | ↑ | 30 | 29 | 1476.18 | 1477.11 |
| DeepSeek V4.1 Flash Max | ↑ | 40 | 38 | 1472.77 | 1474.44 |
| Qwen 3.8 Max | ↑ | 24 | 23 | 1480.86 | 1481.62 |
| Kimi K3 Max | ↑ | 17 | 16 | 1488.03 | 1488.36 |
| GPT-6 Sol Max | ↑ | 66 | 64 | 1455.82 | 1457.21 |
| GPT-6 Luna Max | ↓ | 85 | 90 | 1443.84 | 1442.88 |
| GLM 5.3 Flash | ↓ | 38 | 41 | 1473.67 | 1473.00 |
| hy3 | ↓ | 62 | 67 | 1457.44 | 1455.98 |
| Mimo V2.6 Flash | ↓ | 71 | 77 | 1453.73 | 1451.78 |
当前 Top 5(快照):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Gemini 4 Argon (High) | 1525.22 |
| 2 | Claude Opus 4.6 (High) | 1504.73 |
| 3 | Claude Fable 5 (High) | 1504.27 |
| 4 | Claude Opus 5.5 (High) | 1503.70 |
| 5 | Claude Opus 4.7 (High) | 1501.30 |
[Artificial Analysis / Agentic]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Xhigh) | 55.6 |
| 3 | GPT-6 Astra (Max) | 51.0 |
[Artificial Analysis / Coding]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Medium, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Xhigh) | 77.0 |
[SWE-bench Verified]
本期变动:
| 模型 | 变化 | 旧排名→新排名 | 分数 |
|---|---|---|---|
| Claude 4 Sonnet + o4-mini | ↑ | 10 → 9 | 74.4 |
| GPT-5 | ↓ | 9 → 10 | 74.4 |
| Claude 3.5 Haiku | ↑ | 34 → 33 | 40.6 |
| LLama 3.1 70B Critic | ↓ | 33 → 34 | 40.6 |
当前 Top 3(快照):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI Agents API 周更新 — Computer use 从多步简化为单次 API 调用,叠加 Bedrock 托管代理上线 GPT-6.1 Sol 和 99.97% 轮次可靠性,实质上降低了多 agent 编排的工程门槛;这对依赖 SSE 长连接的实时场景(断连减少、工具调用提速 20%)尤其有体感。
Aleph Alpha 发布 Kolibri 主权开源权重模型(HN 490 分) — 在欧盟 AI 法案合规压力下,"主权"定位(数据不出境、权重开放)是一个差异化叙事;但最终能否立足取决于下游 benchmark 和生态采用量,当前材料中尚无 Kolibri 的任何 benchmark 数据。
Claude Code Mods(v2.1.287) — 插件可修改"更深层次行为"并支持 TypeScript 编写和 /plugin 安装,等于把 Claude Code 从封闭 CLI 变为可扩展平台;结合 v2.1.288 的 $.ui.selection() API,Anthropic 正在以每周一个开发者能力的节奏补齐插件生态短板。