Anthropic 发布 Claude 5.5 家族第二款模型 Sonnet 5.5。相比 Sonnet 5,速度提升超过 30%,多数场景成本降低最高 30%,能力显著升级。Opus 5.5 此前已于 9 月 22 日发布,性能对标 Fable 5.1,成本比 Opus 5 低 40%。Claude 5.5 家族模型在写作清晰度和迭代体验上明显提升,Haiku 5.5 也将在未来几周内推出。
→ Claude Sonnet 5.5 | Claude Opus 5.5
OpenAI DevDay 2026 发布超过 20 项公告,包括 GPT-6 Astra、GPT-6.1 Sol、dots 主动助手、Codex Security Cloud 升级等。dots 能跨应用保持上下文、协调 Codex 任务并主动提醒用户关注事项。Codex Security Cloud 新增 Daybreak Blue 网络安全模型,支持全仓库扫描和持续代码审查。
→ DevDay 2026 Recap | Introducing dots
GPT-6.1 Sol 面向编码、计算机使用和专业工作场景,API 输入输出 token 价格仅为 GPT-6 Astra 标准价的五分之一。同期发布的 GPT-6 Sol 和 Luna 则将 Astra 的前沿能力以更低成本和更高速度带入规模化工作场景,GPT-6 还改进了 prompt 缓存机制,提升命中率并降低延迟。
→ Introducing GPT-6.1 Sol | GPT-6 Sol and Luna
Claude Code v2.1.287 引入 Mods 功能,插件可修改 Claude Code 的深层行为,包括 UI 自定义和行为调整。用户可用几行 TypeScript 编写 Mod,或让 Claude 自动生成,通过 /plugin 命令安装。后续版本(v2.1.288)增加了 $.ui.selection() API,支持 Mod 获取用户选中文本。
→ Claude Code v2.1.287 | Mods 介绍
Gemini 4 Argon 发布,据 Google 数据,Argon 智能体已在其数据中心释放超过 300 TiB 内存,支持 100 万 token 输出上限。智能体分析性能分析数据、发现内存优化方案并应用变更;同时在 C/C++ 转 Rust 迁移中处理超过 80 万行内核代码,视频解码器中 32,000 行 SIMD 代码被安全 Rust 替换后性能提升 2.7 倍。这表明 Gemini 4 已达到与 Fable/Astra 同级竞争力。
本期 SWE-bench Verified 排名变动均为 1 位小幅调整(Claude 4 Sonnet + o4-mini 从第 10 升至第 9,GPT-5 从第 9 降至第 10,Claude 3.5 Haiku 与 Llama 3.1 70B Critic 互换第 33/34 位),分数无变化,均未达到排名变动≥5 或分数变动≥5% 的报告阈值。
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | GPT-6 模型选择指南 | 指导创业公司选模型、调推理深度、优化提示词与技能、协调工具、准备生产工作流 |
| 10-02 | Chatham Financial 案例 | 用 Codex 和 GPT-5.6 将交易验证从 30 分钟压缩至 4 分钟以内 |
| 10-01 | The eternal complement | 探讨 AI 在突破性想法背后执行工作中的作用 |
| 10-01 | Albertsons 零售案例 | 用 ChatGPT Enterprise 和 OpenAI API 提升团队效率、优化购物体验 |
| 10-01 | The Den 案例 | ChatGPT Work 将补助金申请从 3 天缩至 2 小时,酒牌材料从 4 天缩至 3 小时 |
| 09-30 | 阻断模型蒸馏攻击 | 破解企图提取受保护模型推理的协调行动,加强反蒸馏防御 |
| 09-30 | 助力小企业 AI 应用 | 与 America's SBDC 合作推广实操 AI 培训,发布小团队 AI 应用报告 |
| 09-29 | DevDay 2026 回顾 | 超 20 项公告:GPT-6 Astra、Codex、API 安全与开发者工具 |
| 09-29 | 发布 GPT-6.1 Sol | 近 Astra 智能水平,API 输入/输出 token 价格为 Astra 的 1/5 |
| 09-29 | 发布 dots | 跨应用保持上下文、协调 Codex 任务、标记待办的前瞻助手 |
| 09-28 | 澳大利亚事件致歉 | 对涉及澳大利亚政府网站事件道歉,承诺加强网络安全防护 |
| 09-28 | 前沿 AI 训练安全案例 | 发布安全案例早期指南:技术保障、运营实践、错位事件调查 |
| 09-28 | Lenfest 项目扩展 | 500 万美元资金 + 最多 500 万美元软件额度与工程支持 |
| 09-28 | Basis 税务案例 | GPT-6 Astra 完成 50 标签税务工作簿速度为 GPT-5.6 Sol 的 2 倍 |
OpenAI X 动态
| 日期 | 来源 | 要点 |
|---|---|---|
| 10-04 | Tibo | 承诺未来 28 天每天交付一项改进或完整重置,仅聚焦简化、效率和 groundbreaking 功能/新模型 |
| 10-03 | OpenAI Devs | Agents API 周更新:Computer use 1 次调用启动浏览器+agent,99.97% 轮次可靠性,工具调用快 20% |
| 10-03 | Sam Altman | "将宗教力量赋予 AI 模型"是真实安全问题 |
| 10-02 | Sam Altman | 确认与 Cerebras 深度合作,推进速度前沿 |
| 10-02 | OpenAI Devs | dots 与 Codex 协同:dot 学习用户工作方式、跨应用保持上下文、协调 Codex 任务 |
| 09-29 | OpenAI | Codex Security Cloud 大升级:Daybreak Blue 默认包含,扫描整个 GitHub 仓库、持续审查新提交 |
| 09-29 | Greg Brockman | 分享前沿 RL 训练安全实践指南 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-03 | Claude Code v2.1.289 | 修复托管机器上用户安装 mod 审批覆盖嵌套 deny/ask 规则的问题 |
| 10-02 | Claude Code v2.1.288 | 为 mods 添加 $.ui.selection():返回全屏模式下最后选中文本及对应行 |
| 10-01 | Claude Code v2.1.287 | 引入 Claude Mods:插件可修改更深层行为 |
| 09-30 | Claude Code v2.1.286 | 多个权限请求堆叠时显示计数如 "2 of 5" |
| 09-29 | Claude Code v2.1.285 | 添加 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch 工具 |
| 10-01 | Anthropic Science Blog | 哈佛物理学家 Matthew Schwartz 用 Claude 做精确科学计算,发现跨学科关联 |
| 09-28 | Claude Sonnet 5.5 发布 | 比 Sonnet 5 快 30%+,多数工作成本最多低 30% |
| 09-25 | Claude 完成 Nine Loops | 在简化模型中完成九环散射振幅计算(此前记录为八环),总成本数千美元,Lance Dixon 独立验证 |
| 09-23 | Claude 用于刚果埃博拉响应 | CEPI、WHO 非洲区、INRB 用 Claude 加速对异常埃博拉变种的响应 |
| 09-22 | Claude Opus 5.5 发布 | 首个 Claude 5.5 系列模型,多数任务达 Fable 5.1 水平,成本比 Opus 5 低 40% |
Anthropic 个人动态
| 日期 | 来源 | 要点 |
|---|---|---|
| 10-01 | Boris Cherny | Mods 可用几行 TypeScript 编写或让 Claude 帮你生成,作为插件通过 /plugin 安装 |
| 09-28 | Alex Albert | Sonnet 5.5 写作清晰、速度大幅提升,是比 Sonnet 5 的重大能力跃升 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-04 | Demis Hassabis | 对 AI 加速科学和医学的影响感到自豪,提及 AlphaGenome Atlas 绘制全部 90 亿个单字母遗传变异 |
| 10-02 | 九月 AI 更新汇总 | 视频回顾九月 AI 更新 |
| 10-01 | Project Suncatcher 卫星发射 | 与 Planet 合作在 SpaceX Transporter-18 发射搭载 4 个 TPU 的原型卫星,探索太空 ML 基础设施 |
| 09-30 | Gemini 4 Argon agents | 已释放 300+ TiB 数据中心内存;C/C++ 转 Rust 达 80 万行内核代码;视频解码器 3.2 万行 SIMD 替换为安全 Rust 后快 2.7 倍 |
| 09-28 | Future Vision XPRIZE 获奖 | 公布获奖预告片 The Gifted |
| 09-24 | Gemini 3.8 Live | Live Avatar 在 Gemini Enterprise 正式可用,支持视频头像、流畅对话、工具调用 |
| 09-27 | Logan Kilpatrick | 预测 2027 年将出现大规模自主收入生成 agent / 小型公司 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 10-02 | DeepSeek Harness 桌面版 | 发布 macOS 和 Windows 桌面版,Linux 用户经 npm @deepseek-ai/dsh 获取 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 10-04 | Simon Willison | 发文呼吁对 AI 支出设置默认硬预算上限 |
| 10-03 | Simon Willison | 讨论 dots 与 ChatGPT 的区别:dot 似乎只支持单一对话,而自己偏好多线程控制上下文 |
| 10-02 | Karpathy | "Land or Water?" 评估:给 LLM 经纬度文本判断陆地或水域,16,200 次查询后模型明显"知道" |
| 10-02 | Karpathy | 理解 LLM 输出的技巧:ASD-STE100 受控语言、图表、HTML 交互网页、定制解释视频 |
| 10-04 | HN 热门 | 在 RTX 4090 上以 100T/s 运行 Qwen 3.8 Flash Next (125B)(589 分) |
| 10-04 | HN 热门 | macOS 上对每张照片和每帧视频进行 AI 搜索(135 分) |
本期无变动。
AA Intelligence(综合智能)Top 3
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Max, Default Fallback) | 57.6 |
| 2 | Claude Fable 5.1 (Max, Default Fallback) | 53.4 |
| 3 | GPT-6 Astra (Max) | 52.7 |
LMArena(总体)Top 3
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Gemini 4 Argon (High) | 1525.2 |
| 2 | Claude Opus 4-6 (High) | 1504.7 |
| 3 | Claude Fable 5 (High) | 1504.3 |
SWE-bench Verified 变动
| 模型 | 变化 | 前排名 | 现排名 | 分数 |
|---|---|---|---|---|
| Claude 4 Sonnet + o4-mini | ↑ | 10 | 9 | 74.4(不变) |
| GPT-5 | ↓ | 9 | 10 | 74.4(不变) |
| Claude 3.5 Haiku | ↑ | 34 | 33 | 40.6(不变) |
| LLama 3.1 70B Critic | ↓ | 33 | 34 | 40.6(不变) |
四处变动均为同分模型间的微调排名波动,分数未变。
AA Agentic(Agent 能力)Top 3
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Xhigh) | 55.6 |
| 3 | GPT-6 Astra (Max) | 51.0 |
AA Coding(编程)Top 3
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Medium, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Xhigh) | 77.0 |
SWE-bench Verified Top 3
| 排名 | 模型 + 脚手架 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Tibo 28 天承诺:OpenAI Codex/Work 负责人公开承诺"未来 28 天每天交付一项明确改进或完整重置",且仅聚焦"简化、效率、groundbreaking 功能或新模型"——在用户反馈明确要求"更简单"的背景下,这是一次罕见的将产品迭代节奏与方向同时公开的自我加压,如果 28 天内未兑现将直接损害团队公信力。
Claude Code Mods(v2.1.287):Mods 让插件可"修改 Claude Code 更深层行为"并可用几行 TypeScript 编写或让 Claude 自动生成,Boris 称之为"absolutely insane"——这实质上将 Claude Code 从封闭 CLI 工具转向可扩展平台,而 v2.1.289 紧急修复 mod 审批覆盖嵌套安全规则的问题,说明新插件权限模型仍在快速迭代中,早期采用者需注意托管环境下的权限边界。
Gemini 4 Argon agents 内部落地:据 Google 转述,Argon agents 已在 Google 数据中心释放 300+ TiB 内存、完成 80 万行 C/C++ 转 Rust、将视频解码器 3.2 万行 SIMD 替换为安全 Rust 后提速 2.7 倍——这些是 Google 自有基础设施上的昂贵工程任务,说明 Gemini 4 Argon 不只是 benchmark 数字领先(LMArena #1),而是已经在 Google 内部产生可量化的工程价值,这比单纯跑分更有说服力。