← 返回列表
SILASCODING · AI 情报

AI 日报 2026-10-05

2026-10-05 08:46 CST
快速版 完整版

核心速览

1. 【Anthropic】Claude Sonnet 5.5 发布

Anthropic 发布 Claude 5.5 家族第二款模型 Sonnet 5.5。相比 Sonnet 5,速度提升超过 30%,多数场景成本降低最高 30%,能力显著升级。Opus 5.5 此前已于 9 月 22 日发布,性能对标 Fable 5.1,成本比 Opus 5 低 40%。Claude 5.5 家族模型在写作清晰度和迭代体验上明显提升,Haiku 5.5 也将在未来几周内推出。

→ Claude Sonnet 5.5 | Claude Opus 5.5

2. 【OpenAI】DevDay 2026 发布 20+ 公告

OpenAI DevDay 2026 发布超过 20 项公告,包括 GPT-6 Astra、GPT-6.1 Sol、dots 主动助手、Codex Security Cloud 升级等。dots 能跨应用保持上下文、协调 Codex 任务并主动提醒用户关注事项。Codex Security Cloud 新增 Daybreak Blue 网络安全模型,支持全仓库扫描和持续代码审查。

→ DevDay 2026 Recap | Introducing dots

3. 【OpenAI】GPT-6.1 Sol:接近 Astra 水平,价格为 1/5

GPT-6.1 Sol 面向编码、计算机使用和专业工作场景,API 输入输出 token 价格仅为 GPT-6 Astra 标准价的五分之一。同期发布的 GPT-6 Sol 和 Luna 则将 Astra 的前沿能力以更低成本和更高速度带入规模化工作场景,GPT-6 还改进了 prompt 缓存机制,提升命中率并降低延迟。

→ Introducing GPT-6.1 Sol | GPT-6 Sol and Luna

4. 【Anthropic】Claude Code 推出 Mods 插件系统

Claude Code v2.1.287 引入 Mods 功能,插件可修改 Claude Code 的深层行为,包括 UI 自定义和行为调整。用户可用几行 TypeScript 编写 Mod,或让 Claude 自动生成,通过 /plugin 命令安装。后续版本(v2.1.288)增加了 $.ui.selection() API,支持 Mod 获取用户选中文本。

→ Claude Code v2.1.287 | Mods 介绍

5. 【Google DeepMind】Gemini 4 Argon 智能体优化 Google 基础设施

Gemini 4 Argon 发布,据 Google 数据,Argon 智能体已在其数据中心释放超过 300 TiB 内存,支持 100 万 token 输出上限。智能体分析性能分析数据、发现内存优化方案并应用变更;同时在 C/C++ 转 Rust 迁移中处理超过 80 万行内核代码,视频解码器中 32,000 行 SIMD 代码被安全 Rust 替换后性能提升 2.7 倍。这表明 Gemini 4 已达到与 Fable/Astra 同级竞争力。

→ Gemini 4 Argon 详情

重大 Benchmark 变化

本期 SWE-bench Verified 排名变动均为 1 位小幅调整(Claude 4 Sonnet + o4-mini 从第 10 升至第 9,GPT-5 从第 9 降至第 10,Claude 3.5 Haiku 与 Llama 3.1 70B Critic 互换第 33/34 位),分数无变化,均未达到排名变动≥5 或分数变动≥5% 的报告阈值。

快速预览

  • OpenAI Codex/Work 负责人 Tibo 公开承诺未来 28 天每天交付一项明确改进或完整重置
  • Claude Code v2.1.287 引入 Mods 插件系统,v2.1.289 修复托管机器权限漏洞
  • Sam Altman 称将宗教力量赋予 AI 模型是"真实安全问题",同时确认与 Cerebras 深度合作
  • DeepSeek Harness 发布 macOS/Windows 桌面版,Linux 经 npm 获取
  • SWE-bench Verified 微调:Claude 4 Sonnet + o4-mini 升至 #9,GPT-5 降至 #10(分数均不变)

新闻

OpenAI

日期 标题 要点
10-02 GPT-6 模型选择指南 指导创业公司选模型、调推理深度、优化提示词与技能、协调工具、准备生产工作流
10-02 Chatham Financial 案例 用 Codex 和 GPT-5.6 将交易验证从 30 分钟压缩至 4 分钟以内
10-01 The eternal complement 探讨 AI 在突破性想法背后执行工作中的作用
10-01 Albertsons 零售案例 用 ChatGPT Enterprise 和 OpenAI API 提升团队效率、优化购物体验
10-01 The Den 案例 ChatGPT Work 将补助金申请从 3 天缩至 2 小时,酒牌材料从 4 天缩至 3 小时
09-30 阻断模型蒸馏攻击 破解企图提取受保护模型推理的协调行动,加强反蒸馏防御
09-30 助力小企业 AI 应用 与 America's SBDC 合作推广实操 AI 培训,发布小团队 AI 应用报告
09-29 DevDay 2026 回顾 超 20 项公告:GPT-6 Astra、Codex、API 安全与开发者工具
09-29 发布 GPT-6.1 Sol 近 Astra 智能水平,API 输入/输出 token 价格为 Astra 的 1/5
09-29 发布 dots 跨应用保持上下文、协调 Codex 任务、标记待办的前瞻助手
09-28 澳大利亚事件致歉 对涉及澳大利亚政府网站事件道歉,承诺加强网络安全防护
09-28 前沿 AI 训练安全案例 发布安全案例早期指南:技术保障、运营实践、错位事件调查
09-28 Lenfest 项目扩展 500 万美元资金 + 最多 500 万美元软件额度与工程支持
09-28 Basis 税务案例 GPT-6 Astra 完成 50 标签税务工作簿速度为 GPT-5.6 Sol 的 2 倍

OpenAI X 动态

日期 来源 要点
10-04 Tibo 承诺未来 28 天每天交付一项改进或完整重置,仅聚焦简化、效率和 groundbreaking 功能/新模型
10-03 OpenAI Devs Agents API 周更新:Computer use 1 次调用启动浏览器+agent,99.97% 轮次可靠性,工具调用快 20%
10-03 Sam Altman "将宗教力量赋予 AI 模型"是真实安全问题
10-02 Sam Altman 确认与 Cerebras 深度合作,推进速度前沿
10-02 OpenAI Devs dots 与 Codex 协同:dot 学习用户工作方式、跨应用保持上下文、协调 Codex 任务
09-29 OpenAI Codex Security Cloud 大升级:Daybreak Blue 默认包含,扫描整个 GitHub 仓库、持续审查新提交
09-29 Greg Brockman 分享前沿 RL 训练安全实践指南

Anthropic / Claude

日期 标题 要点
10-03 Claude Code v2.1.289 修复托管机器上用户安装 mod 审批覆盖嵌套 deny/ask 规则的问题
10-02 Claude Code v2.1.288 为 mods 添加 $.ui.selection():返回全屏模式下最后选中文本及对应行
10-01 Claude Code v2.1.287 引入 Claude Mods:插件可修改更深层行为
09-30 Claude Code v2.1.286 多个权限请求堆叠时显示计数如 "2 of 5"
09-29 Claude Code v2.1.285 添加 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量关闭 WebFetch 工具
10-01 Anthropic Science Blog 哈佛物理学家 Matthew Schwartz 用 Claude 做精确科学计算,发现跨学科关联
09-28 Claude Sonnet 5.5 发布 比 Sonnet 5 快 30%+,多数工作成本最多低 30%
09-25 Claude 完成 Nine Loops 在简化模型中完成九环散射振幅计算(此前记录为八环),总成本数千美元,Lance Dixon 独立验证
09-23 Claude 用于刚果埃博拉响应 CEPI、WHO 非洲区、INRB 用 Claude 加速对异常埃博拉变种的响应
09-22 Claude Opus 5.5 发布 首个 Claude 5.5 系列模型,多数任务达 Fable 5.1 水平,成本比 Opus 5 低 40%

Anthropic 个人动态

日期 来源 要点
10-01 Boris Cherny Mods 可用几行 TypeScript 编写或让 Claude 帮你生成,作为插件通过 /plugin 安装
09-28 Alex Albert Sonnet 5.5 写作清晰、速度大幅提升,是比 Sonnet 5 的重大能力跃升

Google

日期 标题 要点
10-04 Demis Hassabis 对 AI 加速科学和医学的影响感到自豪,提及 AlphaGenome Atlas 绘制全部 90 亿个单字母遗传变异
10-02 九月 AI 更新汇总 视频回顾九月 AI 更新
10-01 Project Suncatcher 卫星发射 与 Planet 合作在 SpaceX Transporter-18 发射搭载 4 个 TPU 的原型卫星,探索太空 ML 基础设施
09-30 Gemini 4 Argon agents 已释放 300+ TiB 数据中心内存;C/C++ 转 Rust 达 80 万行内核代码;视频解码器 3.2 万行 SIMD 替换为安全 Rust 后快 2.7 倍
09-28 Future Vision XPRIZE 获奖 公布获奖预告片 The Gifted
09-24 Gemini 3.8 Live Live Avatar 在 Gemini Enterprise 正式可用,支持视频头像、流畅对话、工具调用
09-27 Logan Kilpatrick 预测 2027 年将出现大规模自主收入生成 agent / 小型公司

DeepSeek

日期 标题 要点
10-02 DeepSeek Harness 桌面版 发布 macOS 和 Windows 桌面版,Linux 用户经 npm @deepseek-ai/dsh 获取

社区 / 个人

日期 来源 要点
10-04 Simon Willison 发文呼吁对 AI 支出设置默认硬预算上限
10-03 Simon Willison 讨论 dots 与 ChatGPT 的区别:dot 似乎只支持单一对话,而自己偏好多线程控制上下文
10-02 Karpathy "Land or Water?" 评估:给 LLM 经纬度文本判断陆地或水域,16,200 次查询后模型明显"知道"
10-02 Karpathy 理解 LLM 输出的技巧:ASD-STE100 受控语言、图表、HTML 交互网页、定制解释视频
10-04 HN 热门 在 RTX 4090 上以 100T/s 运行 Qwen 3.8 Flash Next (125B)(589 分)
10-04 HN 热门 macOS 上对每张照片和每帧视频进行 AI 搜索(135 分)

Benchmark 快照

行业格局

本期无变动。

AA Intelligence(综合智能)Top 3

排名 模型 分数
1 Claude Opus 5.5 (Max, Default Fallback) 57.6
2 Claude Fable 5.1 (Max, Default Fallback) 53.4
3 GPT-6 Astra (Max) 52.7

LMArena(总体)Top 3

排名 模型 分数
1 Gemini 4 Argon (High) 1525.2
2 Claude Opus 4-6 (High) 1504.7
3 Claude Fable 5 (High) 1504.3

干活选型

SWE-bench Verified 变动

模型 变化 前排名 现排名 分数
Claude 4 Sonnet + o4-mini ↑ 10 9 74.4(不变)
GPT-5 ↓ 9 10 74.4(不变)
Claude 3.5 Haiku ↑ 34 33 40.6(不变)
LLama 3.1 70B Critic ↓ 33 34 40.6(不变)

四处变动均为同分模型间的微调排名波动,分数未变。

AA Agentic(Agent 能力)Top 3

排名 模型 分数
1 Claude Fable 5.1 (Max, Default Fallback) 57.9
2 Claude Opus 5 (Xhigh) 55.6
3 GPT-6 Astra (Max) 51.0

AA Coding(编程)Top 3

排名 模型 分数
1 Claude Fable 5.1 (Max, Default Fallback) 81.6
2 Claude Fable 5.1 (Medium, Default Fallback) 77.1
3 Claude Opus 5 (Xhigh) 77.0

SWE-bench Verified Top 3

排名 模型 + 脚手架 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Tibo 28 天承诺:OpenAI Codex/Work 负责人公开承诺"未来 28 天每天交付一项明确改进或完整重置",且仅聚焦"简化、效率、groundbreaking 功能或新模型"——在用户反馈明确要求"更简单"的背景下,这是一次罕见的将产品迭代节奏与方向同时公开的自我加压,如果 28 天内未兑现将直接损害团队公信力。

  2. Claude Code Mods(v2.1.287):Mods 让插件可"修改 Claude Code 更深层行为"并可用几行 TypeScript 编写或让 Claude 自动生成,Boris 称之为"absolutely insane"——这实质上将 Claude Code 从封闭 CLI 工具转向可扩展平台,而 v2.1.289 紧急修复 mod 审批覆盖嵌套安全规则的问题,说明新插件权限模型仍在快速迭代中,早期采用者需注意托管环境下的权限边界。

  3. Gemini 4 Argon agents 内部落地:据 Google 转述,Argon agents 已在 Google 数据中心释放 300+ TiB 内存、完成 80 万行 C/C++ 转 Rust、将视频解码器 3.2 万行 SIMD 替换为安全 Rust 后提速 2.7 倍——这些是 Google 自有基础设施上的昂贵工程任务,说明 Gemini 4 Argon 不只是 benchmark 数字领先(LMArena #1),而是已经在 Google 内部产生可量化的工程价值,这比单纯跑分更有说服力。

来源 · 109 条