← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-25

2026-09-25 08:44 CST
快速版 完整版

核心速览

【Anthropic】Claude Opus 5.5 发布,首个 Claude 5.5 系列模型 Claude Opus 5.5 在多数任务上达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,支持 1M context,定价 $4/$20 per Mtok,缓存读取 $0.20/Mtok。已设为 Claude Code 默认 Opus 模型。Anthropic 同时宣布 Sonnet 5.5 和 Haiku 5.5 将在未来几周发布,并上调了 Pro/Max/Team 套餐的五小时用量上限。

Claude Opus 5.5 is available today


【OpenAI】GPT-6 Sol 和 Luna 发布,扩展 GPT-6 模型矩阵 Sol 和 Luna 继承 GPT-6 Astra 的能力,定位更快速、更低价。Sol 适合交互式和 agentic coding,Luna 为轻量低成本选项,两者已上架 GitHub Copilot。Sam Altman 称按 per-task 定价衡量,市面上无竞争对手。GPT-6 同步改进 prompt caching,提升缓存命中率并新增诊断工具和显式断点控制,降低延迟与成本。

Introducing GPT-6 Sol and Luna | Better prompt caching for GPT-6


【OpenAI】ChatGPT Voice 大更新:支持插件、GPT-6 全系列模型及 Work 多端使用 ChatGPT Voice 现可调用邮件、日历、Slack 等插件,由 GPT-6 Astra/Sol/Luna 驱动,并在 ChatGPT Work 网页端和移动端可用,用户可通过语音创建文档、表格、站点等。全球已开始推送。

ChatGPT Voice 更新


【Anthropic】Claude Code 云端会话正式上线,脱离研究预览 Cloud sessions 允许 Claude Code 在笔记本关闭时持续工作。Pro 用户获 $100 信用额度,Max 用户获 $250。同时 Projects 新增本地设备支持,可在本机运行预览构建进行快速测试。

Cloud sessions 正式可用


【Google】Gemini 3.8 Flash 和 Flash-Lite TTS 发布,语音模型登顶 Hume AI 基准 Gemini 3.8 Flash 配套 Flash-Lite TTS 提供 2,000+ 生产级语音、100 语言支持、语音复制功能,在 Hume AI 语音基准测试中排名第一。Gemini 3.8 Live with Live Avatar 也在 Gemini Enterprise 中正式可用,支持视频头像、流式对话和工具调用。

Gemini 3.8 Flash 和 Flash-Lite TTS


重大 Benchmark 变化

本轮 SWE-bench Verified 排名仅有 1 位的微幅变动(Claude 4 Sonnet + o4-mini 升至第 9,GPT-5 降至第 10;Claude 3.5 Haiku 与 LLama 3.1 70B Critic 互换第 33/34 位),均未达到排名变动 ≥5 或分数变动 ≥5% 的报告阈值,本期无重大 benchmark 变化。

快速预览

  • Anthropic 发布 Claude Opus 5.5,多数任务达 Fable 5.1 水平、成本比 Opus 5 低 40%,Claude Code 已将其设为默认 Opus 模型
  • OpenAI 推出 GPT-6 Sol 与 Luna,继承 Astra 能力但更便宜更快,Sam Altman 称按每任务成本算「市场无对手」
  • ChatGPT Voice 大更新:支持插件(邮件/日历/Slack)、GPT-6 Astra/Sol/Luna 驱动、可在 Work 中语音创建文档和表格
  • Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中正式可用,支持视频头像与工具调用
  • SWE-bench Verified 榜单微小变动:GPT-5 与 Claude 4 Sonnet+o4-mini 互换第 9/10 位,分数不变

详细正文

模型与产品发布

日期 事件 来源
09-24 Gemini 3.8 Live with Live Avatar 正式可用,支持视频头像、流畅对话与工具调用 Google DeepMind
09-23 Gemini 3.8 Flash 与 Flash-Lite TTS 发布,2000+ 生产级语音、100 语言、Hume AI 语音榜单第一 Google DeepMind
09-23 ChatGPT Voice 支持插件、GPT-6 Astra/Sol/Luna 驱动、Work 语音建文档,全球推送 OpenAI
09-22 Claude Opus 5.5 发布,1M 上下文,$4/$20 per Mtok,缓存读 $0.20/Mtok,多数任务对标 Fable 5.1 Anthropic
09-22 GPT-6 Sol 与 Luna 发布,继承 Astra 能力但更快更省,每 token 价格为 5.6 系列的一半 OpenAI
09-22 Claude Code v2.1.280 将 Opus 5.5 设为默认 Opus 模型 Claude Code
09-22 GPT-6 Sol 与 Luna 上线 GitHub Copilot,Sol 用于交互式/agentic 编码,Luna 用于低成本小任务 GitHub × OpenAI
09-22 GPT-6 prompt caching 改进:更高缓存命中率、新诊断工具、显式断点与控制选项 OpenAI

安全、治理与政策

日期 事件 来源
09-23 Sam Altman 在联合国安理会发言,讨论 AI 安全、人类控制与国际合作 OpenAI
09-22 OpenAI 概述第三方评估的优先事项与原则,涵盖训练、评估与部署的深度访问 OpenAI
09-21 OpenAI 呼吁建立全球 AI 标准,涉及协调评估、报告与治理 OpenAI
09-18 Anthropic 与 Accenture 合作独立评估前沿 AI,双方各承诺五年内投入至少 $10 亿建设能力 Anthropic
09-17 Anthropic 发布 AI 发展速度三项指标:AI 研发中 AI 贡献占比、Agent 监督程度、算力分配 Anthropic
09-16 OpenAI 发布模型失对齐报告框架,附带 6 起训练/评估中观察到的异常行为报告 OpenAI

行业应用与生态

日期 事件 来源
09-23 Harvey 用 GPT-6 Astra 生成结构化法律文书,律师可转向策略工作 OpenAI
09-23 invideo 用 GPT-6 Astra 将调色精度提升 3 倍,一天内产出 50 个自定义效果 OpenAI
09-23 Ringg AI 代理用 GPT-5.6 解决最多 65% 客户来电,覆盖语音/聊天/WhatsApp/Web,成本比 GPT-4.1 低 90% OpenAI
09-23 Airbnb 扩大 GPT-6 Astra 使用范围,工程团队用于修 bug、设计系统与加速交付 OpenAI
09-23 Anthropic:刚果埃博拉疫情中 CEPI/WHO/INRB 使用 Claude 加速响应 Anthropic
09-23 ChatGPT Ads 扩展至东南亚和台湾,覆盖超 60 个国家 OpenAI
09-22 Parallel 用 GPT-6 Astra 将劳动力市场研究时间和成本各砍半 OpenAI
09-22 Perplexity 用 Astra 写通信、改软件、监控生产系统,检查频率大幅降低 OpenAI

开发者工具

日期 事件 来源
09-24 Claude Code v2.1.282:新增 maxProseWidth 设置,宽终端中限制散文宽度,表格/代码块保持全宽 Claude Code
09-23 Claude Code v2.1.281:支持 Claude Desktop 新策略密钥,含 blockReadsOutsideWorkingDirectories 与 disableBypassPermissionsMode Claude Code
09-23 Claude Code 云端会话正式发布,笔记本关盖后任务继续;Pro 用户 $100 额度、Max 用户 $250 ClaudeDevs
09-23 Claude Projects 支持本地设备,可直接在本地拉取预览构建快速测试 ClaudeDevs
09-23 Nimble 成为 ChatGPT/Codex 插件,结合搜索与 computer use 深化网页上下文获取 OpenAI Devs
09-22 Mirage 推出 Tesseract:为 GPT-6 Astra/Sol 重建的 After Effects/Premiere 视频 AI 代理套件 OpenAI Devs

其他值得关注


行业格局

[Artificial Analysis / Intelligence]

排名 模型 分数
1 Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) 57.6
2 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 53.4
3 GPT-6 Astra (max) 52.7

[LMArena / Overall]

排名 模型 分数
1 claude-fable-5 1505.68
2 claude-opus-4-6-high 1504.56
3 claude-opus-4-7-high 1501.75

本期无变动。

干活选型

[Artificial Analysis / Agentic]

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 57.9
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 55.6
3 GPT-6 Astra (max) 51.0

本期无变动。

[Artificial Analysis / Coding]

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 81.6
2 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) 77.1
3 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0

本期无变动。

[SWE-bench Verified]

排名 模型 + 脚手架 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

变动:Claude 4 Sonnet + o4-mini 从第 10 升至第 9(分数 74.4 不变),GPT-5 从第 9 降至第 10(分数 74.4 不变),Claude 3.5 Haiku 从第 34 升至第 33(分数 40.6 不变),Llama 3.1 70B Critic 从第 33 降至第 34(分数 40.6 不变)——均为排名微调,无分数变化。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Claude Opus 5.5 以 57.6 分登顶 Artificial Analysis Intelligence 榜且成本比 Opus 5 低 40%——这是首个在多数任务上对标 Fable 5.1(53.4 分)却大幅降价的旗舰模型,意味着 Anthropic 正在用价格换量来压缩 GPT-6 Astra(52.7 分)的市场空间。结合 Claude Code 同日将其设为默认 Opus 模型,开发者迁移成本几乎为零。

  2. GPT-6 Sol/Luna 每 token 价格为 5.6 系列一半,Sam Altman 强调「按每任务成本算市场无对手」——这直接针对 Opus 5.5 的定价策略。但 LMArena 总榜前五仍被 Claude 系列占据(fable-5 第一、opus-4-6-high 第二),OpenAI 在性价比叙事上走得通,在头部质量上尚未翻盘。

  3. ChatGPT Voice 支持插件且可在 Work 中语音创建文档/表格——这是首个将语音交互、第三方插件(邮件/日历/Slack)与生产工具(docs/decks/sites)打通的 C 端 AI 产品体验,由 GPT-6 Astra/Sol/Luna 三档驱动。此前各平台语音功能仅限对话本身,这一更新让语音从「聊天」升级为「操作入口」。

来源 · 106 条