【Anthropic】Claude Opus 5.5 发布,首个 Claude 5.5 系列模型 Claude Opus 5.5 在多数任务上达到 Claude Fable 5.1 水平,运行成本比 Opus 5 低 40%,支持 1M context,定价 $4/$20 per Mtok,缓存读取 $0.20/Mtok。已设为 Claude Code 默认 Opus 模型。Anthropic 同时宣布 Sonnet 5.5 和 Haiku 5.5 将在未来几周发布,并上调了 Pro/Max/Team 套餐的五小时用量上限。
Claude Opus 5.5 is available today
【OpenAI】GPT-6 Sol 和 Luna 发布,扩展 GPT-6 模型矩阵 Sol 和 Luna 继承 GPT-6 Astra 的能力,定位更快速、更低价。Sol 适合交互式和 agentic coding,Luna 为轻量低成本选项,两者已上架 GitHub Copilot。Sam Altman 称按 per-task 定价衡量,市面上无竞争对手。GPT-6 同步改进 prompt caching,提升缓存命中率并新增诊断工具和显式断点控制,降低延迟与成本。
Introducing GPT-6 Sol and Luna | Better prompt caching for GPT-6
【OpenAI】ChatGPT Voice 大更新:支持插件、GPT-6 全系列模型及 Work 多端使用 ChatGPT Voice 现可调用邮件、日历、Slack 等插件,由 GPT-6 Astra/Sol/Luna 驱动,并在 ChatGPT Work 网页端和移动端可用,用户可通过语音创建文档、表格、站点等。全球已开始推送。
【Anthropic】Claude Code 云端会话正式上线,脱离研究预览 Cloud sessions 允许 Claude Code 在笔记本关闭时持续工作。Pro 用户获 $100 信用额度,Max 用户获 $250。同时 Projects 新增本地设备支持,可在本机运行预览构建进行快速测试。
【Google】Gemini 3.8 Flash 和 Flash-Lite TTS 发布,语音模型登顶 Hume AI 基准 Gemini 3.8 Flash 配套 Flash-Lite TTS 提供 2,000+ 生产级语音、100 语言支持、语音复制功能,在 Hume AI 语音基准测试中排名第一。Gemini 3.8 Live with Live Avatar 也在 Gemini Enterprise 中正式可用,支持视频头像、流式对话和工具调用。
Gemini 3.8 Flash 和 Flash-Lite TTS
本轮 SWE-bench Verified 排名仅有 1 位的微幅变动(Claude 4 Sonnet + o4-mini 升至第 9,GPT-5 降至第 10;Claude 3.5 Haiku 与 LLama 3.1 70B Critic 互换第 33/34 位),均未达到排名变动 ≥5 或分数变动 ≥5% 的报告阈值,本期无重大 benchmark 变化。
| 日期 | 事件 | 来源 |
|---|---|---|
| 09-24 | Gemini 3.8 Live with Live Avatar 正式可用,支持视频头像、流畅对话与工具调用 | Google DeepMind |
| 09-23 | Gemini 3.8 Flash 与 Flash-Lite TTS 发布,2000+ 生产级语音、100 语言、Hume AI 语音榜单第一 | Google DeepMind |
| 09-23 | ChatGPT Voice 支持插件、GPT-6 Astra/Sol/Luna 驱动、Work 语音建文档,全球推送 | OpenAI |
| 09-22 | Claude Opus 5.5 发布,1M 上下文,$4/$20 per Mtok,缓存读 $0.20/Mtok,多数任务对标 Fable 5.1 | Anthropic |
| 09-22 | GPT-6 Sol 与 Luna 发布,继承 Astra 能力但更快更省,每 token 价格为 5.6 系列的一半 | OpenAI |
| 09-22 | Claude Code v2.1.280 将 Opus 5.5 设为默认 Opus 模型 | Claude Code |
| 09-22 | GPT-6 Sol 与 Luna 上线 GitHub Copilot,Sol 用于交互式/agentic 编码,Luna 用于低成本小任务 | GitHub × OpenAI |
| 09-22 | GPT-6 prompt caching 改进:更高缓存命中率、新诊断工具、显式断点与控制选项 | OpenAI |
| 日期 | 事件 | 来源 |
|---|---|---|
| 09-23 | Sam Altman 在联合国安理会发言,讨论 AI 安全、人类控制与国际合作 | OpenAI |
| 09-22 | OpenAI 概述第三方评估的优先事项与原则,涵盖训练、评估与部署的深度访问 | OpenAI |
| 09-21 | OpenAI 呼吁建立全球 AI 标准,涉及协调评估、报告与治理 | OpenAI |
| 09-18 | Anthropic 与 Accenture 合作独立评估前沿 AI,双方各承诺五年内投入至少 $10 亿建设能力 | Anthropic |
| 09-17 | Anthropic 发布 AI 发展速度三项指标:AI 研发中 AI 贡献占比、Agent 监督程度、算力分配 | Anthropic |
| 09-16 | OpenAI 发布模型失对齐报告框架,附带 6 起训练/评估中观察到的异常行为报告 | OpenAI |
| 日期 | 事件 | 来源 |
|---|---|---|
| 09-23 | Harvey 用 GPT-6 Astra 生成结构化法律文书,律师可转向策略工作 | OpenAI |
| 09-23 | invideo 用 GPT-6 Astra 将调色精度提升 3 倍,一天内产出 50 个自定义效果 | OpenAI |
| 09-23 | Ringg AI 代理用 GPT-5.6 解决最多 65% 客户来电,覆盖语音/聊天/WhatsApp/Web,成本比 GPT-4.1 低 90% | OpenAI |
| 09-23 | Airbnb 扩大 GPT-6 Astra 使用范围,工程团队用于修 bug、设计系统与加速交付 | OpenAI |
| 09-23 | Anthropic:刚果埃博拉疫情中 CEPI/WHO/INRB 使用 Claude 加速响应 | Anthropic |
| 09-23 | ChatGPT Ads 扩展至东南亚和台湾,覆盖超 60 个国家 | OpenAI |
| 09-22 | Parallel 用 GPT-6 Astra 将劳动力市场研究时间和成本各砍半 | OpenAI |
| 09-22 | Perplexity 用 Astra 写通信、改软件、监控生产系统,检查频率大幅降低 | OpenAI |
| 日期 | 事件 | 来源 |
|---|---|---|
| 09-24 | Claude Code v2.1.282:新增 maxProseWidth 设置,宽终端中限制散文宽度,表格/代码块保持全宽 |
Claude Code |
| 09-23 | Claude Code v2.1.281:支持 Claude Desktop 新策略密钥,含 blockReadsOutsideWorkingDirectories 与 disableBypassPermissionsMode |
Claude Code |
| 09-23 | Claude Code 云端会话正式发布,笔记本关盖后任务继续;Pro 用户 $100 额度、Max 用户 $250 | ClaudeDevs |
| 09-23 | Claude Projects 支持本地设备,可直接在本地拉取预览构建快速测试 | ClaudeDevs |
| 09-23 | Nimble 成为 ChatGPT/Codex 插件,结合搜索与 computer use 深化网页上下文获取 | OpenAI Devs |
| 09-22 | Mirage 推出 Tesseract:为 GPT-6 Astra/Sol 重建的 After Effects/Premiere 视频 AI 代理套件 | OpenAI Devs |
[Artificial Analysis / Intelligence]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Adaptive Reasoning, Max Effort, Default Fallback) | 57.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 53.4 |
| 3 | GPT-6 Astra (max) | 52.7 |
[LMArena / Overall]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1505.68 |
| 2 | claude-opus-4-6-high | 1504.56 |
| 3 | claude-opus-4-7-high | 1501.75 |
本期无变动。
[Artificial Analysis / Agentic]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 55.6 |
| 3 | GPT-6 Astra (max) | 51.0 |
本期无变动。
[Artificial Analysis / Coding]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
本期无变动。
[SWE-bench Verified]
| 排名 | 模型 + 脚手架 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
变动:Claude 4 Sonnet + o4-mini 从第 10 升至第 9(分数 74.4 不变),GPT-5 从第 9 降至第 10(分数 74.4 不变),Claude 3.5 Haiku 从第 34 升至第 33(分数 40.6 不变),Llama 3.1 70B Critic 从第 33 降至第 34(分数 40.6 不变)——均为排名微调,无分数变化。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Opus 5.5 以 57.6 分登顶 Artificial Analysis Intelligence 榜且成本比 Opus 5 低 40%——这是首个在多数任务上对标 Fable 5.1(53.4 分)却大幅降价的旗舰模型,意味着 Anthropic 正在用价格换量来压缩 GPT-6 Astra(52.7 分)的市场空间。结合 Claude Code 同日将其设为默认 Opus 模型,开发者迁移成本几乎为零。
GPT-6 Sol/Luna 每 token 价格为 5.6 系列一半,Sam Altman 强调「按每任务成本算市场无对手」——这直接针对 Opus 5.5 的定价策略。但 LMArena 总榜前五仍被 Claude 系列占据(fable-5 第一、opus-4-6-high 第二),OpenAI 在性价比叙事上走得通,在头部质量上尚未翻盘。
ChatGPT Voice 支持插件且可在 Work 中语音创建文档/表格——这是首个将语音交互、第三方插件(邮件/日历/Slack)与生产工具(docs/decks/sites)打通的 C 端 AI 产品体验,由 GPT-6 Astra/Sol/Luna 三档驱动。此前各平台语音功能仅限对话本身,这一更新让语音从「聊天」升级为「操作入口」。