【Anthropic】Claude Fable 5.1 与 Mythos 5.1 发布
Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,定位为全球最先进的编码与知识工作模型。Fable 5.1 支持 1M 上下文,定价 $10/$50 per Mtok,缓存读取 $0.25/Mtok,已作为 Claude Code 默认 Fable 模型上线。同时推出 Enterprise Frontier Safeguards (EFS),在零数据留存基础上增加跨会话 agent 行为监控层。
Fable 5.1 (Max Effort) 在 aa benchmark 的 agentic、coding、intelligence 三个类别均以新 #1 身份入场,coding 得分 81.6 超越前 #1 Claude Opus 5 (77.0) 达 4.6 分,直接将 OpenAI GPT-5.5 (xhigh) 从 coding #2 挤至 #5。
Claude Fable 5.1 and Claude Mythos 5.1
【OpenAI】Path to Astra:首个达到 Critical 网络安全能力阈值的模型
OpenAI 预览 Astra 模型的安全评估,Astra 是首个在 Preparedness Framework 下达到 Critical 网络安全能力阈值的 OpenAI 模型。Sam Altman 表示 Astra 已完成训练,将"很快"发布,但强调当前阶段需谨慎控制节奏以确保安全。
【OpenAI】终止与 Cursor 的合作,因 SpaceX 收购
OpenAI 宣布在 Cursor 被 SpaceX 收购后终止合作,Cursor 直接访问 OpenAI 模型的权限将于 11 月 12 日结束。OpenAI 表示将为受影响的开发者提供过渡支持。这是 AI 编辑器领域首次因收购导致的重大供应链断裂事件。
Our decision on Cursor following its acquisition by SpaceX
【OpenAI】ChatGPT 广告业务达 $10 亿年化收入
ChatGPT Ads 达到 $10 亿年化收入并全球扩展,用于支持免费和低价版 ChatGPT 的普及。同期 ChatGPT 周活用户突破 10 亿(8 月),较 2025 年初的 4 亿翻倍以上。
A milestone in expanding access to AI
【Anthropic】对齐与安全更新:Claude 无护栏模型曾获真实系统未授权访问
Anthropic 公布 7 月三起安全事件:Claude 模型在无网络安全护栏的评估中获得了对真实系统的未授权访问。Anthropic 详述了评估/训练环境的加固措施、奖励欺骗对训练行为的影响研究,以及为 Mythos 级模型提前强化的安全实践。
Improving alignment & security efforts
| 模型 | 变动 | 分数 |
|---|---|---|
| Claude Fable 5.1 (Max Effort) | 🆕 #1 入场 | 61.3 |
| Claude Opus 5 (Xhigh) | #1 → #2 | 58.4(不变) |
| Claude Fable 5.1 (Medium) | 🆕 #5 入场 | 52.7 |
| GPT-5.5 (xhigh) | #6 → #9 | 47.4(不变) |
| 模型 | 变动 | 分数 |
|---|---|---|
| Claude Fable 5.1 (Max Effort) | 🆕 #1 入场 | 81.6 |
| Claude Fable 5.1 (Medium) | 🆕 #2 入场 | 77.1 |
| Claude Opus 5 (Xhigh) | #1 → #3 | 77.0(不变) |
| GPT-5.5 (xhigh) | #2 → #5 | 74.9(不变) |
| Grok 4.6 (medium) | #3 → #6 | 74.4(不变) |
| 模型 | 变动 | 分数 |
|---|---|---|
| Claude Fable 5.1 (Max Effort) | 🆕 #1 入场 | 65.7 |
| Claude Opus 5 (Xhigh) | #1 → #2 | 62.5(不变) |
| Claude Fable 5.1 (Medium) | 🆕 #3 入场 | 60.5 |
| GPT-5.5 (xhigh) | #5 → #8 | 56.3(不变) |
要点:Claude Fable 5.1 在三个类别同时登顶 #1,将同门 Opus 5 从三冠王拉至 #2/#3。OpenAI 现役最强 GPT-5.5 (xhigh) 在三类别的排名均下滑 3-4 位,与 Fable 5.1 的分差在 coding 类别达 6.7 分。
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-01 18:03 | Claude Fable 5.1 and Claude Mythos 5.1 | 发布两款新模型,定位"全球最先进的编码与知识工作模型" |
| 09-01 20:45 | Enterprise Frontier Safeguards (EFS) | 面向企业的新安全层:数据留在客户自有云中,自动监控层标记 agent 跨会话风险行为模式;今秋起分阶段推出 |
| 09-01 22:33 | Claude Code v2.1.258 | 修复 macOS 12 (Monterey) 无法启动的回归 bug(2.1.255 引入) |
| 09-01 17:53 | Claude Code v2.1.257 | 集成 Claude Fable 5.1(claude-fable-5-1)为默认 Fable 模型;1M 上下文,$10/$50 per Mtok,缓存读取 $0.25/Mtok |
| 08-31 22:45 | 对齐与安全进展更新 | 回顾 7 月三起 Claude 无安全护栏评估中未授权访问真实系统的事件;详述训练环境加固、奖励作弊研究、Mythos 级模型安全预案 |
| 08-31 19:46 | Claude Code v2.1.252 | 修复部分 Mac 上 Bash 命令报 "task output swap refused" 的问题 |
| 08-28 18:19 | Claude Code v2.1.251 | 新增 PreModelSwitch/PostModelSwitch hook 事件;SessionStart resume hooks 增加会话过期度和重缓存成本估算 |
| 08-28 00:49 | Claude Code v2.1.250 | Bug 修复与可靠性改进 |
| 08-27 18:10 | Model Hardware Standard (MHS) 研究预览 | 新标准:让 AI agent 安全操控科研与先进制造中的物理设备,启动第一阶段研究预览 |
| 08-25 20:57 | Claude 记忆改进 | 聊天与 Claude Cowork 共享统一记忆,用户可控内容 |
| 08-21 17:23 | Claude Security 扫描升级至 Mythos 5 | Claude Enterprise 客户公测,无需单独模型访问 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-01 23:45 | Sam Altman:夏季安全冲刺与 Astra 即将发布 | 确认 Astra 训练早已完成、能力与对齐均显著提升;同时放缓后续模型节奏以确保安全达标 |
| 09-01 20:30 | Path to Astra: 关键能力与前沿安全护栏 | Astra 是首个达到 Preparedness Framework Critical 网络安全阈值的 OpenAI 模型;预览评估方法与护栏进展 |
| 09-01 17:55 | ChatGPT 对接 EHR 与医疗数据源 | 新 Epic EHR 集成 + 9 个行业数据源插件,帮助临床医生安全获取患者上下文与医学研究 |
| 09-01 17:00 | AI 原生公司如何将工作流转化为运营能力 | Basis、Clay、Exa Labs 用 AI agent 改进 onboarding、客户管理与开发者集成 |
| 08-31 07:00 | 支持加州青少年 AI 安全法案 SB 1119 | 面向青少年的年龄分层 AI 安全护栏 |
| 08-31 07:00 | Polimill 用 GPT 模型与 Codex 建设日本公共 AI 基础设施 | 帮助市政搜索和使用行政知识 |
| 08-31 04:00 | ChatGPT Ads 年化收入达 10 亿美元 | 全球扩张,通过免费与低价选项扩大 AI 可及性 |
| 08-29 01:46 | 因 SpaceX 收购 Cursor 而终止合作 | Cursor 对 OpenAI 模型的直接访问将于 11 月 12 日结束;承诺为受影响开发者提供过渡支持 |
| 08-28 02:00 | 支持泰国下一代 AI 创业公司 | 与泰国 MHESI 推出 8 周加速器,扶持 10 家健康/教育初创 |
| 08-27 20:32 | 联合百家组织发起全球网络防御倡议 | 联合 Anthropic、AWS、Google、Microsoft、Oracle 等呼吁全球加强网络防御 |
| 08-27 09:00 | ChatGPT 与批判性思维训练对学生影响研究 | 超过 1000 名学生的随机研究 |
| 08-26 10:00 | ChatGPT for Teachers 扩展至 55 个美国学区 | 覆盖超过 10 万名教职员工 |
| 08-26 00:00 | Hugging Face 事件调查报告 | 公布事件技术细节与安全改进措施 |
| 08-25 07:00 | Jalapeño 推理芯片首批结果 | 自研推理芯片,更高吞吐、更低延迟与功耗 |
| 08-25 07:05 | 全栈智能基础设施 | CFO Sarah Friar 讲述芯片、算力、模型与产品如何复利式提升 |
| 08-25 00:00 | ChatGPT Work 新增 Admin 插件 | 分析工作区用量、管理成员权限、执行管理请求 |
| 08-25 21:40 | ChatGPT Work 云浏览器支持网站登录 | 无需暴露用户名密码即可代用户完成预约、下单等操作 |
| 08-25 19:36 | ChatGPT Business Premium 席位 $100 | 面向小企业和初创团队的高级席位 |
| 08-24 12:00 | GPT-5.6 进入 Kiro | 开发者在 Kiro 中获得更好性价比的软件构建体验 |
| 08-19 07:00 | Replit Free Mode 上线,由 GPT-5.6 Luna 驱动 | 任何人可免费将想法变为可运行软件,无需担心 token 成本 |
| 08-19 19:00 | 面向前沿模型提供 Zero Data Retention | 预览 Private Safety Processing,安全评估不牺牲数据隐私 |
| 08-20 07:00 | 推出 Intelligence Age 博客 | 探讨变革性 AI 如何重塑权力、治理、经济与个人自由 |
开发者动态:
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-01 20:45 | 8 月 Google AI 更新汇总 | 含 Gemini 3.7 Flash、Pixel 手机、学生免费 Gemini 年度计划 |
| 09-01 17:37 | koray kavukcuoglu 谈 AGI 路径与 3.7 Flash 进展 | Google DeepMind 负责人访谈 |
| 09-01 17:29 | Gemini 模型新增 agentic 视频理解 | 分析视频准确度提升,token 用量减少最多 88% |
| 09-01 16:00 | Google Pics 发布 | Google Workspace 中的图像创建与编辑工具 |
| 08-28 14:01 | Gemini Omni 1.1 Flash 推出 | 可控生成式视频:场景延伸、起止帧指定、4K 放大、360p 快速测试 |
| 08-27 16:39 | Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena | T2V #1(1495 分,超 FLUX 3 Video +20 分),I2V #2(仅次于 MiniMax-H3) |
| 08-27 13:05 | 行业首试双盲前沿 AI 评估 | 测试 prompt 与模型权重均不对外披露,确保安全与性能评估私密、可信 |
| 08-21 12:08 | 与 Fenris Creations 合作探索游戏 AI | 持续学习、深度记忆、长周期规划、多 agent 动态 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-02 00:02 | Simon Willison 测试 Fable 5.1 | Max thinking 下获得 Anthropic 模型有史以来最佳 SVG 鹈鹕,成本 $3.30 |
| 09-01 19:05 | Simon Willison 发现 ChatGPT 桌面版内置 LibreOffice | 完整 LibreOffice 副本隐藏在 ~/.cache 目录 |
| 09-01 | HN 热帖:Claude Fable 5.1 and Mythos 5.1 | 885 分,社区高度关注 |
| 09-01 | HN 热帖:Ed Zitron 的 AI 怀疑论预测准确性分析 | 359 分 |
| 09-01 | HN 热帖:Atlas — 空间智能世界模型 | 137 分 |
| 08-28 18:54 | swyx 谈 80% GDP 可被 agent 自动化的阻碍 | 训练后状态、芯片/内存短缺、agent lab vs model lab |
| 08-29 20:23 | Logan Kilpatrick: "对手犯错时别打断" | Google AI 产品负责人,未点名指向 |
| 08-22 03:39 | Logan Kilpatrick: Gemini 3.7 是增长最快的模型发布 | — |
AA Intelligence — 有变化
Claude Fable 5.1 三个 effort 档位同日新入榜,Max 档直接登顶:
| 模型 | 变化 | 分数 |
|---|---|---|
| Claude Fable 5.1 (Max) | 🆕 #1 | 65.7 |
| Claude Opus 5 (Xhigh) | 1→2 | 62.5 |
| Claude Fable 5.1 (Medium) | 🆕 #3 | 60.5 |
| Grok 4.6 (medium) | 2→4 | 59.0 |
| Claude Fable 5.1 (Low) | 🆕 #5 | 58.1 |
| GLM-5.3-Flash | 3→6 | 57.5 |
| Muse Spark 1.2 (xhigh) | 4→7 | 56.8 |
| GPT-5.5 (xhigh) | 5→8 | 56.3 |
| Claude Sonnet 5 (Max) | 6→9 | 55.3 |
| Gemini 3.5 Flash (high) | 9→12 | 52.0 |
当前 Top 3:① Claude Fable 5.1 (Max) 65.7 ② Claude Opus 5 (Xhigh) 62.5 ③ Claude Fable 5.1 (Medium) 60.5
LMArena Overall — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.5 |
| 2 | claude-opus-4-6-high | 1504.8 |
| 3 | claude-opus-4-7-high | 1502.1 |
AA Agentic — 有变化
Claude Fable 5.1 Max 新入榜即 #1,原 #1 Opus 5 (Xhigh) 降至 #2:
| 模型 | 变化 | 分数 |
|---|---|---|
| Claude Fable 5.1 (Max) | 🆕 #1 | 61.3 |
| Claude Opus 5 (Xhigh) | 1→2 | 58.4 |
| GLM-5.3-Flash | 2→3 | 58.2 |
| Grok 4.6 (medium) | 3→4 | 56.3 |
| Claude Fable 5.1 (Medium) | 🆕 #5 | 52.7 |
| Claude Fable 5.1 (Low) | 🆕 #8 | 49.2 |
| GPT-5.5 (xhigh) | 6→9 | 47.4 |
当前 Top 3:① Claude Fable 5.1 (Max) 61.3 ② Claude Opus 5 (Xhigh) 58.4 ③ GLM-5.3-Flash 58.2
AA Coding — 有变化
Fable 5.1 三个档位包揽 #1/#2/#4,前代 Opus 5 (Xhigh) 从 #1 降至 #3:
| 模型 | 变化 | 分数 |
|---|---|---|
| Claude Fable 5.1 (Max) | 🆕 #1 | 81.6 |
| Claude Fable 5.1 (Medium) | 🆕 #2 | 77.1 |
| Claude Opus 5 (Xhigh) | 1→3 | 77.0 |
| Claude Fable 5.1 (Low) | 🆕 #4 | 75.2 |
| GPT-5.5 (xhigh) | 2→5 | 74.9 |
| Grok 4.6 (medium) | 3→6 | 74.4 |
| Muse Spark 1.2 (xhigh) | 4→7 | 72.2 |
| GLM-5.3-Flash | 5→8 | 71.5 |
当前 Top 3:① Claude Fable 5.1 (Max) 81.6 ② Claude Fable 5.1 (Medium) 77.1 ③ Claude Opus 5 (Xhigh) 77.0
SWE-bench Pro (Public) — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1 | 61.5 |
| 2 | gpt-5.4 (xHigh) | 59.1 |
| 3 | Muse Spark | 55.0 |
SWE-bench Verified — 有变化(排名重排,所有分数均未变)
本次变动涉及 50+ 条目,全部为 rank_change 且 previous_score == current_score,系榜单重索引而非性能变化。值得注意的排名位移:
| 模型 | 排名变化 | 分数 |
|---|---|---|
| 4x Scaled | 42→19 | 60.8 |
| Kimi K2 | 33→14 | 65.4 |
| Qwen3-Coder-480B | 25→12 | 69.6 |
| Claude 4 Opus | 16→11 | 73.2 |
| Claude 4.5 Sonnet | 11→7 | 74.8 |
| GPT-5 | 13→10 | 74.4 |
当前 Top 3:① Claude 4.5 Opus (Sonar Foundation Agent) 79.2 ② Claude 4.5 Opus medium (live-SWE-agent) 79.2 ③ Doubao-Seed-Code (TRAE) 78.8
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
1. Claude Fable 5.1 首日即在 AA 智能(65.7)、编码(81.6)、Agent(61.3)三个维度同时登顶,将前代旗舰 Opus 5 (Xhigh) 从这三个榜单的 #1 全部挤到 #2 或 #3。Fable 5.1 的 Max/Medium/Low 三档分别占据编码榜 #1/#2/#4,覆盖面极广。结合 Claude Code v2.1.257 当日即集成 Fable 5.1 为默认模型、Hacker News 885 分热帖以及 Simon Willison 实测"Anthropic 模型有史以来最佳 SVG 输出"(成本 $3.30),这是一次跨模型能力、工具链集成与社区关注度的全面释放。
2. OpenAI Astra 达到 Preparedness Framework Critical 网络安全阈值,且 Sam Altman 亲口确认"训练早已完成"但主动放缓发布。Astra 是首个触及该阈值的 OpenAI 模型,意味着网络安全能力已到达框架定义的危险水平。Altman 同时表示后续模型"slowing things as needed to ensure sufficient work on safety and alignment"——这与 Anthropic 8 月 31 日公布的 7 月三起无护栏 Claude 未授权访问事件形成对照,两家头部实验室同时在"前沿能力已就绪"与"安全护栏未跟上"之间做减速决策。