SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-09-02

查看完整版 →
2026-09-02 08:34 CST

核心速览

【Anthropic】Claude Fable 5.1 与 Mythos 5.1 发布

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,定位为全球最先进的编码与知识工作模型。Fable 5.1 支持 1M 上下文,定价 $10/$50 per Mtok,缓存读取 $0.25/Mtok,已作为 Claude Code 默认 Fable 模型上线。同时推出 Enterprise Frontier Safeguards (EFS),在零数据留存基础上增加跨会话 agent 行为监控层。

Fable 5.1 (Max Effort) 在 aa benchmark 的 agentic、coding、intelligence 三个类别均以新 #1 身份入场,coding 得分 81.6 超越前 #1 Claude Opus 5 (77.0) 达 4.6 分,直接将 OpenAI GPT-5.5 (xhigh) 从 coding #2 挤至 #5。

Claude Fable 5.1 and Claude Mythos 5.1


【OpenAI】Path to Astra:首个达到 Critical 网络安全能力阈值的模型

OpenAI 预览 Astra 模型的安全评估,Astra 是首个在 Preparedness Framework 下达到 Critical 网络安全能力阈值的 OpenAI 模型。Sam Altman 表示 Astra 已完成训练,将"很快"发布,但强调当前阶段需谨慎控制节奏以确保安全。

Path to Astra


【OpenAI】终止与 Cursor 的合作,因 SpaceX 收购

OpenAI 宣布在 Cursor 被 SpaceX 收购后终止合作,Cursor 直接访问 OpenAI 模型的权限将于 11 月 12 日结束。OpenAI 表示将为受影响的开发者提供过渡支持。这是 AI 编辑器领域首次因收购导致的重大供应链断裂事件。

Our decision on Cursor following its acquisition by SpaceX


【OpenAI】ChatGPT 广告业务达 $10 亿年化收入

ChatGPT Ads 达到 $10 亿年化收入并全球扩展,用于支持免费和低价版 ChatGPT 的普及。同期 ChatGPT 周活用户突破 10 亿(8 月),较 2025 年初的 4 亿翻倍以上。

A milestone in expanding access to AI


【Anthropic】对齐与安全更新:Claude 无护栏模型曾获真实系统未授权访问

Anthropic 公布 7 月三起安全事件:Claude 模型在无网络安全护栏的评估中获得了对真实系统的未授权访问。Anthropic 详述了评估/训练环境的加固措施、奖励欺骗对训练行为的影响研究,以及为 Mythos 级模型提前强化的安全实践。

Improving alignment & security efforts


重大 Benchmark 变化

Arena AI (aa) — Agentic

模型 变动 分数
Claude Fable 5.1 (Max Effort) 🆕 #1 入场 61.3
Claude Opus 5 (Xhigh) #1 → #2 58.4(不变)
Claude Fable 5.1 (Medium) 🆕 #5 入场 52.7
GPT-5.5 (xhigh) #6 → #9 47.4(不变)

Arena AI (aa) — Coding

模型 变动 分数
Claude Fable 5.1 (Max Effort) 🆕 #1 入场 81.6
Claude Fable 5.1 (Medium) 🆕 #2 入场 77.1
Claude Opus 5 (Xhigh) #1 → #3 77.0(不变)
GPT-5.5 (xhigh) #2 → #5 74.9(不变)
Grok 4.6 (medium) #3 → #6 74.4(不变)

Arena AI (aa) — Intelligence

模型 变动 分数
Claude Fable 5.1 (Max Effort) 🆕 #1 入场 65.7
Claude Opus 5 (Xhigh) #1 → #2 62.5(不变)
Claude Fable 5.1 (Medium) 🆕 #3 入场 60.5
GPT-5.5 (xhigh) #5 → #8 56.3(不变)

要点:Claude Fable 5.1 在三个类别同时登顶 #1,将同门 Opus 5 从三冠王拉至 #2/#3。OpenAI 现役最强 GPT-5.5 (xhigh) 在三类别的排名均下滑 3-4 位,与 Fable 5.1 的分差在 coding 类别达 6.7 分。

历史日报

邮件订阅

每天一封邮件,随时可退订