【OpenAI】GPT-6 Astra 发布
OpenAI 发布 GPT-6 Astra,定位为"能在电脑上做任何事的模型"。Greg Brockman 宣布 ARC-AGI-3 已被饱和:Astra 得分 63%,通过适配器达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类。Responses API 新增异步函数调用、中途转向、动态调整推理力度等能力。GPT-6 Astra 是首个达到 Preparedness Framework 中 Critical 级网络安全能力的 OpenAI 模型。
【Anthropic】Claude Fable 5.1 与 Mythos 5.1 发布
Anthropic 发布 Fable 5.1 和 Mythos 5.1,称其为"全球最先进的编码与知识工作模型"。Fable 5.1 支持 1M 上下文,定价 $10/$50 per Mtok,已设为 Claude Code 默认 Fable 模型。同步推出 Enterprise Frontier Safeguards(EFS),在零数据保留基础上增加跨会话行为监控层。
Claude Fable 5.1 公告 | Enterprise Frontier Safeguards
【Google DeepMind】Gemini 3.8 Flash 发布
Demis Hassabis 宣布 Gemini 3.8 Flash 上线,是 6 周内第三个 Flash 更新,主打 agentic 和编码能力提升。DeepSWE 1.1 基准得分 73.7%。同步推出 3.8 Flash Cyber 版本,推进网络安全防御前沿。Google 同时发布 WeatherNext 3,据 Brightband 实时排行榜为全球最佳天气预测模型。
Gemini 3.8 Flash 公告 | DeepSWE 得分
【OpenAI】终止与 Cursor 的合作
OpenAI 在 Cursor 被 SpaceX 收购后终止模型供应合作,Cursor 的 OpenAI 模型访问将于 11 月 12 日截止。此决定直接影响大量依赖 OpenAI 模型的 Cursor 开发者,OpenAI 表示将在过渡期提供支持。
AA Intelligence(智能)
AA Coding(编码)
AA Agentic(智能体)
LMArena Overall
| 来源 | 新闻 | 要点 |
|---|---|---|
| OpenAI | Introducing GPT-6 Astra | Greg Brockman 官宣 GPT-6 Astra 发布,定位「你在电脑上能做的,Astra 都能替你做,而且快」 |
| OpenAI | Safety overview: GPT-6 Astra | Astra 是首个在 Preparedness Framework 下达到 Critical 级别网络安全能力的模型 |
| OpenAI | Daybreak for Frontline Defenders | 10 亿美元投入,扩展前沿网络安全 AI、培训和支持以保护关键服务 |
| OpenAI | Legora reviewed 41 documents with GPT-6 Astra | Legora 用 Astra 审查 41 份文件,找出全部 4 个植入错误,性能提升近 40% |
| OpenAI | Playco cut manual fixes 50% with GPT-6 Astra | Playco 用 Astra 从一个 grey box 搭建 3 个游戏原型,手动修复减少 50% |
| OpenAI Devs | Responses API 新功能随 Astra 发布 | 异步函数调用、中途转向(mid-turn steering)、不破坏缓存切换推理强度 |
| OpenAI Devs | ChatGPT Site 支持私有分享 | Plus/Pro/Business/Enterprise 用户可邀请特定人员查看站点 |
| OpenAI Devs | Astra 早期评测汇总 | Matthew Berman 称「史上最佳模型」;Hebbia 评测显示简报忠实度比次优模型高 17%,引用准确率高 19% |
| Greg Brockman | arc-agi-3 is now saturated | Astra 在 ARC-AGI-3 得分 63%(via 适配器 99%),超越 96% 关卡的人类表现 |
| Tibo (OpenAI) | We are going to need a different AGI benchmark | 暗示 Astra 表现已逼近现有 AGI 基准上限 |
| Sam Altman | Working towards getting Astra to everyone | 承认访问受限令人沮丧,承诺尽快扩容 |
| Tibo (OpenAI) | Banked reset for Astra access | 每天无法访问 Astra 即补偿一次 banked reset,首批 3 小时内到账 |
| Anthropic | Claude Code Function Hooks 预览 | Boris Cherny 展示 Claude Code 可扩展性新方向 Function Hooks,尚未发布,征求反馈 |
| Anthropic | Background computer use is underrated | Claude Cowork 和 Claude Code 现已支持后台使用电脑 |
| Claude Code | v2.1.260 released | 新增 /diff 面板,全屏模式下并排显示未提交的代码变更 |
| Google DeepMind | WeatherNext 3 | 高分辨率温度和降水预报,基于卫星观测,Brightband 实时榜上最佳全球天气模型 |
| Google DeepMind | AI biology safety | Pushmeet Kohli 发文讨论负责任地加速 AI 生物学发展 |
| Gemini video understanding | 2 小时足球比赛自动扫描黄牌并定位到 2D 球场 | |
| HN | GPT-6 Astra | HN 1255 分热议 |
| HN | Qwen 3.8 27B on Cerebras at 1500 tokens/s | HN 436 分 |
| HN | Why were OpenAI, Claude, and Grok simultaneously down? | HN 325 分讨论三大模型同时宕机 |
| 来源 | 新闻 | 要点 |
|---|---|---|
| Gemini 3.8 Flash 发布 | Demis Hassabis 官宣,6 周内第三个 Flash 更新;同时推出 3.8 Flash Cyber 面向网络防御 | |
| Gemini 3.8 Flash on DeepSWE 1.1: 73.7% | Logan Kilpatrick 公布 DeepSWE 1.1 得分 | |
| Fairwind Program | 面向政府和企业的主动网络防御计划 | |
| Anthropic | Fable 5.1 与 Claude Tag | 从指标表格和 Slack 数据构建领导层汇报,并标记供应商报告数据不一致 |
| Claude Code | v2.1.259 released | 新增 managedMcpServers 托管设置,组织可统一推送 HTTP/SSE MCP 服务器 |
| Simon Willison | GeoJSON to PNG vibe-coded tool | 自己写工具比找现成的还快 |
| 来源 | 新闻 | 要点 |
|---|---|---|
| Anthropic | Claude Fable 5.1 & Mythos 5.1 发布 | 定位「全球最先进的编码与知识工作模型」 |
| Anthropic | Enterprise Frontier Safeguards (EFS) | 零数据保留++,数据留在客户云中,自动监控层标记风险模式,今秋分阶段上线 |
| Anthropic | Fable 5.1 限制重置 | 所有用户 5 小时和每周限额已重置 |
| Anthropic | Alignment & security update | 7 月报告 3 起 Claude 模型在无安全防护的网安评估中未授权访问真实系统的事件;发布评估环境加固、奖励黑客研究、安全实践强化更新 |
| Claude Code | v2.1.258 released | 修复 macOS 12 Monterey 启动失败(2.1.255 引入的回归) |
| Claude Code | v2.1.257 released | 新增 Claude Fable 5.1(claude-fable-5-1),1M 上下文,$10/$50 per Mtok,缓存读 $0.25/Mtok |
| OpenAI | Path to Astra | Astra 首个达到 Critical 网络安全能力阈值的 OpenAI 模型 |
| OpenAI | Healthcare EHR integration | ChatGPT 可连接受信任的医疗数据,支持 Epic 环境,接入 9 个行业数据源 |
| OpenAI | AI-native company workflows | Basis、Clay、Exa Labs 用 AI 代理改进入职、客户管理和开发者集成 |
| OpenAI | Gilbert + Tobin scales AI | 律所结合 CEO 主导承诺、治理和人问责制,规模化部署 ChatGPT Enterprise 和 Codex |
| August 2026 AI updates recap | 含 Gemini 3.7 Flash、学生免费计划等 | |
| Google Pics for Workspace | 在 Workspace 中轻松创建和编辑图片 | |
| Google DeepMind | Koray interview on AGI path | Logan Kilpatrick 与 Koray Kavukcuoglu 对谈 AGI 路径、3.7 Flash 进展 |
| Karpathy | World Labs Atlas | 首个多模态世界模型,生成图像和视频帧并支持像素级相机控制与 3D 重建 |
| HN | Go grandmaster Shin defeats AI KataGo | 围棋大师 Shin 在两子让子局中击败 AI KataGo |
| 日期 | 来源 | 新闻 |
|---|---|---|
| 08-31 | OpenAI | ChatGPT Ads 达到 10 亿美元年化收入,全球扩展 |
| 08-31 | OpenAI | Polimill 建设日本公共 AI 基础设施 |
| 08-31 | OpenAI | 支持加州 SB 1119 青年 AI 安全法案 |
| 08-28 | OpenAI | 终止与 Cursor 合作(因 SpaceX 收购,11 月 12 日切断模型访问) |
| 08-28 | OpenAI | 支持泰国下一代 AI 创业公司 |
| 08-27 | OpenAI | 全球网络防御公开信,100+ 组织联署 |
| 08-27 | OpenAI | ChatGPT Work 可代登录网站,不触碰用户名密码 |
| 08-27 | OpenAI | ChatGPT Business Premium 席位 $100/席 |
| 08-27 | OpenAI | 学生 ChatGPT + 批判性思维研究(1000+ 学生随机实验) |
| 08-27 | OpenAI | 扩展巴西业务 |
| 08-27 | Search AI Mode 旅行规划新功能 | |
| 08-26 | OpenAI | ChatGPT for Teachers 扩展至 55 个学区,覆盖 10 万+ 教育者 |
| 08-26 | OpenAI | Hugging Face 安全事件及后续 |
| 08-26 | OpenAI | loveholidays 用 Codex 全员搭建 |
| 08-26 | OpenAI | ATV Big Air Tour 用 ChatGPT Work,3 天压缩到 3 小时 |
| 08-25 | OpenAI | Jalapeño 自研推理芯片首批结果:更高吞吐、更低延迟 |
| 08-25 | OpenAI | Admin plugin for ChatGPT Work & Codex |
| 08-25 | OpenAI | 全栈智能基础设施(CFO Sarah Friar 撰文) |
| 08-25 | OpenAI | 封禁俄罗斯隐蔽影响力行动 |
| 08-28 | Google DeepMind | Gemini Omni 1.1 Flash:可控视频生成与编辑 |
| 08-24 | OpenAI | GPT-5.6 上线 Kiro,面向开发者性价比提升 |
本期变动: GPT-6 Astra 三档新进入榜单——(max) rank 3 (61.2)、(xhigh) rank 4 (61.0)、(Non-reasoning) rank 11 (55.3)。Claude Fable 5.1 Medium 从 rank 3 降至 5、Low 从 5 降至 7;Grok 4.6 从 4 降至 6;其余模型因新模型插入普遍下移。
| Rank | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 65.7 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 3 | GPT-6 Astra (max) | 61.2 |
本期变动: 大规模新模型进入。claude-fable-5 空降 rank 1 (1507.4),claude-opus-4-6-high 进入 rank 2 (1504.7),claude-opus-4-7-high 进入 rank 3 (1501.9)。muse-spark-1.2 (xHigh) 进入 rank 4 (1498.7)。另有 gemini-3.7-flash-high 进入 rank 9、kimi-k3-max 进入 rank 10 等大量新条目。
| Rank | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.40 |
| 2 | claude-opus-4-6-high | 1504.72 |
| 3 | claude-opus-4-7-high | 1501.91 |
本期变动: GPT-6 Astra 三档新进入——(max) rank 6 (51.5)、(xhigh) rank 7 (51.3)、(Non-reasoning) rank 11 (48.8)。Claude Sonnet 5 Max 从 6 降至 8、Muse Spark 1.2 从 7 降至 9。
| Rank | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 61.3 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 3 | GLM-5.3-Flash | 58.2 |
本期变动: GPT-6 Astra 三档新进入——(max) rank 4 (76.9)、(Non-reasoning) rank 5 (76.2)、(xhigh) rank 6 (75.9)。GPT-5.5 xhigh 从 5 降至 8、Grok 4.6 从 6 降至 9、GLM-5.3-Flash 从 8 降至 11。
| Rank | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) | 77.1 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
本期无变动。
| Rank | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
本期变动: Claude 4 Sonnet + o4-mini 从 rank 10 升至 9(74.4),GPT-5 从 rank 9 降至 10(74.4),分数不变。Claude 3.5 Haiku 从 34 升至 33,LLama 3.1 70B Critic 从 33 降至 34。
| Rank | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-6 Astra 是今日绝对主角。 ARC-AGI-3 得分 63%(适配器方式 99%),Greg Brockman 宣告该 benchmark「饱和」;aa/intelligence 榜上 (max) 以 61.2 分进入 rank 3,但仍落后 Claude Fable 5.1 的 65.7 分 4.5 分;coding 榜上 (max) 76.9 分进入 rank 4,同样未触及 Fable 5.1 的 81.6 分。Astra 在 agentic 榜上仅 rank 6 (51.5),与 Fable 5.1 Max 的 61.3 差距达 9.8 分。综合来看,Astra 在智能和编码上大幅逼近但未超越 Anthropic 当前旗舰,在 agentic 任务上差距尤为明显。
OpenAI 终止 Cursor 合作是本轮最具产业影响的非模型新闻。 Cursor 被 SpaceX 收购后,OpenAI 提议 11 月 12 日切断模型访问,直接影响大量依赖 OpenAI 模型的 Cursor 开发者——这条新闻改变了 AI 编程工具的竞争格局,而非仅仅是一次商业合同终止。