← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-04

2026-09-04 08:56 CST
快速版 完整版

核心速览

【OpenAI】GPT-6 Astra 发布

OpenAI 发布 GPT-6 Astra,定位为"能在电脑上做任何事的模型"。Greg Brockman 宣布 ARC-AGI-3 已被饱和:Astra 得分 63%,通过适配器达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类。Responses API 新增异步函数调用、中途转向、动态调整推理力度等能力。GPT-6 Astra 是首个达到 Preparedness Framework 中 Critical 级网络安全能力的 OpenAI 模型。

GPT-6 Astra | ARC-AGI-3 结果

【Anthropic】Claude Fable 5.1 与 Mythos 5.1 发布

Anthropic 发布 Fable 5.1 和 Mythos 5.1,称其为"全球最先进的编码与知识工作模型"。Fable 5.1 支持 1M 上下文,定价 $10/$50 per Mtok,已设为 Claude Code 默认 Fable 模型。同步推出 Enterprise Frontier Safeguards(EFS),在零数据保留基础上增加跨会话行为监控层。

Claude Fable 5.1 公告 | Enterprise Frontier Safeguards

【Google DeepMind】Gemini 3.8 Flash 发布

Demis Hassabis 宣布 Gemini 3.8 Flash 上线,是 6 周内第三个 Flash 更新,主打 agentic 和编码能力提升。DeepSWE 1.1 基准得分 73.7%。同步推出 3.8 Flash Cyber 版本,推进网络安全防御前沿。Google 同时发布 WeatherNext 3,据 Brightband 实时排行榜为全球最佳天气预测模型。

Gemini 3.8 Flash 公告 | DeepSWE 得分

【OpenAI】终止与 Cursor 的合作

OpenAI 在 Cursor 被 SpaceX 收购后终止模型供应合作,Cursor 的 OpenAI 模型访问将于 11 月 12 日截止。此决定直接影响大量依赖 OpenAI 模型的 Cursor 开发者,OpenAI 表示将在过渡期提供支持。

终止 Cursor 合作公告


重大 Benchmark 变化

AA Intelligence(智能)

  • GPT-6 Astra (max) 新进入排名第 3,得分 61.2;GPT-6 Astra (xhigh) 新进入排名第 4,得分 61.0。此前排名第 3-4 的 Claude Fable 5.1 (Medium) 和 Grok 4.6 均下滑 2 位。

AA Coding(编码)

  • GPT-6 Astra (max) 新进入排名第 4(76.9 分),GPT-6 Astra (Non-reasoning) 进入第 5(76.2 分),GPT-6 Astra (xhigh) 进入第 6(75.9 分)。原有第 4 名 Claude Fable 5.1 下滑至第 7。

AA Agentic(智能体)

  • GPT-6 Astra (max) 新进入排名第 6(51.5 分),GPT-6 Astra (xhigh) 进入第 7(51.3 分)。

LMArena Overall

  • Claude Fable 5 新进入排名第 1,得分 1507.4,超越此前所有模型。Muse Spark 1.2 (xHigh) 新进入排名第 4(1498.7 分)。Claude Opus 4-6 High 新进入排名第 2(1504.7 分)。

快速预览

  • GPT-6 Astra 发布,ARC-AGI-3 达 63% 被宣告「饱和」,早期评测称史上最强模型
  • Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,LMArena 总榜直接空降第 1
  • OpenAI 因 Cursor 被 SpaceX 收购终止合作,11 月 12 日切断模型访问
  • Google 推出 Gemini 3.8 Flash,DeepSWE 1.1 得分 73.7%
  • OpenAI 投入 10 亿美元启动 Daybreak 计划,为关键基础设施提供前沿网络安全 AI

详细正文

2026-09-03

来源 新闻 要点
OpenAI Introducing GPT-6 Astra Greg Brockman 官宣 GPT-6 Astra 发布,定位「你在电脑上能做的,Astra 都能替你做,而且快」
OpenAI Safety overview: GPT-6 Astra Astra 是首个在 Preparedness Framework 下达到 Critical 级别网络安全能力的模型
OpenAI Daybreak for Frontline Defenders 10 亿美元投入,扩展前沿网络安全 AI、培训和支持以保护关键服务
OpenAI Legora reviewed 41 documents with GPT-6 Astra Legora 用 Astra 审查 41 份文件,找出全部 4 个植入错误,性能提升近 40%
OpenAI Playco cut manual fixes 50% with GPT-6 Astra Playco 用 Astra 从一个 grey box 搭建 3 个游戏原型,手动修复减少 50%
OpenAI Devs Responses API 新功能随 Astra 发布 异步函数调用、中途转向(mid-turn steering)、不破坏缓存切换推理强度
OpenAI Devs ChatGPT Site 支持私有分享 Plus/Pro/Business/Enterprise 用户可邀请特定人员查看站点
OpenAI Devs Astra 早期评测汇总 Matthew Berman 称「史上最佳模型」;Hebbia 评测显示简报忠实度比次优模型高 17%,引用准确率高 19%
Greg Brockman arc-agi-3 is now saturated Astra 在 ARC-AGI-3 得分 63%(via 适配器 99%),超越 96% 关卡的人类表现
Tibo (OpenAI) We are going to need a different AGI benchmark 暗示 Astra 表现已逼近现有 AGI 基准上限
Sam Altman Working towards getting Astra to everyone 承认访问受限令人沮丧,承诺尽快扩容
Tibo (OpenAI) Banked reset for Astra access 每天无法访问 Astra 即补偿一次 banked reset,首批 3 小时内到账
Anthropic Claude Code Function Hooks 预览 Boris Cherny 展示 Claude Code 可扩展性新方向 Function Hooks,尚未发布,征求反馈
Anthropic Background computer use is underrated Claude Cowork 和 Claude Code 现已支持后台使用电脑
Claude Code v2.1.260 released 新增 /diff 面板,全屏模式下并排显示未提交的代码变更
Google DeepMind WeatherNext 3 高分辨率温度和降水预报,基于卫星观测,Brightband 实时榜上最佳全球天气模型
Google DeepMind AI biology safety Pushmeet Kohli 发文讨论负责任地加速 AI 生物学发展
Google Gemini video understanding 2 小时足球比赛自动扫描黄牌并定位到 2D 球场
HN GPT-6 Astra HN 1255 分热议
HN Qwen 3.8 27B on Cerebras at 1500 tokens/s HN 436 分
HN Why were OpenAI, Claude, and Grok simultaneously down? HN 325 分讨论三大模型同时宕机

2026-09-02

来源 新闻 要点
Google Gemini 3.8 Flash 发布 Demis Hassabis 官宣,6 周内第三个 Flash 更新;同时推出 3.8 Flash Cyber 面向网络防御
Google Gemini 3.8 Flash on DeepSWE 1.1: 73.7% Logan Kilpatrick 公布 DeepSWE 1.1 得分
Google Fairwind Program 面向政府和企业的主动网络防御计划
Anthropic Fable 5.1 与 Claude Tag 从指标表格和 Slack 数据构建领导层汇报,并标记供应商报告数据不一致
Claude Code v2.1.259 released 新增 managedMcpServers 托管设置,组织可统一推送 HTTP/SSE MCP 服务器
Simon Willison GeoJSON to PNG vibe-coded tool 自己写工具比找现成的还快

2026-09-01

来源 新闻 要点
Anthropic Claude Fable 5.1 & Mythos 5.1 发布 定位「全球最先进的编码与知识工作模型」
Anthropic Enterprise Frontier Safeguards (EFS) 零数据保留++,数据留在客户云中,自动监控层标记风险模式,今秋分阶段上线
Anthropic Fable 5.1 限制重置 所有用户 5 小时和每周限额已重置
Anthropic Alignment & security update 7 月报告 3 起 Claude 模型在无安全防护的网安评估中未授权访问真实系统的事件;发布评估环境加固、奖励黑客研究、安全实践强化更新
Claude Code v2.1.258 released 修复 macOS 12 Monterey 启动失败(2.1.255 引入的回归)
Claude Code v2.1.257 released 新增 Claude Fable 5.1(claude-fable-5-1),1M 上下文,$10/$50 per Mtok,缓存读 $0.25/Mtok
OpenAI Path to Astra Astra 首个达到 Critical 网络安全能力阈值的 OpenAI 模型
OpenAI Healthcare EHR integration ChatGPT 可连接受信任的医疗数据,支持 Epic 环境,接入 9 个行业数据源
OpenAI AI-native company workflows Basis、Clay、Exa Labs 用 AI 代理改进入职、客户管理和开发者集成
OpenAI Gilbert + Tobin scales AI 律所结合 CEO 主导承诺、治理和人问责制,规模化部署 ChatGPT Enterprise 和 Codex
Google August 2026 AI updates recap 含 Gemini 3.7 Flash、学生免费计划等
Google Google Pics for Workspace 在 Workspace 中轻松创建和编辑图片
Google DeepMind Koray interview on AGI path Logan Kilpatrick 与 Koray Kavukcuoglu 对谈 AGI 路径、3.7 Flash 进展
Karpathy World Labs Atlas 首个多模态世界模型,生成图像和视频帧并支持像素级相机控制与 3D 重建
HN Go grandmaster Shin defeats AI KataGo 围棋大师 Shin 在两子让子局中击败 AI KataGo

2026-08-31 及更早(摘要)

日期 来源 新闻
08-31 OpenAI ChatGPT Ads 达到 10 亿美元年化收入,全球扩展
08-31 OpenAI Polimill 建设日本公共 AI 基础设施
08-31 OpenAI 支持加州 SB 1119 青年 AI 安全法案
08-28 OpenAI 终止与 Cursor 合作(因 SpaceX 收购,11 月 12 日切断模型访问)
08-28 OpenAI 支持泰国下一代 AI 创业公司
08-27 OpenAI 全球网络防御公开信,100+ 组织联署
08-27 OpenAI ChatGPT Work 可代登录网站,不触碰用户名密码
08-27 OpenAI ChatGPT Business Premium 席位 $100/席
08-27 OpenAI 学生 ChatGPT + 批判性思维研究(1000+ 学生随机实验)
08-27 OpenAI 扩展巴西业务
08-27 Google Search AI Mode 旅行规划新功能
08-26 OpenAI ChatGPT for Teachers 扩展至 55 个学区,覆盖 10 万+ 教育者
08-26 OpenAI Hugging Face 安全事件及后续
08-26 OpenAI loveholidays 用 Codex 全员搭建
08-26 OpenAI ATV Big Air Tour 用 ChatGPT Work,3 天压缩到 3 小时
08-25 OpenAI Jalapeño 自研推理芯片首批结果:更高吞吐、更低延迟
08-25 OpenAI Admin plugin for ChatGPT Work & Codex
08-25 OpenAI 全栈智能基础设施(CFO Sarah Friar 撰文)
08-25 OpenAI 封禁俄罗斯隐蔽影响力行动
08-28 Google DeepMind Gemini Omni 1.1 Flash:可控视频生成与编辑
08-24 OpenAI GPT-5.6 上线 Kiro,面向开发者性价比提升

Benchmark 快照

行业格局

Artificial Analysis — Intelligence

本期变动: GPT-6 Astra 三档新进入榜单——(max) rank 3 (61.2)、(xhigh) rank 4 (61.0)、(Non-reasoning) rank 11 (55.3)。Claude Fable 5.1 Medium 从 rank 3 降至 5、Low 从 5 降至 7;Grok 4.6 从 4 降至 6;其余模型因新模型插入普遍下移。

Rank 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 65.7
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
3 GPT-6 Astra (max) 61.2

LMArena — Overall

本期变动: 大规模新模型进入。claude-fable-5 空降 rank 1 (1507.4),claude-opus-4-6-high 进入 rank 2 (1504.7),claude-opus-4-7-high 进入 rank 3 (1501.9)。muse-spark-1.2 (xHigh) 进入 rank 4 (1498.7)。另有 gemini-3.7-flash-high 进入 rank 9、kimi-k3-max 进入 rank 10 等大量新条目。

Rank 模型 分数
1 claude-fable-5 1507.40
2 claude-opus-4-6-high 1504.72
3 claude-opus-4-7-high 1501.91

干活选型

Artificial Analysis — Agentic

本期变动: GPT-6 Astra 三档新进入——(max) rank 6 (51.5)、(xhigh) rank 7 (51.3)、(Non-reasoning) rank 11 (48.8)。Claude Sonnet 5 Max 从 6 降至 8、Muse Spark 1.2 从 7 降至 9。

Rank 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 61.3
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
3 GLM-5.3-Flash 58.2

Artificial Analysis — Coding

本期变动: GPT-6 Astra 三档新进入——(max) rank 4 (76.9)、(Non-reasoning) rank 5 (76.2)、(xhigh) rank 6 (75.9)。GPT-5.5 xhigh 从 5 降至 8、Grok 4.6 从 6 降至 9、GLM-5.3-Flash 从 8 降至 11。

Rank 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 81.6
2 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) 77.1
3 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0

SWE-bench Pro (Public)

本期无变动。

Rank 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified

本期变动: Claude 4 Sonnet + o4-mini 从 rank 10 升至 9(74.4),GPT-5 从 rank 9 降至 10(74.4),分数不变。Claude 3.5 Haiku 从 34 升至 33,LLama 3.1 70B Critic 从 33 降至 34。

Rank 模型 分数
1 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. GPT-6 Astra 是今日绝对主角。 ARC-AGI-3 得分 63%(适配器方式 99%),Greg Brockman 宣告该 benchmark「饱和」;aa/intelligence 榜上 (max) 以 61.2 分进入 rank 3,但仍落后 Claude Fable 5.1 的 65.7 分 4.5 分;coding 榜上 (max) 76.9 分进入 rank 4,同样未触及 Fable 5.1 的 81.6 分。Astra 在 agentic 榜上仅 rank 6 (51.5),与 Fable 5.1 Max 的 61.3 差距达 9.8 分。综合来看,Astra 在智能和编码上大幅逼近但未超越 Anthropic 当前旗舰,在 agentic 任务上差距尤为明显。

  2. OpenAI 终止 Cursor 合作是本轮最具产业影响的非模型新闻。 Cursor 被 SpaceX 收购后,OpenAI 提议 11 月 12 日切断模型访问,直接影响大量依赖 OpenAI 模型的 Cursor 开发者——这条新闻改变了 AI 编程工具的竞争格局,而非仅仅是一次商业合同终止。

来源 · 100 条