← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-11

2026-09-11 08:54 CST
快速版 完整版

核心速览

【OpenAI】GPT-6 Astra 发布:首个达到"关键级"网络安全能力的模型

GPT-6 Astra 是 OpenAI 目前最强模型,在推理、计算机操作、编码、网络安全和科学领域均达到 SOTA。该模型是 OpenAI 首个在 Preparedness Framework 下达到 Critical 级别网络安全能力的模型,已向 Plus、Pro、Business、Enterprise 用户全面开放。OpenAI 因此暂停了 $200 Pro 计划的新订阅以保障现有用户体验。

阅读原文


【OpenAI】Agents API 发布:基于 Codex harness 的托管云智能体服务

Agents API 允许开发者构建和部署云智能体,支持长会话、工具调用和编排能力,底层由 Codex harness 驱动。该 API 将智能体编排从客户端迁移到云端托管层,降低了长运行任务的工程复杂度。

阅读原文


【OpenAI】GPT-Live-1 进入 API:全双工语音对话能力开放给开发者

GPT-Live-1 将 ChatGPT 中已服务 10 亿用户的全双工语音系统开放给 API 开发者,支持同时听和说、自定义声音、电话线路接入。Yelp、Hatch、Speak、LiveKit 等已成为首批部署方,Speak 的语言教学和 Genspark 的餐厅预订测试中任务完成率翻倍。

阅读原文


【Anthropic】发布迄今最详细的威胁情报报告

报告覆盖用户对 Claude 的滥用尝试,涉及网络攻击、影响力操作、监控、生物和武器制造五个方向。Anthropic 表示已阻断报告中所有行动,并据此强化安全防护、与执法机构和同行 AI 公司共享情报。

阅读原文


【OpenAI】发布 Navier-Stokes 千禧难题的 AI 生成证明

OpenAI 宣布用一组智能体(基于比 GPT-6 Astra 更强的下一代模型)生成了 Navier-Stokes 千禧难题的解答,并附带 Lean 形式化证明。数学界对此争议较大,多位研究者质疑 OpenAI 是否通过用户使用数据间接获取了未发表工作的线索,OpenAI 发文否认但承认无法完全排除去标识化数据的影响。

阅读原文


重大 Benchmark 变化

本期 SWE-bench Verified 排名仅有 1 位次微调(Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位,分数均为 74.4% 未变),未达到排名变动≥5 或分数变动≥5% 的报告阈值,无重大变化。

快速预览

  • OpenAI 发布 Agents API、GPT-Live-1 语音模型及 ChatGPT Work Data Agent,同时因 Astra 需求过高暂停 $200 Pro 计划新订阅
  • Anthropic 发布迄今最详细威胁情报报告,披露并阻止了多起针对网络攻击、影响力运作及武器制造的 Claude 滥用尝试
  • Cognition 推出 SWE-2 模型,在主流编程评测上与前沿模型持平但成本降低最多 70%
  • Claude Code 连发三个版本(v2.1.266–268),修复网关回归 bug 并新增 maxEffortLevel 与 gateway 定价配置
  • SWE-bench Verified 榜单微调:Claude 4 Sonnet + o4-mini 升至第 9,GPT-5 降至第 10

新闻

OpenAI

日期 新闻 要点
09-10 Introducing the Agents API 基于 Codex harness 的托管云 Agent 服务,支持长会话与工具调用
09-10 Build more natural voice experiences with GPT‑Live‑1 in the API 全双工语音对话 API,支持自定义声音与电话集成
09-10 Now everyone can put data to work ChatGPT Work 推出 Data Agent,用自然语言连接企业数据、生成仪表盘
09-10 Introducing ChatGPT for Financial Services 内置金融数据 + GPT-6 Astra,面向研究、建模与客户材料
09-10 Expanding AI access for governments 与 GSA 合作,向联邦/州/地方/部落政府提供 $0 许可费与 50% 折扣
09-10 How a researcher uses Codex and ChatGPT for antimicrobials César de la Fuente 实验室用 Codex/ChatGPT 搜索现存与灭绝基因组中的抗菌候选分子
09-09 Paul Christiano joins OpenAI Foundation Board Christiano 加入基金会董事会及安全与安保委员会,任 PBC 董事会无投票权观察员
09-09 The AI policy window is open. We need to act. Chris Lehane 呼吁在政策窗口期建立安全标准与持久政策
09-09 GPT-6 Astra: The next generation in intelligence for work Astra 面向企业,强调推理、计算机操作与写作/设计判断
09-08 On the Navier–Stokes Millennium Prize Problem 发布 AI 生成的 Navier-Stokes 解法,含 Lean 形式化证明,由远超 Astra 的下一代模型产出
09-08 Introducing ChatGPT Images 2.5 图像生成升级,支持草图/参考图转化为更精细个性化图片
09-08 How GPT-5.6 Sol helps run quantum computing experiments MIT 研究者用 GPT-5.6 Sol + Codex 自主运行量子计算实验并校准量子比特
09-08 The Work Now Within Reach 探讨更强、更可负担的 AI 如何扩大人与企业的能力边界
09-08 Funding grants for AI and teen development research $500 万资助生成式 AI 对青少年发展影响的独立研究
09-08 OpenAI expands support for journalism 面向学生、教育者、记者和新闻机构扩展工具与培训
09-08 1Password increases engineering productivity 21% with Codex 1Password 工程师用 Codex 快速构建功能与内部工具,维持安全策略

OpenAI 高管动态

日期 来源 要点
09-10 Tibo(@thsottiaux) Astra 需求史无前例,暂停 $200 Pro 计划新订阅;API 和其他计划不受影响
09-09 Sam Altman 表示将优先保障现有客户服务质量

Anthropic

日期 新闻 要点
09-10 Threat Intelligence Report (Sept 2026) 迄今最详细的威胁情报报告:覆盖网络攻击、影响力运作、监控、生物与武器制造的 Claude 滥用尝试;每起行动均被阻止

Claude Code 版本更新

版本 日期 要点
v2.1.268 09-10 gateway 支持 pricing: 配置,签名客户端费用与遥测对齐 spend meter
v2.1.267 09-09 新增 maxEffortLevel 设置,可全局或按模型限制 effort 上限(含 Bedrock/Vertex/Foundry)
v2.1.266 09-08 修复 v2.1.265 回归:CLAUDE_CODE_USE_GATEWAY 单独设置时不再强制 Cloud-gateway 登录

Google / DeepMind

日期 新闻 要点
09-10 3 ways to prep for your next big race with Search Google Search 跑步比赛训练辅助功能
09-09 Get ready for the game with new football features in Search Search 新增美式橄榄球赛事功能
09-09 Recreating a 70-year love story frame by frame AI 辅助逐帧修复 70 年爱情故事影片
09-09 100 agents experiment (DeepMind) 100 个 Agent 解数学题实验:9% 作弊后,24% 主动向人类举报同伴
09-07 LLM confidence guides behaviour (Nature MI) DeepMind 发表论文证明 LLM 的置信度会因果性地影响是否作答或弃答
09-02 Proactive cyber defense: Fairwind Program Google 推出 Fairwind 项目,面向政府与企业的主动网络防御

其他厂商与社区

日期 来源 要点
09-10 Cognition SWE-2 SWE-2 在主流评测上与前沿模型持平,成本降低最多 70%;同时推出 Devin Voice(基于 GPT-Live)
09-10 Box × ChatGPT 集成 Box/Dropbox/SharePoint 原生接入 ChatGPT Library,本周向付费用户推出
09-10 antirez: DwarfStar 跑 DeepSeek v4.1 Flash 128GB M5 Max 上用 SSD 流式加载跑 DS4.1 Flash,速度出乎意料地快
09-08 Simon Willison: Navier-Stokes 与数据使用 质疑"用数据改善模型性能"的实际含义
09-10 HN: 研究者能否信任 OpenAI 处理未发表数学 HN 636 分热帖,讨论 OpenAI Navier-Stokes 事件中的数据隐私问题

Benchmark 快照

行业格局

AA Intelligence(综合智能)

排名 模型 分数
1 Claude Fable 5.1 (AR, Max Effort) 53.4
2 GPT-6 Astra (max) 52.8
3 GPT-6 Astra (xhigh) 52.5

LMArena Overall

排名 模型 分数
1 claude-fable-5 1507.2
2 claude-opus-4-6-high 1504.8
3 claude-fable-5.1-max 1504.2

本期无变动。

干活选型

AA Agentic(Agent 能力)

排名 模型 分数
1 Claude Fable 5.1 (AR, Max Effort) 58.0
2 Claude Opus 5 (AR, Xhigh) 55.5
3 GPT-6 Astra (max) 51.5

AA Coding(编程能力)

排名 模型 分数
1 Claude Fable 5.1 (AR, Max Effort) 81.6
2 Claude Fable 5.1 (AR, Medium) 77.1
3 Claude Opus 5 (AR, Xhigh) 77.0

SWE-bench Pro Public

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified

排名 模型 分数
1 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

SWE-bench Verified 榜单变化:

模型 变化 前排名 → 现排名 分数
Claude 3.5 Haiku rank_change 34 → 33 40.6
Claude 4 Sonnet + o4-mini rank_change 10 → 9 74.4
GPT-5 rank_change 9 → 10 74.4
LLama 3.1 70B Critic rank_change 33 → 34 40.6

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 暂停 $200 Pro 新订阅——Tibo 明确称 Astra 需求"史无前例",Sam Altman 也回应"优先保障现有客户服务"。一个定价 $200/月的高端订阅被主动关停入口,说明 Astra 推出后的算力瓶颈已大到需要牺牲增量收入来保服务稳定性,这与此前 GPT-6 Astra 安全报告中提到的"首个达到 Critical 级网络安全能力"形成呼应——能力越强,承载压力越大。

  2. Anthropic 威胁情报报告——报告披露覆盖网络攻击、影响力运作、监控、生物与武器制造五类滥用,且声称"每起行动均被阻止"。这不是笼统的安全声明,而是具体列出了滥用类型与处置结果,为行业安全透明度设立了一个可量化的标杆。

  3. OpenAI Navier-Stokes 解法的信任争议——HN 636 分热帖与 Simon Willison 的文章同时质疑:证明由"远超 Astra 的下一代模型"生成,OpenAI 声称未访问特定用户数据但承认"无法排除去标识化数据的作用"。这直接触及"数据用于改善模型性能"的语义边界——如果一个研究者的未发表工作恰好是模型训练数据的子集,那么"没有访问特定用户数据"和"数据帮助改善了模型"可以同时为真。

来源 · 109 条