【OpenAI】GPT-6 Astra 发布:首个达到"关键级"网络安全能力的模型
GPT-6 Astra 是 OpenAI 目前最强模型,在推理、计算机操作、编码、网络安全和科学领域均达到 SOTA。该模型是 OpenAI 首个在 Preparedness Framework 下达到 Critical 级别网络安全能力的模型,已向 Plus、Pro、Business、Enterprise 用户全面开放。OpenAI 因此暂停了 $200 Pro 计划的新订阅以保障现有用户体验。
【OpenAI】Agents API 发布:基于 Codex harness 的托管云智能体服务
Agents API 允许开发者构建和部署云智能体,支持长会话、工具调用和编排能力,底层由 Codex harness 驱动。该 API 将智能体编排从客户端迁移到云端托管层,降低了长运行任务的工程复杂度。
【OpenAI】GPT-Live-1 进入 API:全双工语音对话能力开放给开发者
GPT-Live-1 将 ChatGPT 中已服务 10 亿用户的全双工语音系统开放给 API 开发者,支持同时听和说、自定义声音、电话线路接入。Yelp、Hatch、Speak、LiveKit 等已成为首批部署方,Speak 的语言教学和 Genspark 的餐厅预订测试中任务完成率翻倍。
【Anthropic】发布迄今最详细的威胁情报报告
报告覆盖用户对 Claude 的滥用尝试,涉及网络攻击、影响力操作、监控、生物和武器制造五个方向。Anthropic 表示已阻断报告中所有行动,并据此强化安全防护、与执法机构和同行 AI 公司共享情报。
【OpenAI】发布 Navier-Stokes 千禧难题的 AI 生成证明
OpenAI 宣布用一组智能体(基于比 GPT-6 Astra 更强的下一代模型)生成了 Navier-Stokes 千禧难题的解答,并附带 Lean 形式化证明。数学界对此争议较大,多位研究者质疑 OpenAI 是否通过用户使用数据间接获取了未发表工作的线索,OpenAI 发文否认但承认无法完全排除去标识化数据的影响。
本期 SWE-bench Verified 排名仅有 1 位次微调(Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位,分数均为 74.4% 未变),未达到排名变动≥5 或分数变动≥5% 的报告阈值,无重大变化。
maxEffortLevel 与 gateway 定价配置| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-10 | Introducing the Agents API | 基于 Codex harness 的托管云 Agent 服务,支持长会话与工具调用 |
| 09-10 | Build more natural voice experiences with GPT‑Live‑1 in the API | 全双工语音对话 API,支持自定义声音与电话集成 |
| 09-10 | Now everyone can put data to work | ChatGPT Work 推出 Data Agent,用自然语言连接企业数据、生成仪表盘 |
| 09-10 | Introducing ChatGPT for Financial Services | 内置金融数据 + GPT-6 Astra,面向研究、建模与客户材料 |
| 09-10 | Expanding AI access for governments | 与 GSA 合作,向联邦/州/地方/部落政府提供 $0 许可费与 50% 折扣 |
| 09-10 | How a researcher uses Codex and ChatGPT for antimicrobials | César de la Fuente 实验室用 Codex/ChatGPT 搜索现存与灭绝基因组中的抗菌候选分子 |
| 09-09 | Paul Christiano joins OpenAI Foundation Board | Christiano 加入基金会董事会及安全与安保委员会,任 PBC 董事会无投票权观察员 |
| 09-09 | The AI policy window is open. We need to act. | Chris Lehane 呼吁在政策窗口期建立安全标准与持久政策 |
| 09-09 | GPT-6 Astra: The next generation in intelligence for work | Astra 面向企业,强调推理、计算机操作与写作/设计判断 |
| 09-08 | On the Navier–Stokes Millennium Prize Problem | 发布 AI 生成的 Navier-Stokes 解法,含 Lean 形式化证明,由远超 Astra 的下一代模型产出 |
| 09-08 | Introducing ChatGPT Images 2.5 | 图像生成升级,支持草图/参考图转化为更精细个性化图片 |
| 09-08 | How GPT-5.6 Sol helps run quantum computing experiments | MIT 研究者用 GPT-5.6 Sol + Codex 自主运行量子计算实验并校准量子比特 |
| 09-08 | The Work Now Within Reach | 探讨更强、更可负担的 AI 如何扩大人与企业的能力边界 |
| 09-08 | Funding grants for AI and teen development research | $500 万资助生成式 AI 对青少年发展影响的独立研究 |
| 09-08 | OpenAI expands support for journalism | 面向学生、教育者、记者和新闻机构扩展工具与培训 |
| 09-08 | 1Password increases engineering productivity 21% with Codex | 1Password 工程师用 Codex 快速构建功能与内部工具,维持安全策略 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-10 | Tibo(@thsottiaux) | Astra 需求史无前例,暂停 $200 Pro 计划新订阅;API 和其他计划不受影响 |
| 09-09 | Sam Altman | 表示将优先保障现有客户服务质量 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-10 | Threat Intelligence Report (Sept 2026) | 迄今最详细的威胁情报报告:覆盖网络攻击、影响力运作、监控、生物与武器制造的 Claude 滥用尝试;每起行动均被阻止 |
| 版本 | 日期 | 要点 |
|---|---|---|
| v2.1.268 | 09-10 | gateway 支持 pricing: 配置,签名客户端费用与遥测对齐 spend meter |
| v2.1.267 | 09-09 | 新增 maxEffortLevel 设置,可全局或按模型限制 effort 上限(含 Bedrock/Vertex/Foundry) |
| v2.1.266 | 09-08 | 修复 v2.1.265 回归:CLAUDE_CODE_USE_GATEWAY 单独设置时不再强制 Cloud-gateway 登录 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-10 | 3 ways to prep for your next big race with Search | Google Search 跑步比赛训练辅助功能 |
| 09-09 | Get ready for the game with new football features in Search | Search 新增美式橄榄球赛事功能 |
| 09-09 | Recreating a 70-year love story frame by frame | AI 辅助逐帧修复 70 年爱情故事影片 |
| 09-09 | 100 agents experiment (DeepMind) | 100 个 Agent 解数学题实验:9% 作弊后,24% 主动向人类举报同伴 |
| 09-07 | LLM confidence guides behaviour (Nature MI) | DeepMind 发表论文证明 LLM 的置信度会因果性地影响是否作答或弃答 |
| 09-02 | Proactive cyber defense: Fairwind Program | Google 推出 Fairwind 项目,面向政府与企业的主动网络防御 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-10 | Cognition SWE-2 | SWE-2 在主流评测上与前沿模型持平,成本降低最多 70%;同时推出 Devin Voice(基于 GPT-Live) |
| 09-10 | Box × ChatGPT 集成 | Box/Dropbox/SharePoint 原生接入 ChatGPT Library,本周向付费用户推出 |
| 09-10 | antirez: DwarfStar 跑 DeepSeek v4.1 Flash | 128GB M5 Max 上用 SSD 流式加载跑 DS4.1 Flash,速度出乎意料地快 |
| 09-08 | Simon Willison: Navier-Stokes 与数据使用 | 质疑"用数据改善模型性能"的实际含义 |
| 09-10 | HN: 研究者能否信任 OpenAI 处理未发表数学 | HN 636 分热帖,讨论 OpenAI Navier-Stokes 事件中的数据隐私问题 |
AA Intelligence(综合智能)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (AR, Max Effort) | 53.4 |
| 2 | GPT-6 Astra (max) | 52.8 |
| 3 | GPT-6 Astra (xhigh) | 52.5 |
LMArena Overall
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.2 |
| 2 | claude-opus-4-6-high | 1504.8 |
| 3 | claude-fable-5.1-max | 1504.2 |
本期无变动。
AA Agentic(Agent 能力)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (AR, Max Effort) | 58.0 |
| 2 | Claude Opus 5 (AR, Xhigh) | 55.5 |
| 3 | GPT-6 Astra (max) | 51.5 |
AA Coding(编程能力)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (AR, Max Effort) | 81.6 |
| 2 | Claude Fable 5.1 (AR, Medium) | 77.1 |
| 3 | Claude Opus 5 (AR, Xhigh) | 77.0 |
SWE-bench Pro Public
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
SWE-bench Verified
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
SWE-bench Verified 榜单变化:
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude 3.5 Haiku | rank_change | 34 → 33 | 40.6 |
| Claude 4 Sonnet + o4-mini | rank_change | 10 → 9 | 74.4 |
| GPT-5 | rank_change | 9 → 10 | 74.4 |
| LLama 3.1 70B Critic | rank_change | 33 → 34 | 40.6 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 暂停 $200 Pro 新订阅——Tibo 明确称 Astra 需求"史无前例",Sam Altman 也回应"优先保障现有客户服务"。一个定价 $200/月的高端订阅被主动关停入口,说明 Astra 推出后的算力瓶颈已大到需要牺牲增量收入来保服务稳定性,这与此前 GPT-6 Astra 安全报告中提到的"首个达到 Critical 级网络安全能力"形成呼应——能力越强,承载压力越大。
Anthropic 威胁情报报告——报告披露覆盖网络攻击、影响力运作、监控、生物与武器制造五类滥用,且声称"每起行动均被阻止"。这不是笼统的安全声明,而是具体列出了滥用类型与处置结果,为行业安全透明度设立了一个可量化的标杆。
OpenAI Navier-Stokes 解法的信任争议——HN 636 分热帖与 Simon Willison 的文章同时质疑:证明由"远超 Astra 的下一代模型"生成,OpenAI 声称未访问特定用户数据但承认"无法排除去标识化数据的作用"。这直接触及"数据用于改善模型性能"的语义边界——如果一个研究者的未发表工作恰好是模型训练数据的子集,那么"没有访问特定用户数据"和"数据帮助改善了模型"可以同时为真。