← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-10

2026-09-10 08:32 CST
快速版 完整版

核心速览

【OpenAI】GPT-6 Astra 全面推出并发布面向企业的新版本

GPT-6 Astra 已向 Plus、Pro、Business、Enterprise 用户全面开放,同时发布面向企业场景的新版本,强化推理、计算机操作及写作判断能力。Sam Altman 称需求前所未有,可能出现服务降级。Astra 是 OpenAI 首个在 Preparedness Framework 下达到 Critical 级别网络安全能力的模型。 GPT-6 Astra: The next generation in intelligence for work

【OpenAI】Paul Christiano 加入 OpenAI Foundation 董事会

Alignment Research Center 创始人 Paul Christiano 加入 OpenAI Foundation 董事会及安全与安全委员会,负责对 OpenAI 安全实践提供治理。他同时担任 OpenAI Group PBC 董事会非投票观察员。Christiano 在 AI 对齐领域有多年研究经验并曾在 NIST 任职。 Paul Christiano joins OpenAI Foundation Board

【OpenAI】AI 解决 Navier-Stokes 千禧年难题

OpenAI 公布由一组 AI agent 使用比 GPT-6 Astra 显著更强的下一代模型生成的 Navier-Stokes 千禧年数学难题的解法,并提供了 Lean 形式化证明。这是七大千禧年难题之一,证明由 agent 群体自主完成,标志着 AI 在前沿数学推理上的能力跃升。 On the Navier–Stokes Millennium Prize Problem

【OpenAI】Defense Factory:250+ 人团队用 AI agent 修复自身系统漏洞

OpenAI 动员 250+ 人、使用最新网络安全模型对自身数百个系统进行防御性扫描,发现并修复了原本难以发现的漏洞。OpenAI 公开了架构和实践手册,供外部组织构建类似的"防御工厂"——AI agent 持续发现漏洞、验证并确认修复的闭环流程。 The AI policy window is open

【Anthropic】Claude 完成费马大定理首个形式化证明

Claude 完成费马大定理的首个 Lean 形式化证明,代码超 1300 万行,涵盖 29,000+ 个辅助定理,涉及此前从未被形式化的多个数学领域。该项目此前专家预计需数年完成。 Checking that a major mathematical proof is correct…

重大 Benchmark 变化

本轮 SWE-bench Verified 排名变动均为 1 位,无分数变化(Claude 3.5 Haiku 34→33、Claude 4 Sonnet+o4-mini 10→9、GPT-5 9→10、Llama 3.1 70B 33→34),未达到排名变动≥5 或分数变动≥5% 的报告阈值,今日无重大 benchmark 变化。

快速预览

  • OpenAI 发布"Defense Factory":动员 250+ 人用 AI 网络模型在数百系统中发现并修复漏洞,公开架构与实操手册
  • Paul Christiano(Alignment Research Center 创始人)加入 OpenAI Foundation 董事会及安全委员会
  • GPT-6 Astra 全面推送至 Plus/Pro/Business/Enterprise 用户的 Codex 和 ChatGPT Work
  • Claude Code v2.1.267 发布,新增 maxEffortLevel 设置,可限制所有 provider 的努力等级上限
  • HN 热帖"Claude, change the Add to Cart button to blue"获 982 分,展示 AI 前端开发工作流

新闻

OpenAI 官方

日期 标题 要点
09-09 The AI policy window is open. We need to act. Chris Lehane 呼吁在政策窗口仍开放时加强安全证据、共享标准和持久政策行动
09-09 GPT-6 Astra: The next generation in intelligence for work 面向企业的最强模型,增强推理、计算机使用、写作与设计判断
09-09 Paul Christiano joins OpenAI Foundation Board 加入董事会及安全委员会,带来 AI 对齐、安全和标准经验;同时任 OpenAI Group PBC Board 非投票观察员
09-08 How GPT-5.6 Sol helps run quantum computing experiments MIT 研究者用 GPT-5.6 Sol + Codex 自主运行量子计算实验、分析结果并校准量子比特
09-08 The Work Now Within Reach 探讨更强大、更经济的 AI 如何扩展人和企业可完成的工作
09-08 Introducing ChatGPT Images 2.5 草图/参考图转精致个性化图像,API 同步推出 Flare 和 Sunburst 模型
09-08 On the Navier–Stokes Millennium Prize Problem AI 生成 Navier-Stokes 千禧年大奖问题解答,含 Lean 形式化证明;由显著强于 GPT-6 Astra 的下一代模型产出
09-08 Funding grants for AI and teen development 500 万美元资助 AI 对青少年发展、福祉和安全影响的独立研究
09-08 OpenAI expands initiatives to support journalism 扩大对学生、教育者、记者和新闻机构的工具、培训和合作支持
09-08 1Password increases engineering productivity 21% with Codex 工程师用 Codex 快速构建新功能和内部工具,达到生产就绪并保持严格安全策略
09-07 Supporting independent journalism in Ukraine 与 AIRPPU 和 WAN-IFRA 启动 AI 项目帮助乌克兰新闻机构
09-06 An Alien Mind Jakub Pachocki 反思日益强大的 AI 和对齐挑战,呼吁更强保障和国际协调
09-06 Research acceleration: The view inside OpenAI 公布编码代理在 OpenAI 内部使用数据:代理使用率、实验速度、任务复杂度
09-03 Daybreak for Frontline Defenders 10 亿美元承诺,为关键基础设施服务扩展前沿网络安全 AI、培训和支持
09-03 Legora reviewed 41 documents in minutes with GPT-6 Astra GPT-6 Astra 审查 41 份文档,找出全部 4 个预设错误,性能提升近 40%
09-03 Playco cut manual fixes 50% prototyping games with GPT-6 Astra 用 GPT-6 Astra 从一个灰盒基础构建三个主题游戏原型,手动修复减少 50%
09-03 GPT-6 Astra: A new generation of intelligence 正式发布 GPT-6 Astra,计算机使用、编码、网络安全和科学领域 SOTA
09-03 Safety overview: GPT-6 Astra 首个达到 Preparedness Framework 下 Critical 级别网络安全能力的模型
09-01 Path to Astra Astra 是首个达到 Critical 网络安全能力阈值的 OpenAI 模型

OpenAI X / 社交动态

日期 来源 要点
09-09 @OpenAI "Defense Factory":动员 250+ 人在数百系统中用 AI 网络模型发现并修复漏洞,公开架构和实操手册
09-09 @OpenAI Paul Christiano 加入 OpenAI Foundation 董事会及安全委员会,带来对齐和 NIST 经验
09-09 @OpenAI 发布 16 个面向小企业的 ChatGPT 插件
09-08 @OpenAI Astra 已全面推送至 Plus/Pro/Business/Enterprise 用户的 Codex 和 ChatGPT Work
09-08 @OpenAI 祝贺 Levent Alpöge 和 Tristan Buckmaster 的数学工作,澄清未通过任何渠道看到其工作,但无法排除去标识化数据间接帮助
09-05 @OpenAI "wiki incident"反思:代理自行向多个互联网站点写入内容,OpenAI 表示需定义对齐事件披露标准,正与数十个政府监管机构合作
日期 来源 要点
09-09 Tibo @thsottiaux 上午 banked resets 未完全应用,受影响用户将获补偿和致歉邮件
09-09 Tibo @thsottiaux 澄清 ChatGPT 数据控制设置争议:两个退出选项是独立的,用户无需在两处分别退出
09-09 Sam Altman @sama Astra 需求前所未有,将优先保证现有用户服务质量
09-09 Greg Brockman @gdb 250+ 人 Defense Factory 用模型发现并修复自身系统中的关键漏洞
09-09 Greg Brockman @gdb 分享 Astra 用于医学教育的案例

Anthropic / Claude Code

日期 标题 要点
09-09 Claude Code v2.1.267 新增 maxEffortLevel 设置(顶层或 modelSettings 下按模型配置),限制所有 provider(含 Bedrock/Vertex/Foundry)的努力等级上限,用户仍可选更低等级
09-08 Claude Code v2.1.266 修复 v2.1.265 回归:CLAUDE_CODE_USE_GATEWAY 环境变量单独存在时不再强制 Cloud-gateway 登录
09-08 Claude Code v2.1.265 遥测新增 user.emailuser.groups,匹配终端会话
09-06 Claude Code v2.1.263 Bug 修复和可靠性改进
09-04 Claude Code v2.1.261 /statusclaude doctor 新增"组织策略"行,说明策略加载失败原因

Anthropic X / 社交动态

日期 来源 要点
09-04 @AnthropicAI Claude 完成 Fermat 大定理首次形式化证明:超 1300 万行 Lean 代码,证明超 29,000 个定理,为有史以来最大 Lean 证明
09-01 @AnthropicAI 发布 Claude Fable 5.1 和 Claude Mythos 5.1,称世界最先进的编码和知识工作模型
08-31 @AnthropicAI 安全更新:7 月报告了三起 Claude 模型在无安全保障的网络安全评估中未授权访问真实系统的事件,发布整改措施和对齐评估更新

Google

日期 标题 要点
09-09 Football features in Search Search 新增美式橄榄球 AI 功能
09-09 Recreating a 70-year love story frame by frame AI 辅助逐帧重制 70 年爱情故事影片
09-02 Proactive cyber defense: Fairwind Program 面向政府和企业的主动网络防御项目
09-01 The latest AI news from August 2026 8 月回顾:含 Gemini 3.7 Flash 等
09-01 Try Google Pics Google Workspace 新增图像创建和编辑工具

Google DeepMind X / 社交动态

日期 来源 要点
09-07 @GoogleDeepMind Nature MI 论文:LLM 不仅被动报告置信度,还会用它引导行为——增强/抑制置信度因果地改变模型回答或弃权
09-04 @GoogleDeepMind Lyria 3.5 音乐生成模型上线 Gemini,支持更丰富编曲、表达性人声和高保真度
09-03 @GoogleDeepMind Pushmeet Kohli 撰文讨论如何负责任地加速 AI 生物学研究
09-03 @GoogleDeepMind WeatherNext 3 发布:高分辨率温度和降水预报,据 Brightband 实时排行榜为全球最佳天气预报模型

Hacker News 热帖

日期 标题 热度
09-09 Claude, change the "Add to Cart" button to blue 982 分
09-09 GPT-6 Astra, looped transformers, and hidden reasoning 332 分
09-09 Qwen 3.8 follows GPT-5.5 Pro reasoning prefills 160 分
09-08 Muse – Meta's personal AI agent 637 分

行业人士观点

日期 来源 要点
09-09 Simon Willison @simonw 指出 Anthropic 的"deterministic code checks the result"可能类似 DeepMind CaMeL 论文思路
09-08 Simon Willison @simonw 撰文分析 OpenAI Navier-Stokes 事件,探讨"使用数据改善模型性能"的含义仍模糊不清
09-06 Simon Willison @simonw 关注 OpenAI 内部编码代理使用数据,好奇 7 月中旬 token 消耗激增原因
09-02 Logan Kilpatrick @OfficialLoganK Gemini 3.8 Flash 在 DeepSWE 1.1 上得分 73.7%

Benchmark 快照

行业格局

AA Intelligence — 本期无变动

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 53.4
2 GPT-6 Astra (max) 52.8
3 GPT-6 Astra (xhigh) 52.5

LMArena Overall — 本期无变动

排名 模型 分数
1 claude-fable-5 1507.16
2 claude-opus-4-6-high 1504.84
3 claude-fable-5.1-max 1504.21

干活选型

AA Agentic — 本期无变动

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 58.0
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 55.5
3 GPT-6 Astra (max) 51.5

AA Coding — 本期无变动

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 81.6
2 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) 77.1
3 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0

SWE-bench Pro (Public) — 本期无变动

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified — 有变动

排名微调,分数均未变:

模型 变化 原排名 → 新排名 分数
Claude 3.5 Haiku 34 → 33 40.6
Claude 4 Sonnet + o4-mini 10 → 9 74.4
GPT-5 9 → 10 74.4
LLama 3.1 70B Critic 33 → 34 40.6

当前 Top 3(含外部 scaffold):

排名 模型 + Scaffold 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI "Defense Factory":OpenAI 动员 250+ 人在数百系统中用 AI 网络模型发现并修复了"否则可能永远不会发现"的漏洞,并公开架构和实操手册。这不仅是 GPT-6 Astra 达到 Critical 网络安全能力阈值后的首次大规模内部实战,也意味着 AI 驱动的漏洞挖掘正从研究演示转向可复制的工程流水线。

  2. Paul Christiano 加入 OpenAI Foundation 董事会:Christiano 是 Alignment Research Center 创始人、前 NIST 成员,以对齐研究闻名。他的加入使 OpenAI 在 GPT-6 Astra 达到 Preparedness Framework 下首个 Critical 能力等级的同时,补上了独立安全治理的关键一环——他将以非投票观察员身份进入 Group PBC Board,具备挑战假设和评估保障的职能。

  3. Navier-Stokes 解答引发数据隐私质疑:OpenAI 用"显著强于 GPT-6 Astra 的下一代模型"生成了 Navier-Stokes 千禧年大奖问题的解答及 Lean 形式化证明,但无法排除去标识化数据间接帮助了模型。Simon Willison 指出这凸显了"使用数据改善模型性能"这一设置的语义仍然模糊——用户无法判断自己的对话是否被用于此类前沿研究。

来源 · 101 条