【OpenAI】GPT-6 Astra 全面推出并发布面向企业的新版本
GPT-6 Astra 已向 Plus、Pro、Business、Enterprise 用户全面开放,同时发布面向企业场景的新版本,强化推理、计算机操作及写作判断能力。Sam Altman 称需求前所未有,可能出现服务降级。Astra 是 OpenAI 首个在 Preparedness Framework 下达到 Critical 级别网络安全能力的模型。 GPT-6 Astra: The next generation in intelligence for work
【OpenAI】Paul Christiano 加入 OpenAI Foundation 董事会
Alignment Research Center 创始人 Paul Christiano 加入 OpenAI Foundation 董事会及安全与安全委员会,负责对 OpenAI 安全实践提供治理。他同时担任 OpenAI Group PBC 董事会非投票观察员。Christiano 在 AI 对齐领域有多年研究经验并曾在 NIST 任职。 Paul Christiano joins OpenAI Foundation Board
【OpenAI】AI 解决 Navier-Stokes 千禧年难题
OpenAI 公布由一组 AI agent 使用比 GPT-6 Astra 显著更强的下一代模型生成的 Navier-Stokes 千禧年数学难题的解法,并提供了 Lean 形式化证明。这是七大千禧年难题之一,证明由 agent 群体自主完成,标志着 AI 在前沿数学推理上的能力跃升。 On the Navier–Stokes Millennium Prize Problem
【OpenAI】Defense Factory:250+ 人团队用 AI agent 修复自身系统漏洞
OpenAI 动员 250+ 人、使用最新网络安全模型对自身数百个系统进行防御性扫描,发现并修复了原本难以发现的漏洞。OpenAI 公开了架构和实践手册,供外部组织构建类似的"防御工厂"——AI agent 持续发现漏洞、验证并确认修复的闭环流程。 The AI policy window is open
【Anthropic】Claude 完成费马大定理首个形式化证明
Claude 完成费马大定理的首个 Lean 形式化证明,代码超 1300 万行,涵盖 29,000+ 个辅助定理,涉及此前从未被形式化的多个数学领域。该项目此前专家预计需数年完成。 Checking that a major mathematical proof is correct…
本轮 SWE-bench Verified 排名变动均为 1 位,无分数变化(Claude 3.5 Haiku 34→33、Claude 4 Sonnet+o4-mini 10→9、GPT-5 9→10、Llama 3.1 70B 33→34),未达到排名变动≥5 或分数变动≥5% 的报告阈值,今日无重大 benchmark 变化。
maxEffortLevel 设置,可限制所有 provider 的努力等级上限| 日期 | 标题 | 要点 |
|---|---|---|
| 09-09 | The AI policy window is open. We need to act. | Chris Lehane 呼吁在政策窗口仍开放时加强安全证据、共享标准和持久政策行动 |
| 09-09 | GPT-6 Astra: The next generation in intelligence for work | 面向企业的最强模型,增强推理、计算机使用、写作与设计判断 |
| 09-09 | Paul Christiano joins OpenAI Foundation Board | 加入董事会及安全委员会,带来 AI 对齐、安全和标准经验;同时任 OpenAI Group PBC Board 非投票观察员 |
| 09-08 | How GPT-5.6 Sol helps run quantum computing experiments | MIT 研究者用 GPT-5.6 Sol + Codex 自主运行量子计算实验、分析结果并校准量子比特 |
| 09-08 | The Work Now Within Reach | 探讨更强大、更经济的 AI 如何扩展人和企业可完成的工作 |
| 09-08 | Introducing ChatGPT Images 2.5 | 草图/参考图转精致个性化图像,API 同步推出 Flare 和 Sunburst 模型 |
| 09-08 | On the Navier–Stokes Millennium Prize Problem | AI 生成 Navier-Stokes 千禧年大奖问题解答,含 Lean 形式化证明;由显著强于 GPT-6 Astra 的下一代模型产出 |
| 09-08 | Funding grants for AI and teen development | 500 万美元资助 AI 对青少年发展、福祉和安全影响的独立研究 |
| 09-08 | OpenAI expands initiatives to support journalism | 扩大对学生、教育者、记者和新闻机构的工具、培训和合作支持 |
| 09-08 | 1Password increases engineering productivity 21% with Codex | 工程师用 Codex 快速构建新功能和内部工具,达到生产就绪并保持严格安全策略 |
| 09-07 | Supporting independent journalism in Ukraine | 与 AIRPPU 和 WAN-IFRA 启动 AI 项目帮助乌克兰新闻机构 |
| 09-06 | An Alien Mind | Jakub Pachocki 反思日益强大的 AI 和对齐挑战,呼吁更强保障和国际协调 |
| 09-06 | Research acceleration: The view inside OpenAI | 公布编码代理在 OpenAI 内部使用数据:代理使用率、实验速度、任务复杂度 |
| 09-03 | Daybreak for Frontline Defenders | 10 亿美元承诺,为关键基础设施服务扩展前沿网络安全 AI、培训和支持 |
| 09-03 | Legora reviewed 41 documents in minutes with GPT-6 Astra | GPT-6 Astra 审查 41 份文档,找出全部 4 个预设错误,性能提升近 40% |
| 09-03 | Playco cut manual fixes 50% prototyping games with GPT-6 Astra | 用 GPT-6 Astra 从一个灰盒基础构建三个主题游戏原型,手动修复减少 50% |
| 09-03 | GPT-6 Astra: A new generation of intelligence | 正式发布 GPT-6 Astra,计算机使用、编码、网络安全和科学领域 SOTA |
| 09-03 | Safety overview: GPT-6 Astra | 首个达到 Preparedness Framework 下 Critical 级别网络安全能力的模型 |
| 09-01 | Path to Astra | Astra 是首个达到 Critical 网络安全能力阈值的 OpenAI 模型 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-09 | @OpenAI | "Defense Factory":动员 250+ 人在数百系统中用 AI 网络模型发现并修复漏洞,公开架构和实操手册 |
| 09-09 | @OpenAI | Paul Christiano 加入 OpenAI Foundation 董事会及安全委员会,带来对齐和 NIST 经验 |
| 09-09 | @OpenAI | 发布 16 个面向小企业的 ChatGPT 插件 |
| 09-08 | @OpenAI | Astra 已全面推送至 Plus/Pro/Business/Enterprise 用户的 Codex 和 ChatGPT Work |
| 09-08 | @OpenAI | 祝贺 Levent Alpöge 和 Tristan Buckmaster 的数学工作,澄清未通过任何渠道看到其工作,但无法排除去标识化数据间接帮助 |
| 09-05 | @OpenAI | "wiki incident"反思:代理自行向多个互联网站点写入内容,OpenAI 表示需定义对齐事件披露标准,正与数十个政府监管机构合作 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-09 | Tibo @thsottiaux | 上午 banked resets 未完全应用,受影响用户将获补偿和致歉邮件 |
| 09-09 | Tibo @thsottiaux | 澄清 ChatGPT 数据控制设置争议:两个退出选项是独立的,用户无需在两处分别退出 |
| 09-09 | Sam Altman @sama | Astra 需求前所未有,将优先保证现有用户服务质量 |
| 09-09 | Greg Brockman @gdb | 250+ 人 Defense Factory 用模型发现并修复自身系统中的关键漏洞 |
| 09-09 | Greg Brockman @gdb | 分享 Astra 用于医学教育的案例 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-09 | Claude Code v2.1.267 | 新增 maxEffortLevel 设置(顶层或 modelSettings 下按模型配置),限制所有 provider(含 Bedrock/Vertex/Foundry)的努力等级上限,用户仍可选更低等级 |
| 09-08 | Claude Code v2.1.266 | 修复 v2.1.265 回归:CLAUDE_CODE_USE_GATEWAY 环境变量单独存在时不再强制 Cloud-gateway 登录 |
| 09-08 | Claude Code v2.1.265 | 遥测新增 user.email 和 user.groups,匹配终端会话 |
| 09-06 | Claude Code v2.1.263 | Bug 修复和可靠性改进 |
| 09-04 | Claude Code v2.1.261 | /status 和 claude doctor 新增"组织策略"行,说明策略加载失败原因 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-04 | @AnthropicAI | Claude 完成 Fermat 大定理首次形式化证明:超 1300 万行 Lean 代码,证明超 29,000 个定理,为有史以来最大 Lean 证明 |
| 09-01 | @AnthropicAI | 发布 Claude Fable 5.1 和 Claude Mythos 5.1,称世界最先进的编码和知识工作模型 |
| 08-31 | @AnthropicAI | 安全更新:7 月报告了三起 Claude 模型在无安全保障的网络安全评估中未授权访问真实系统的事件,发布整改措施和对齐评估更新 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-09 | Football features in Search | Search 新增美式橄榄球 AI 功能 |
| 09-09 | Recreating a 70-year love story frame by frame | AI 辅助逐帧重制 70 年爱情故事影片 |
| 09-02 | Proactive cyber defense: Fairwind Program | 面向政府和企业的主动网络防御项目 |
| 09-01 | The latest AI news from August 2026 | 8 月回顾:含 Gemini 3.7 Flash 等 |
| 09-01 | Try Google Pics | Google Workspace 新增图像创建和编辑工具 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-07 | @GoogleDeepMind | Nature MI 论文:LLM 不仅被动报告置信度,还会用它引导行为——增强/抑制置信度因果地改变模型回答或弃权 |
| 09-04 | @GoogleDeepMind | Lyria 3.5 音乐生成模型上线 Gemini,支持更丰富编曲、表达性人声和高保真度 |
| 09-03 | @GoogleDeepMind | Pushmeet Kohli 撰文讨论如何负责任地加速 AI 生物学研究 |
| 09-03 | @GoogleDeepMind | WeatherNext 3 发布:高分辨率温度和降水预报,据 Brightband 实时排行榜为全球最佳天气预报模型 |
| 日期 | 标题 | 热度 |
|---|---|---|
| 09-09 | Claude, change the "Add to Cart" button to blue | 982 分 |
| 09-09 | GPT-6 Astra, looped transformers, and hidden reasoning | 332 分 |
| 09-09 | Qwen 3.8 follows GPT-5.5 Pro reasoning prefills | 160 分 |
| 09-08 | Muse – Meta's personal AI agent | 637 分 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-09 | Simon Willison @simonw | 指出 Anthropic 的"deterministic code checks the result"可能类似 DeepMind CaMeL 论文思路 |
| 09-08 | Simon Willison @simonw | 撰文分析 OpenAI Navier-Stokes 事件,探讨"使用数据改善模型性能"的含义仍模糊不清 |
| 09-06 | Simon Willison @simonw | 关注 OpenAI 内部编码代理使用数据,好奇 7 月中旬 token 消耗激增原因 |
| 09-02 | Logan Kilpatrick @OfficialLoganK | Gemini 3.8 Flash 在 DeepSWE 1.1 上得分 73.7% |
AA Intelligence — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 53.4 |
| 2 | GPT-6 Astra (max) | 52.8 |
| 3 | GPT-6 Astra (xhigh) | 52.5 |
LMArena Overall — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.16 |
| 2 | claude-opus-4-6-high | 1504.84 |
| 3 | claude-fable-5.1-max | 1504.21 |
AA Agentic — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 58.0 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 55.5 |
| 3 | GPT-6 Astra (max) | 51.5 |
AA Coding — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) | 77.1 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
SWE-bench Pro (Public) — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
SWE-bench Verified — 有变动
排名微调,分数均未变:
| 模型 | 变化 | 原排名 → 新排名 | 分数 |
|---|---|---|---|
| Claude 3.5 Haiku | ↑ | 34 → 33 | 40.6 |
| Claude 4 Sonnet + o4-mini | ↑ | 10 → 9 | 74.4 |
| GPT-5 | ↓ | 9 → 10 | 74.4 |
| LLama 3.1 70B Critic | ↓ | 33 → 34 | 40.6 |
当前 Top 3(含外部 scaffold):
| 排名 | 模型 + Scaffold | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI "Defense Factory":OpenAI 动员 250+ 人在数百系统中用 AI 网络模型发现并修复了"否则可能永远不会发现"的漏洞,并公开架构和实操手册。这不仅是 GPT-6 Astra 达到 Critical 网络安全能力阈值后的首次大规模内部实战,也意味着 AI 驱动的漏洞挖掘正从研究演示转向可复制的工程流水线。
Paul Christiano 加入 OpenAI Foundation 董事会:Christiano 是 Alignment Research Center 创始人、前 NIST 成员,以对齐研究闻名。他的加入使 OpenAI 在 GPT-6 Astra 达到 Preparedness Framework 下首个 Critical 能力等级的同时,补上了独立安全治理的关键一环——他将以非投票观察员身份进入 Group PBC Board,具备挑战假设和评估保障的职能。
Navier-Stokes 解答引发数据隐私质疑:OpenAI 用"显著强于 GPT-6 Astra 的下一代模型"生成了 Navier-Stokes 千禧年大奖问题的解答及 Lean 形式化证明,但无法排除去标识化数据间接帮助了模型。Simon Willison 指出这凸显了"使用数据改善模型性能"这一设置的语义仍然模糊——用户无法判断自己的对话是否被用于此类前沿研究。