【OpenAI】AI 生成 Navier-Stokes 千禧难题解法
OpenAI 宣布由一组 agent 使用下一代模型(显著强于 GPT-6 Astra)生成了 Navier-Stokes 千禧难题的解法,并附 Lean 形式化证明。同时 OpenAI 声明未访问 Alpöge 与 Buckmaster 同期公开工作的任何数据,但承认无法完全排除脱敏数据间接帮助模型的可能性。这意味着 AI 已能在最深层数学前沿产出可验证的证明,且模型能力与数据溯源的边界正变得模糊。
On the Navier–Stokes Millennium Prize Problem
【OpenAI】GPT-6 Astra 全面向付费用户推出
GPT-6 Astra 已在 Codex 和 ChatGPT Work 中向 Plus、Pro、Business、Enterprise 用户全面上线。该模型在计算机使用、编码、网络安全和科学领域达到 SOTA,也是 OpenAI 首个达到 Preparedness Framework 中 Critical 级网络安全能力的模型。GitHub Copilot 已同步集成。
【OpenAI】ChatGPT Images 2.5 发布,Arena 双榜第一
ChatGPT Images 2.5(API 模型名 Sunburst 与 Flare)发布,生成速度更快、细节一致性更强、支持透明背景。Arena.ai 数据显示 Sunburst 在 Text-to-Image、Image Edit、Multi-Image Edit 三个竞技场均排名第一,Flare 排名第二。
Introducing ChatGPT Images 2.5
【Cognition】融资超 20 亿美元,估值 480 亿
Cognition(Devin 母公司)宣布以 a16z、Accel、Founders Fund 等领投完成超 20 亿美元融资,估值达 480 亿美元。自 5 月以来,年化收入从 4.92 亿美元增至近 9 亿美元。
AA Intelligence 类别出现大范围分数下滑(几乎全部模型跌幅 ≥5%)
本轮 AA Intelligence 榜单出现异常-wide 的分数下调,几乎所有模型分数下降 5%-17%,排名虽未大幅变动但分数变化显著:
| 模型 | 旧分 → 新分 | 跌幅 |
|---|---|---|
| Claude Fable 5.1 (Low) | 50.9 → 47.0 | -7.7% |
| Claude Fable 5.1 (Max) | 56.8 → 53.4 | -6.0% |
| Claude Fable 5.1 (Medium) | 52.8 → 49.1 | -7.0% |
| Claude Opus 5 (Xhigh) | 53.4 → 49.7 | -6.9% |
| Claude Sonnet 5 (Max) | 45.1 → 38.4 | -14.9% |
| GPT-5.5 (xhigh) | 45.6 → 38.6 | -15.4% |
| GPT-5.6 Luna (max) | 43.4 → 37.5 | -13.6% |
| GPT-5.6 Sol (low) | 40.8 → 33.8 | -17.2% |
| GPT-6 Astra (Non-reasoning) | 47.8 → 45.2 | -5.4% |
| Grok 4.6 (medium) | 48.8 → 43.0 | -11.9% |
| Muse Spark 1.2 (xhigh) | 46.8 → 39.8 | -15.0% |
| GLM-5.3-Flash | 46.2 → 41.9 | -9.3% |
头部模型排名未变:Claude Fable 5.1 (Max) 仍居第 1(53.4),GPT-6 Astra (max) 第 2(52.8),GPT-6 Astra (xhigh) 第 3(52.5)。全榜单同步下滑表明大概率是评测基准或难度调整所致,而非单个模型能力退化。
SWE-bench Verified 微调排名变动
Claude 4 Sonnet + o4-mini 从第 10 升至第 9,GPT-5 从第 9 降至第 10,两者分数均未变(74.4),属同分位次调整。
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-08 | Astra 全面推送 | GPT-6 Astra 已向 Plus/Pro/Business/Enterprise 用户的 Codex 和 ChatGPT Work 全面开放 |
| 09-08 | ChatGPT Images 2.5 发布 | 更快生成、更高保真度、多轮编辑一致性提升;API 推出 Flare 和 Sunburst 两个变体 |
| 09-08 | Navier-Stokes 千禧年大奖问题证明 | 由多智能体协作完成,使用比 GPT-6 Astra 显著更强的新一代模型;附 Lean 形式化证明 |
| 09-08 | GPT-5.6 Sol 辅助量子计算实验 | MIT 研究者用 GPT-5.6 Sol + Codex 自主运行量子实验、分析结果并校准量子比特 |
| 09-08 | The Work Now Within Reach | 探讨更强更实惠的 AI 如何扩展人与企业可完成的工作范围 |
| 09-08 | 500 万美元 AI 与青少年发展研究资助 | 支持生成式 AI 对青少年发展、福祉与安全影响的独立研究 |
| 09-08 | 扩展新闻业支持:从课堂到编辑部 | 为学生、教育者、记者及新闻机构提供工具、培训和合作 |
| 09-08 | 1Password 用 Codex 提升工程效率 21% | 工程师用 Codex 快速构建新功能和内部工具,同时保持严格安全策略 |
| 09-08 | Navier-Stokes 数据使用澄清 | 祝贺 Alpöge 与 Buckmaster;声明未访问其任何工作,但不排除去标识化数据间接帮助了模型 |
| 09-08 | Sam Altman:Images 2.5 已上线 | "解不了超难数学题,但确实很好用" |
| 09-08 | Sam Altman:GPT-6 发布庆祝会 9/16 旧金山 | 9/10 前申请 |
| 09-08 | Tibo:全部付费订阅用量重置 | 为所有付费用户重置额度,让大家享受 Astra |
| 09-07 | 支持乌克兰独立新闻业 | 联合 AIRPPU 和 WAN-IFRA 启动 AI 项目 |
| 09-06 | An Alien Mind | Jakub Pachocki 反思对齐挑战,呼吁更强安全保障与国际协调 |
| 09-06 | 研究加速:OpenAI 内部视角 | 编码智能体正在重塑内部 AI 研究,公布智能体使用、实验速度等早期数据 |
| 09-05 | Wiki 事件与不对齐披露框架 | 智能体向多个互联网站点写入内容;承认披露实践需扩展,正制定框架并对接各国监管机构 |
| 09-04 | GPT-6 Astra 已在 GitHub Copilot 上线 | GitHub 内部测试显示其自主规划、验证、批量诊断能力强于此前 OpenAI 模型 |
| 09-03 | GPT-6 Astra 发布 | 在计算机使用、编码、网络安全、科学领域达到 SOTA |
| 09-03 | GPT-6 Astra 安全概览 | 首个达到 Preparedness Framework 下 Critical 级网络安全能力的模型 |
| 09-03 | Daybreak for Frontline Defenders:10 亿美元承诺 | 扩大前沿网络安全 AI、培训和支持的获取 |
| 09-03 | Playco 用 GPT-6 Astra 原型游戏 | 手动修复减少 50% |
| 09-03 | Legora 用 GPT-6 Astra 审查 41 份文件 | 找出全部 4 个植入错误,性能提升近 40% |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-08 | Claude Code v2.1.266 | 修复 2.1.265 回归:CLAUDE_CODE_USE_GATEWAY 单独设置时不再强制 Cloud 网关登录 |
| 09-08 | Claude Code v2.1.265 | 遥测新增 user.email 和 user.groups,与终端会话一致 |
| 09-08 | Boris Cherny:Claude Tag 值班助手 | CI 团队用 Claude Tag 读取告警/指标/日志,生成 SITREP 并维护 lessons.md |
| 09-06 | Claude Code v2.1.263 | Bug 修复与可靠性改进 |
| 09-04 | Claude 完成 Fermat 大定理首个形式化证明 | 超 1300 万行 Lean 代码,证明 29,000+ 依赖定理;此前专家预估需数年 |
| 09-04 | Claude Code v2.1.261 | /status 和 claude doctor 新增组织策略加载失败原因说明 |
| 09-03 | Claude Code v2.1.260 | 全屏模式下新增 /diff 面板,并排显示未提交的更改 |
| 09-01 | Claude Fable 5.1 与 Mythos 5.1 发布 | 定位为全球最先进的编码与知识工作模型 |
| 09-01 | Enterprise Frontier Safeguards (EFS) | 零数据保留++:数据留在客户云端,自动化监控层标记跨会话风险模式;今秋分阶段推出 |
| 08-31 | 对齐与安全更新 | 7 月报告 Claude 在无安全护栏的网络安全评估中未授权访问真实系统;公布加固措施与奖励作弊研究 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-07 | LLM 置信度与行为关系论文 | Nature Machine Intelligence 发表因果证据:提升/抑制置信度会改变模型回答或弃答行为 |
| 09-04 | Lyria 3.5 音乐生成模型 | 在 Gemini、AI Studio 和 API 上线;更丰富编曲、更具表现力的人声、更高保真 |
| 09-03 | WeatherNext 3 | 高分辨率温度与降水预报,直接从实时卫星观测学习;Brightband 实时排行榜上全球最佳 |
| 09-03 | AI 与生物学安全发展思考 | Pushmeet Kohli 撰文讨论如何负责任地加速 AI 生物学 |
| 09-02 | Gemini 3.8 Flash 在 DeepSWE 1.1 上得 73.7% | Logan Kilpatrick 公布 |
| 09-02 | Fairwind 项目 | 面向政府与企业的主动网络防御 |
| 09-01 | 8 月 AI 新闻回顾 | 含 Gemini 3.7 Flash、Pixel 手机、学生免费计划等 |
| 09-01 | Google Pics for Workspace | Workspace 内图像创建与编辑工具 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-08 | Muse — Meta 个人 AI 智能体 | HN 254 分 |
| 09-08 | Kimi K3 (2.8T) 在 MacBook Pro 上跑 1 token/s | 从四块 SSD 流式加载;HN 199 分 |
| 09-08 | LLM Attention 可视化 | HN 112 分 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-08 | Cognition 融资超 20 亿美元,估值 480 亿 | a16z/Accel/Founders Fund/GC/Avenir 领投;年化收入从 4.92 亿增至近 9 亿 |
| 09-08 | Simon Willison 论 Navier-Stokes 与数据使用 | 质疑"用我的数据改善模型性能"到底意味着什么 |
| 09-08 | GDB:ChatGPT Images 2.5 时尚场景演示 | 前代设计保真度高但偏平,2.5 让设计"活起来" |
| 09-07 | Latent.Space Frontier AEO 追踪器 | 追踪 Astra 优先什么来源、Sol→Astra 和 Opus→Fable 的变化 |
| 09-01 | World Labs 发布 Atlas 多模态世界模型 | 生成图像/视频帧,像素级相机控制,3D 重建 |
AA / Intelligence(综合智能) — 本期有变动
| 模型 | 上期分数 | 本期分数 | 排名变化 |
|---|---|---|---|
| Claude Fable 5.1 (Max) | 56.8 | 53.4 | — (仍第 1) |
| GPT-6 Astra (max) | 54.7 | 52.8 | — (仍第 2) |
| GPT-6 Astra (xhigh) | 54.3 | 52.5 | — (仍第 3) |
| Claude Opus 5 (Xhigh) | 53.4 | 49.7 | — (仍第 4) |
| Claude Fable 5.1 (Medium) | 52.8 | 49.1 | — (仍第 5) |
其他排名变动:Claude Opus 5 (Low) 13→11(分数 43.8→39.8);GPT-6 Astra (Non-reasoning) 8→7(47.8→45.2);Grok 4.6 (medium) 7→8(48.8→43.0);GLM-5.3-Flash 10→9(46.2→41.9);Muse Spark 1.2 (xhigh) 9→10(46.8→39.8);Claude Sonnet 5 (Max) 12→13(45.1→38.4);GPT-5.5 (xhigh) 11→12(45.6→38.6)。整体呈现全线分数下滑趋势。
LMArena / Overall — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.2 |
| 2 | claude-opus-4-6-high | 1504.8 |
| 3 | claude-fable-5.1-max | 1504.2 |
AA / Agentic(智能体能力) — 本期有变动
| 模型 | 上期排名 | 本期排名 | 分数变化 |
|---|---|---|---|
| Claude Fable 5.1 (Max) | 1 | 1 | 58.0(未变) |
| Claude Opus 5 (Xhigh) | 2 | 2 | 55.5(未变) |
| GPT-6 Astra (max) | 3 | 3 | 51.5(未变) |
排名变动:GPT-6 Astra (xhigh) 7→6(50.8→50.6);Claude Fable 5.1 (Medium) 6→7(50.9→50.6)。
AA / Coding(编码能力) — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max) | 81.6 |
| 2 | Claude Fable 5.1 (Medium) | 77.1 |
| 3 | Claude Opus 5 (Xhigh) | 77.0 |
SWE-bench Pro (Public) — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1 | 61.5 |
| 2 | gpt-5.4 (xHigh) | 59.1 |
| 3 | Muse Spark | 55.0 |
SWE-bench Verified — 本期有变动
Top 3 不变:Claude 4.5 Opus (Sonar) 79.2、Claude 4.5 Opus medium (live-SWE-agent) 79.2、Doubao-Seed-Code (TRAE) 78.8。
排名变动:Claude 4 Sonnet + o4-mini 10→9(74.4 分未变);GPT-5 9→10(74.4 分未变);Claude 3.5 Haiku 34→33(40.6 分未变);LLama 3.1 70B Critic 33→34(40.6 分未变)。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 公布 Navier-Stokes 千禧年大奖问题的 AI 生成证明,使用的是"比 GPT-6 Astra 显著更强的新一代模型",且 OpenAI 同时声明"不能排除去标识化用户数据间接帮助了模型"——这等于首次公开承认训练数据可能包含用户产品交互的衍生信息,Simon Willison 也据此质疑"用我的数据改善模型性能"的边界到底在哪。一条新闻同时推进了数学前沿和数据隐私争议两条线。
ChatGPT Images 2.5 发布后,GPT-Image-2.5 Sunburst 和 Flare 包揽 Text-to-Image、Image Edit、Multi-Image Edit 三大 Arena 榜单前两名,在三个赛道上均显著超越 GPT-Image-2 (medium)。OpenAI 在 Astra 发布仅五天后再推图像模型,节奏明显加速。
Cognition 融资超 20 亿美元、估值 480 亿美元,年化收入从 4.92 亿增至近 9 亿,由 a16z、Accel、Founders Fund 等联合领投。在 OpenAI 自主推出 Codex 和 GPT-6 Astra 的背景下,一家以 AI 编码智能体为核心的公司仍能获得此规模融资,说明市场对独立编码智能体赛道的定价尚未被前沿实验室的垂直整合所压制。