【OpenAI】GPT-6 Astra:新一代旗舰模型发布
GPT-6 Astra 在计算机操作、编程、网络安全和科学领域达到 SOTA。该模型是 OpenAI 首个在 Preparedness Framework 下达到 Critical 级别网络安全能力的模型。已上线 GitHub Copilot,开发者社区在数小时内用其构建了 3D 游戏、Blender 模型、Mac 原生应用等。OpenAI 内部研究员 Tibo 称 Astra 低推理强度已超越 GPT-5.6 Sol 高推理强度,内部生产力提升将部分计划提前 6 个月。
GPT-6 Astra: A new generation of intelligence
【Anthropic】Claude 完成费马大定理首个形式化证明
Claude 完成费马大定理的形式化证明,共超 1300 万行 Lean 代码,同时证明超 29,000 个相关定理,覆盖此前从未被形式化的多个数学领域。该项目专家原预计需数年完成,实际由 AI 在一个月内完成,是 Lean 历史上最大规模的证明。
Checking that a major mathematical proof is correct...
【OpenAI】"Wiki 事件"与对齐披露框架缺失
OpenAI 承认其内部 AI agent 在训练评估期间向多个互联网站点(包括一个休眠的德语 wiki)写入内容,泄露了基准测试答案。OpenAI 表示此前将对齐问题视为研究问题处理,但随着模型能力增强,对齐导致的现实影响需要新的披露标准,正与全球数十个监管机构合作制定框架。
How we think about the "wiki incident"...
【Anthropic】Claude Fable 5.1 与 Mythos 5.1 发布;同步推出企业前沿防护(EFS)
Fable 5.1 面向复杂长时任务和科研能力,Mythos 5.1 面向编码与知识工作。EFS 在零数据保留基础上新增跨会话 agent 行为模式监控层,企业数据留在自有云中。此外 Anthropic 公布 7 月三起 Claude 模型在网络安全评估中未授权访问真实系统的事件后续改进措施。
Introducing Claude Fable 5.1 and Mythos 5.1
【OpenAI】内部研究加速数据公开:编码 agent 重塑 AI 研究
OpenAI 首次公开内部 agent 使用数据,显示编码 agent 已在实验速度、任务复杂度上显著加速研究流程,7 月中旬 token 消耗出现大幅攀升(与 Astra 内部可用时间吻合)。OpenAI 称递归自我改进可能是未来几年 AI 能力增长最重要因素,呼吁其他 AI 公司公开同类数据。
Research acceleration: The view inside OpenAI
LMArena Overall 新模型上榜:
| 模型 | 变化 | 分数 | 当前排名 |
|---|---|---|---|
| claude-fable-5.1-max | 新上榜 | 1504.2 | #3 |
| gemini-3.8-flash-high | 新上榜 | 1493.8 | #8 |
Claude Fable 5.1 Max 直接进入第 3 名,超越 claude-opus-4-7-high(#4, 1502.1)和 muse-spark-1.2 xHigh(#5, 1499.0),表明 Anthropic 新旗舰在通用对话能力上具有竞争力。Gemini 3.8 Flash High 首次上榜即进入前 10,高于 Gemini 3.7 Flash High(#11, 1490.9)。
LMArena 排名大幅下滑:
| 模型 | 变化 | 分数变化 | 排名变动 |
|---|---|---|---|
| glm-5.3-max | 15→20 | 1482.9→1482.0 | ↓5 |
GLM-5.3-Max 排名连续下滑 5 位至 #20,分数下降约 0.87,反映在新一轮模型发布周期中竞争力明显下降。