【OpenAI】推出 GPT-5.6-Cyber 网络安全专用模型,扩展 Daybreak 计划
OpenAI 发布 GPT-5.6-Cyber,这是首个专为高级网络安全任务设计的大规模模型,用于漏洞研究、渗透测试等授权安全工作。该模型通过 Daybreak Blue 和 Red 两级访问权限开放给经过审核的防御者,在攻击者利用 AI 前抢先部署防御能力。
Expanding Daybreak as the Cyber Defense Window Narrows
【Anthropic】研究版 Claude 在黎曼猜想相关问题上取得进展
Anthropic 用未发布的研究版 Claude 挑战黎曼猜想,虽未解决该难题,但将黎曼 zeta 函数满足假设的零点比例下界从 41.6% 提升至 67.2%。这是 AI 在前沿数学领域的重要能力展示。
【Meta】发布 Muse Glimmer 30B 开源智能体模型
Meta 发布 Muse Glimmer,一个 30B 参数的开源权重智能体模型,采用 Apache 2.0 协议。该模型可在 24GB 显存上运行且不损失智能体可靠性,专为本地持续运行的智能体工作流优化,已在 Hugging Face 上线。
Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows
【Anthropic】Claude Code 新增自托管运行器功能
Claude Code v2.1.224 新增 self-hosted-runner 功能,允许 Team 和 Enterprise 计划用户将自己的机器或容器转变为 Claude Code 的运行环境,支持 Web、移动和桌面会话。
SWE-bench Verified 排名更新:Claude 4.5 Opus medium 登顶第 1 名(79.2 分),Claude 4.6 Opus 新上榜位列第 9(75.6 分)。GPT 5.2 (high) 新上榜位列第 19(72.8 分),GLM 5 (high) 新上榜位列第 18(72.8 分)。
8月10日
OpenAI 发布 GPT-5.6-Cyber,这是首个大规模针对高级网络安全任务(如漏洞利用开发)的专用模型,通过 Daybreak Red 提供给授权的漏洞研究、漏洞验证和安全测试使用。同时扩展 Daybreak 计划,新增 Blue 和 Red 两个访问层级。
OpenAI 向德克萨斯州州长 Abbott 发送 公开信,阐述在德州负责任建设 AI 基础设施的承诺。
OpenAI CFO Sarah Friar 分享 构建 AI 原生财务职能的五条经验,涵盖自动预测、强化管控和 AI ROI 等主题。
Model ML 展示如何用 GPT-5.6 Sol 完成金融工作,从研究分析到可编辑的 PowerPoint 和 Excel 文件。
ChatGPT Business 即将推出 Premium 席位,8月20日前注册可获 100 美元工作空间额度。
企业案例:Zapier 用 ChatGPT Work 优化营销流程,Virgin Atlantic 用其加速客户旅程分析。
8月10日
Anthropic 披露,一个未发布的研究版 Claude 尝试攻克黎曼猜想,虽未解决但取得进展:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。详见 研究报告。
Boris Cherny 发文指出,Anthropic 通过模型训练+输入探测+意图分类器多层叠加,已将间接提示注入攻击率降至接近零,这使 Claude Code 的自动模式得以成为默认设置。
8月10日
Meta 发布 Muse Glimmer 30B,这是一个针对始终在线的本地智能体工作流优化的开源模型(Apache 2.0),可在 24GB 显存上运行而不损失智能体可靠性。HN 讨论 热度 1023 点。
Mark Zuckerberg 批评"封闭"AI 竞争对手,宣布 Meta 回归开源路线。FT 报道引发 HN 讨论 352 点。
8月10日
Google Ads 和 Google Analytics 推出 AI Advisor 界面,帮助营销人员优化广告投放。
8月10日
发布 v2.1.227,修复登录令牌过期时功能标志误判 Max 用户启用额度的问题。
8月8日
v2.1.225 新增网关支出限制支持,限额提示现显示上限、重置时间和操作者消息。
8月7日
v2.1.224 新增自托管环境功能,Team 和 Enterprise 计划可将自有机器或容器转为 Claude Code 运行环境。
Artificial Analysis 综合能力
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
LMArena 总榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.3 |
| 2 | claude-opus-4-6-thinking | 1504.6 |
| 3 | claude-opus-4-7-thinking | 1501.7 |
SWE-bench Verified — 本期大变动
| 变化类型 | 模型 | 变化 |
|---|---|---|
| 新登顶 | Claude 4.5 Opus medium (20251101) | 排名 2→1,分数 79.2 |
| 新模型 | Claude 4.6 Opus | 新入榜排名第 9,分数 75.6 |
| 新模型 | GLM 5 (high) | 新入榜排名第 18,分数 72.8 |
| 新模型 | GPT 5.2 (high) | 新入榜排名第 19,分数 72.8 |
当前 Top 3:Claude 4.5 Opus medium (20251101) 79.2|Claude 4.5 Opus 79.2|Doubao-Seed-Code 78.8
Terminal-Bench 2.0
| 变化类型 | 模型 | 变化 |
|---|---|---|
| 排名上升 | Claude Opus 4.7 | 排名 3→2,分数 80.2 |
| 排名下降 | Gemini 3.1 Pro | 排名 2→3,分数 80.2 |
当前 Top 3:GPT-5.5 (NexAU-AHE) 84.7|Claude Opus 4.7 (WOZCODE) 80.2|Gemini 3.1 Pro (TongAgents) 80.2
Agentic 能力
本期无变动。Top 3:Claude Opus 5 (Xhigh) 58.4|Claude Sonnet 5 (Max) 49.7|Muse Spark 1.2 (xhigh) 49.3
编程能力
本期无变动。Top 3:Claude Opus 5 (Xhigh) 77.0|GPT-5.5 (xhigh) 74.9|Muse Spark 1.2 (xhigh) 72.2
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 推出 GPT-5.6-Cyber 并扩展 Daybreak 计划,标志着前沿 AI 能力首次系统性地向网络安全防御侧倾斜——在 AISI 刚披露 Claude 和 GPT 模型在网络安全评估中出现"非预期行为"的背景下,OpenAI 选择主动将攻击能力以受控方式开放给授权方,而非等待黑产先行利用。
Meta 的 Muse Glimmer 30B 以 Apache 2.0 协议开源、24GB 显存可运行的定位,直接填补了"本地智能体"场景的空白——对比 Claude Haiku 被批评"幻觉严重",开源侧正在用可审计、可本地部署的方案争夺对可靠性敏感的开发者用户。