← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-11

2026-08-11 08:56 CST
快速版 完整版

核心速览

【OpenAI】推出 GPT-5.6-Cyber 网络安全专用模型,扩展 Daybreak 计划

OpenAI 发布 GPT-5.6-Cyber,这是首个专为高级网络安全任务设计的大规模模型,用于漏洞研究、渗透测试等授权安全工作。该模型通过 Daybreak Blue 和 Red 两级访问权限开放给经过审核的防御者,在攻击者利用 AI 前抢先部署防御能力。

Expanding Daybreak as the Cyber Defense Window Narrows

【Anthropic】研究版 Claude 在黎曼猜想相关问题上取得进展

Anthropic 用未发布的研究版 Claude 挑战黎曼猜想,虽未解决该难题,但将黎曼 zeta 函数满足假设的零点比例下界从 41.6% 提升至 67.2%。这是 AI 在前沿数学领域的重要能力展示。

Anthropic X

【Meta】发布 Muse Glimmer 30B 开源智能体模型

Meta 发布 Muse Glimmer,一个 30B 参数的开源权重智能体模型,采用 Apache 2.0 协议。该模型可在 24GB 显存上运行且不损失智能体可靠性,专为本地持续运行的智能体工作流优化,已在 Hugging Face 上线。

Muse Glimmer: 30B-parameter model optimized for always-on local agent workflows

【Anthropic】Claude Code 新增自托管运行器功能

Claude Code v2.1.224 新增 self-hosted-runner 功能,允许 Team 和 Enterprise 计划用户将自己的机器或容器转变为 Claude Code 的运行环境,支持 Web、移动和桌面会话。

Claude Code v2.1.224 released


重大 Benchmark 变化

SWE-bench Verified 排名更新:Claude 4.5 Opus medium 登顶第 1 名(79.2 分),Claude 4.6 Opus 新上榜位列第 9(75.6 分)。GPT 5.2 (high) 新上榜位列第 19(72.8 分),GLM 5 (high) 新上榜位列第 18(72.8 分)。

快速预览

  • OpenAI 发布 GPT-5.6-Cyber 网络安全专用模型,扩展 Daybreak 计划
  • Meta 发布 Muse Glimmer 30B 开源智能体模型,可在 24GB 显存运行
  • Anthropic 未发布版 Claude 在黎曼猜想相关问题上取得进展
  • SWE-bench Verified 榜单大洗牌,Claude 4.5 Opus medium 登顶
  • Claude Code 发布自托管运行器功能,支持 Team/Enterprise 计划

OpenAI:网络安全模型与企业功能

8月10日

OpenAI 发布 GPT-5.6-Cyber,这是首个大规模针对高级网络安全任务(如漏洞利用开发)的专用模型,通过 Daybreak Red 提供给授权的漏洞研究、漏洞验证和安全测试使用。同时扩展 Daybreak 计划,新增 Blue 和 Red 两个访问层级。

OpenAI 向德克萨斯州州长 Abbott 发送 公开信,阐述在德州负责任建设 AI 基础设施的承诺。

OpenAI CFO Sarah Friar 分享 构建 AI 原生财务职能的五条经验,涵盖自动预测、强化管控和 AI ROI 等主题。

Model ML 展示如何用 GPT-5.6 Sol 完成金融工作,从研究分析到可编辑的 PowerPoint 和 Excel 文件。

ChatGPT Business 即将推出 Premium 席位,8月20日前注册可获 100 美元工作空间额度。

企业案例:Zapier 用 ChatGPT Work 优化营销流程,Virgin Atlantic 用其加速客户旅程分析。


Anthropic:数学突破与安全研究

8月10日

Anthropic 披露,一个未发布的研究版 Claude 尝试攻克黎曼猜想,虽未解决但取得进展:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。详见 研究报告

Boris Cherny 发文指出,Anthropic 通过模型训练+输入探测+意图分类器多层叠加,已将间接提示注入攻击率降至接近零,这使 Claude Code 的自动模式得以成为默认设置。


Meta:开源智能体模型

8月10日

Meta 发布 Muse Glimmer 30B,这是一个针对始终在线的本地智能体工作流优化的开源模型(Apache 2.0),可在 24GB 显存上运行而不损失智能体可靠性。HN 讨论 热度 1023 点

Mark Zuckerberg 批评"封闭"AI 竞争对手,宣布 Meta 回归开源路线。FT 报道引发 HN 讨论 352 点


Google:营销 AI 工具

8月10日

Google Ads 和 Google Analytics 推出 AI Advisor 界面,帮助营销人员优化广告投放。


Claude Code:自托管与安全改进

8月10日

发布 v2.1.227,修复登录令牌过期时功能标志误判 Max 用户启用额度的问题。

8月8日

v2.1.225 新增网关支出限制支持,限额提示现显示上限、重置时间和操作者消息。

8月7日

v2.1.224 新增自托管环境功能,Team 和 Enterprise 计划可将自有机器或容器转为 Claude Code 运行环境。


行业动态

  • Mistral 获得"代码实现工具调用"专利,HN 讨论 207 点
  • Needle2:14MB 的端侧智能体 LLM,面向手机、可穿戴设备和机器人,HN 讨论 150 点
  • Simon Willison 批评 Claude Haiku 幻觉严重,被 Claude Code WebFetch 工具使用带来风险

行业格局

Artificial Analysis 综合能力

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

LMArena 总榜

排名 模型 分数
1 claude-fable-5 1507.3
2 claude-opus-4-6-thinking 1504.6
3 claude-opus-4-7-thinking 1501.7

干活选型

SWE-bench Verified — 本期大变动

变化类型 模型 变化
新登顶 Claude 4.5 Opus medium (20251101) 排名 2→1,分数 79.2
新模型 Claude 4.6 Opus 新入榜排名第 9,分数 75.6
新模型 GLM 5 (high) 新入榜排名第 18,分数 72.8
新模型 GPT 5.2 (high) 新入榜排名第 19,分数 72.8

当前 Top 3:Claude 4.5 Opus medium (20251101) 79.2|Claude 4.5 Opus 79.2|Doubao-Seed-Code 78.8

Terminal-Bench 2.0

变化类型 模型 变化
排名上升 Claude Opus 4.7 排名 3→2,分数 80.2
排名下降 Gemini 3.1 Pro 排名 2→3,分数 80.2

当前 Top 3:GPT-5.5 (NexAU-AHE) 84.7|Claude Opus 4.7 (WOZCODE) 80.2|Gemini 3.1 Pro (TongAgents) 80.2

Agentic 能力

本期无变动。Top 3:Claude Opus 5 (Xhigh) 58.4|Claude Sonnet 5 (Max) 49.7|Muse Spark 1.2 (xhigh) 49.3

编程能力

本期无变动。Top 3:Claude Opus 5 (Xhigh) 77.0|GPT-5.5 (xhigh) 74.9|Muse Spark 1.2 (xhigh) 72.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI 推出 GPT-5.6-Cyber 并扩展 Daybreak 计划,标志着前沿 AI 能力首次系统性地向网络安全防御侧倾斜——在 AISI 刚披露 Claude 和 GPT 模型在网络安全评估中出现"非预期行为"的背景下,OpenAI 选择主动将攻击能力以受控方式开放给授权方,而非等待黑产先行利用。

Meta 的 Muse Glimmer 30B 以 Apache 2.0 协议开源、24GB 显存可运行的定位,直接填补了"本地智能体"场景的空白——对比 Claude Haiku 被批评"幻觉严重",开源侧正在用可审计、可本地部署的方案争夺对可靠性敏感的开发者用户。

来源 · 89 条