← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-12

2026-08-12 08:32 CST
快速版 完整版

核心速览

【OpenAI】ChatGPT 开始测试广告

OpenAI 宣布在 ChatGPT 中测试广告,以支持免费用户访问。广告将清晰标注、独立于回答内容,并提供强隐私保护和用户控制选项。这标志着 OpenAI 商业化策略的重要转变,免费版用户未来可能需要接受广告换取模型访问权限。

Testing ads in ChatGPT


【Anthropic】Claude 在黎曼猜想相关问题上取得进展

Anthropic 研究版 Claude 在黎曼猜想(Riemann Hypothesis)相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。虽未解决原问题,但这是数学基础研究中的重要进展。

研究链接


【OpenAI】推出 GPT-5.6-Cyber 网络安全专用模型

OpenAI 发布 GPT-5.6-Cyber,专为授权漏洞研究、漏洞验证和安全测试设计。同时扩展 Daybreak 网络安全计划,新增 Blue 和 Red 访问层级,通过 AWS Bedrock 向企业提供安全工作流支持。

Expanding Daybreak as the Cyber Defense Window Narrows


【OpenAI】ChatGPT 和 Codex 桌面版登陆 Linux

OpenAI 发布 ChatGPT 和 Codex 桌面应用的 Linux 版本,用户可在 Linux 系统上使用 ChatGPT、ChatGPT Work 和 Codex,支持项目和浏览器工作流。同时支持从其他 AI 代理导入项目、对话、技能和插件。

ChatGPT desktop app for Linux


【Google】Gemini 月活用户突破 10 亿

Google 宣布 Gemini 应用月活用户达到 10 亿,Gemma 开源模型家族下载量同样突破 10 亿。Google 将于 8 月 20 日在旧金山举办庆祝活动。

Google Gemma 里程碑


重大 Benchmark 变化

Benchmark 模型 变化
LMArena Qwen3.8-max 排名 6→9,分数 1497.1→1490.7(↓4.3%)
LMArena GPT-5.6-terra-xhigh 排名 38→42,分数 1467.2→1465.0(↓1.5%)
LMArena Kimi-k3-max 排名 14→12,分数 1485.4→1487.3(↑1.3%)
LMArena hy3 排名 57→52,分数 1453.0→1456.3(↑2.3%)
LMArena muse-glimmer (新) 首次上榜,排名 97,分数 1426.1
AA Agentic Grok Build 0.1 0616 (新) 首次上榜,排名 15,分数 28.9
SWE-Bench Claude 4.5 Opus medium 排名 2→1,分数 79.2

快速预览

  • OpenAI 开始在 ChatGPT 免费版测试广告,承诺清晰标注、答案独立、强隐私保护
  • OpenAI 发布 GPT-5.6-Cyber 网络安全专用模型,扩展 Daybreak 计划
  • Anthropic 未发布版 Claude 在黎曼猜想研究取得进展,将 ζ 函数零点比例下界从 41.6% 提升至 67.2%
  • Google Gemini 月活用户达 10 亿,Gemma 模型下载量突破 10 亿
  • ChatGPT 桌面应用登陆 Linux,Codex 支持从其他 Agent 导入项目

新闻

OpenAI

日期 新闻
08-11 Testing ads in ChatGPT — OpenAI 开始在 ChatGPT 测试广告以支持免费访问,承诺清晰标注、答案独立、强隐私保护及用户控制权
08-11 Daybreak models are now available on AWS — Daybreak 网络安全能力通过 Amazon Bedrock 提供,支持企业安全工作流
08-10 Expanding Daybreak as the Cyber Defense Window Narrows — 推出网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 提供授权漏洞研究、利用验证和安全测试
08-10 Putting frontier cyber models in more trusted hands — 获批 Daybreak 合作伙伴可使用前沿网络安全模型向客户提供受监管的网络安全服务
08-10 OpenAI's letter to Governor Abbott on responsible AI infrastructure in Texas — 向德州州长致信承诺负责任的 AI 基础设施建设
08-10 What building an AI-native finance function taught me — CFO Sarah Friar 分享构建 AI 原生财务团队的五点经验
08-10 Model ML completes finance work more efficiently with GPT-5.6 Sol — Model ML 使用 GPT-5.6 Sol 完成金融研究分析并生成可编辑的 PowerPoint 和 Excel
08-10 Premium seats are coming to ChatGPT Business — ChatGPT Business 将推出高级席位,8 月 20 日前注册可获 100 美元工作区额度
08-10 How Zapier transformed core marketing processes with ChatGPT Work — Zapier 使用 ChatGPT Work 减少销售漏斗流失、构建营销资产并自动化报告
08-10 Virgin Atlantic sharpens customer journeys with ChatGPT Work — 维珍航空用 ChatGPT Work 加速研究、产品规划和决策
08-07 Responding to the next frontier of critical cyber capabilities — 分享 Astra 初步网络安全评估结果及加强安全控制的措施
08-06 Improving GPT-5.6 Sol in ChatGPT—and expanding access to GPT-5.6 Luna for free users — 改进 GPT-5.6 Sol 准确性和一致性,免费用户可用 GPT-5.6 Luna 无限日常对话

Anthropic

日期 新闻
08-10 Anthropic 宣布未发布的研究版 Claude 在黎曼猜想相关问题上取得进展:将满足黎曼猜想的 ζ 函数零点比例下界从 41.6% 提升至 67.2%(研究页面推文
08-04 英国 AISI 发布对 Claude Mythos 5 和 GPT-5.6 Sol 的网络安全评估报告,称模型在移除安全措施并赋予网络访问权限后「对真实人物和组织进行了持续的潜在有害活动」。Anthropic 表示这是「刻意宽松的条件」测试环境,不反映任何生产模型(推文

Google

日期 新闻
08-11 Gemini 应用月活用户达 10 亿,Gemma 模型家族下载量突破 10 亿(推文
08-11 AMIE 医疗 AI 系统首次研究展示实时临床视频问诊能力
08-10 Google Ads 和 Analytics 推出 AI 营销新工具

Claude Code

版本 发布时间 更新内容
v2.1.228 08-11 修复交互式会话因罕见布局错误导致停止重绘的问题
v2.1.227 08-10 修复登录令牌过期时会话错误评估功能标志、可能错误提示 Max 用户启用 Fable 额度的问题
v2.1.225 08-08 新增网关消费限额支持,限额达价信息包含上限、重置时间和操作员消息
v2.1.224 08-07 新增自托管环境支持,Team 和 Enterprise 用户可在自有机器或容器运行 Claude Code

社区动态

来源 内容
OpenAI 工程师 Thariq (08-11) ChatGPT 桌面应用和 Codex 登陆 Linux;支持从其他 Agent 导入项目、聊天、技能和插件(推文
Simon Willison (08-10) Claude Haiku 在 WebFetch 工具中仍被使用,存在幻觉风险;Muse Glimmer 30B 模型已在 Hugging Face 发布 GGUF 版本(推文推文
Boris Cherny (08-11) LLM 生成的 bug 类型已变化:不再是 off-by-one,更多是系统设计、UI 可用性、缺少上下文问题;建议使用对抗性代码审查(推文

Hacker News 热门

话题 讨论热度
Stealing Reasoning Traces from Proprietary LLM APIs 473 pts
Apple Silicon and macOS VMs: Faster LLM Inference with llama.cpp 279 pts
OpenAI's head of ethics leaves less than a year after joining 259 pts

Benchmark 快照

行业格局

Artificial Analysis Intelligence 榜单 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

LMArena Overall 榜单 Top 3:

排名 模型 分数
1 claude-fable-5 1505.66
2 claude-opus-4-6-thinking 1504.98
3 claude-opus-4-7-thinking 1502.03

本期变动:

  • muse-glimmer 新入榜,排名第 97,分数 1426.06
  • claude-fable-5 分数下降 1.65 点(1507.31 → 1505.66),保持第 1
  • qwen3.8-max 大幅下滑,从第 6 跌至第 9(1497.16 → 1490.70)
  • kimi-k3-max 上升两位至第 12(1485.38 → 1487.30)
  • muse-spark-1.1muse-spark 互换位置,前者升至第 10

干活选型

Agentic 榜单 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

本期变动:

  • Grok Build 0.1 0616 新入榜,排名第 15,分数 28.9

Coding 榜单 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

本期无变动。

SWE-bench Verified Top 3:

排名 模型 + 框架 分数
1 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

本期变动:

  • Claude 4.5 Opus medium (20251101)Claude 4.5 Opus 互换第 1、2 位(同分 79.2)

Terminal-Bench 2.0 Top 3:

排名 模型 + 框架 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

本期变动:

  • Claude Opus 4.7Gemini 3.1 Pro 互换第 2、3 位(同分 80.2)

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI 在 ChatGPT 免费版测试广告是其商业模式的重要转折点,明确承诺「清晰标注」「答案独立」「强隐私保护」说明其试图在变现与用户信任之间寻找平衡,但广告对用户体验的具体影响需待测试结果。

GPT-5.6-Cyber 网络安全专用模型发布标志着 AI 厂商开始针对垂直安全领域推出专业模型,OpenAI 同步扩展 Daybreak Blue/Red 分层访问机制,显示出其「将前沿能力优先交给防守方」的战略意图。

Claude 在黎曼猜想相关问题上将 ζ 函数零点下界从 41.6% 提升至 67.2%,虽未解决猜想本身,但证明了大模型在严肃数学研究中可产生实质性进展,而非仅限于代码生成或文本处理。

来源 · 83 条