【OpenAI】ChatGPT 开始测试广告
OpenAI 宣布在 ChatGPT 中测试广告,以支持免费用户访问。广告将清晰标注、独立于回答内容,并提供强隐私保护和用户控制选项。这标志着 OpenAI 商业化策略的重要转变,免费版用户未来可能需要接受广告换取模型访问权限。
【Anthropic】Claude 在黎曼猜想相关问题上取得进展
Anthropic 研究版 Claude 在黎曼猜想(Riemann Hypothesis)相关问题上取得突破:将满足黎曼猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%。虽未解决原问题,但这是数学基础研究中的重要进展。
【OpenAI】推出 GPT-5.6-Cyber 网络安全专用模型
OpenAI 发布 GPT-5.6-Cyber,专为授权漏洞研究、漏洞验证和安全测试设计。同时扩展 Daybreak 网络安全计划,新增 Blue 和 Red 访问层级,通过 AWS Bedrock 向企业提供安全工作流支持。
Expanding Daybreak as the Cyber Defense Window Narrows
【OpenAI】ChatGPT 和 Codex 桌面版登陆 Linux
OpenAI 发布 ChatGPT 和 Codex 桌面应用的 Linux 版本,用户可在 Linux 系统上使用 ChatGPT、ChatGPT Work 和 Codex,支持项目和浏览器工作流。同时支持从其他 AI 代理导入项目、对话、技能和插件。
【Google】Gemini 月活用户突破 10 亿
Google 宣布 Gemini 应用月活用户达到 10 亿,Gemma 开源模型家族下载量同样突破 10 亿。Google 将于 8 月 20 日在旧金山举办庆祝活动。
| Benchmark | 模型 | 变化 |
|---|---|---|
| LMArena | Qwen3.8-max | 排名 6→9,分数 1497.1→1490.7(↓4.3%) |
| LMArena | GPT-5.6-terra-xhigh | 排名 38→42,分数 1467.2→1465.0(↓1.5%) |
| LMArena | Kimi-k3-max | 排名 14→12,分数 1485.4→1487.3(↑1.3%) |
| LMArena | hy3 | 排名 57→52,分数 1453.0→1456.3(↑2.3%) |
| LMArena | muse-glimmer (新) | 首次上榜,排名 97,分数 1426.1 |
| AA Agentic | Grok Build 0.1 0616 (新) | 首次上榜,排名 15,分数 28.9 |
| SWE-Bench | Claude 4.5 Opus medium | 排名 2→1,分数 79.2 |
| 日期 | 新闻 |
|---|---|
| 08-10 | Anthropic 宣布未发布的研究版 Claude 在黎曼猜想相关问题上取得进展:将满足黎曼猜想的 ζ 函数零点比例下界从 41.6% 提升至 67.2%(研究页面,推文) |
| 08-04 | 英国 AISI 发布对 Claude Mythos 5 和 GPT-5.6 Sol 的网络安全评估报告,称模型在移除安全措施并赋予网络访问权限后「对真实人物和组织进行了持续的潜在有害活动」。Anthropic 表示这是「刻意宽松的条件」测试环境,不反映任何生产模型(推文) |
| 日期 | 新闻 |
|---|---|
| 08-11 | Gemini 应用月活用户达 10 亿,Gemma 模型家族下载量突破 10 亿(推文) |
| 08-11 | AMIE 医疗 AI 系统首次研究展示实时临床视频问诊能力 |
| 08-10 | Google Ads 和 Analytics 推出 AI 营销新工具 |
| 版本 | 发布时间 | 更新内容 |
|---|---|---|
| v2.1.228 | 08-11 | 修复交互式会话因罕见布局错误导致停止重绘的问题 |
| v2.1.227 | 08-10 | 修复登录令牌过期时会话错误评估功能标志、可能错误提示 Max 用户启用 Fable 额度的问题 |
| v2.1.225 | 08-08 | 新增网关消费限额支持,限额达价信息包含上限、重置时间和操作员消息 |
| v2.1.224 | 08-07 | 新增自托管环境支持,Team 和 Enterprise 用户可在自有机器或容器运行 Claude Code |
| 来源 | 内容 |
|---|---|
| OpenAI 工程师 Thariq (08-11) | ChatGPT 桌面应用和 Codex 登陆 Linux;支持从其他 Agent 导入项目、聊天、技能和插件(推文) |
| Simon Willison (08-10) | Claude Haiku 在 WebFetch 工具中仍被使用,存在幻觉风险;Muse Glimmer 30B 模型已在 Hugging Face 发布 GGUF 版本(推文、推文) |
| Boris Cherny (08-11) | LLM 生成的 bug 类型已变化:不再是 off-by-one,更多是系统设计、UI 可用性、缺少上下文问题;建议使用对抗性代码审查(推文) |
Artificial Analysis Intelligence 榜单 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
LMArena Overall 榜单 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1505.66 |
| 2 | claude-opus-4-6-thinking | 1504.98 |
| 3 | claude-opus-4-7-thinking | 1502.03 |
本期变动:
Agentic 榜单 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
本期变动:
Coding 榜单 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
本期无变动。
SWE-bench Verified Top 3:
| 排名 | 模型 + 框架 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
本期变动:
Terminal-Bench 2.0 Top 3:
| 排名 | 模型 + 框架 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
本期变动:
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 在 ChatGPT 免费版测试广告是其商业模式的重要转折点,明确承诺「清晰标注」「答案独立」「强隐私保护」说明其试图在变现与用户信任之间寻找平衡,但广告对用户体验的具体影响需待测试结果。
GPT-5.6-Cyber 网络安全专用模型发布标志着 AI 厂商开始针对垂直安全领域推出专业模型,OpenAI 同步扩展 Daybreak Blue/Red 分层访问机制,显示出其「将前沿能力优先交给防守方」的战略意图。
Claude 在黎曼猜想相关问题上将 ζ 函数零点下界从 41.6% 提升至 67.2%,虽未解决猜想本身,但证明了大模型在严肃数学研究中可产生实质性进展,而非仅限于代码生成或文本处理。