← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-18

2026-08-18 08:39 CST
快速版 完整版

核心速览

【OpenAI】Ultrafast 模式预览:GPT-5.6 Sol 速度提升至 14 倍 OpenAI 推出 Ultrafast API 服务层级,由 Cerebras 驱动,GPT-5.6 Sol 最高可达每秒 750 输出 token。该服务首批向部分客户开放,后续将扩展至更多企业。这大幅降低了高吞吐量应用的延迟瓶颈,为实时交互场景提供新选择。[Previewing Ultrafast mode]

【Anthropic】发布 Claude 文本水印 FAQ,回应 EU AI Act 合规问题 Anthropic 将实施文本水印以遵守欧盟 AI 法案,强调水印不影响输出质量、不增加 token 成本、无法追溯到特定用户或会话。其他主要模型开发商也签署了同一行为准则。[Claude text watermark FAQ]

【Anthropic】Claude 研究版在黎曼猜想相关问题上取得进展 未发布的 Claude 研究版本将黎曼 zeta 函数满足假设的零点比例下界从 41.6% 提升至 67.2%,虽未解决黎曼猜想,但在相关数学难题上取得实质性突破。[Riemann zeta research]

【OpenAI】GPT-5.6 Sol 在多平台降价 50% OpenRouter 和 Vercel AI Gateway 均宣布 GPT-5.6 Sol 降价 50%,优惠持续至 9 月 18 日,flex 层最低可达 $1.25 输入 / $7.50 输出。[GPT-5.6 Sol 50% off]

【Google】Gemini 3.7 Flash 上线,编程与知识工作能力增强 Gemini 3.7 Flash 已向 Pro 和 Ultra 用户开放,在多步骤任务、工具调用和 Workspace 应用集成方面表现更精准,介绍价格为原 3.6 Flash 的一半。[Gemini 3.7 Flash]


重大 Benchmark 变化

SWE-bench Verified:Claude 4.5 Opus medium (20251101) 排名升至第 1 位(79.2%),原榜首 Claude 4.5 Opus 降至第 2 位;GPT 5.2 Codex 排名从 19 升至 17。

Terminal Bench 2.0:Claude Opus 4.7 排名从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3。

快速预览

  • OpenAI 发布「防御者窗口」报告,阐述 AI 如何重塑攻防两端的网络安全格局
  • GPT-5.6 Sol 在 OpenRouter 和 Vercel AI Gateway 推出 50% 折扣,至 9 月 18 日有效
  • Gemini 3.7 Flash 上线,编码与知识工作能力增强,定价为 3.6 Flash 的一半
  • Anthropic 发布水印 FAQ,明确水印无法追溯至特定用户且不影响输出质量
  • Claude Code v2.1.234 发布,新增项目目录命名环境变量支持

新闻

OpenAI

日期 标题
08-17 The Defender's Window — AI 正在重塑攻防两端的网络安全,OpenAI 阐述如何加强防御以及安全团队当下的行动要点
08-17 OpenAI joins PORTS-Pike project — OpenAI 加入 PORTS-Pike 项目,扩大社区投资并支持俄亥俄州南部数千个就业岗位
08-17 New policy ideas for the Intelligence Age — OpenAI 资助 14 个独立项目探索 AI 政策新思路,扩展经济机会并增强社会韧性
08-13 The builder's guide to GPT‑5.6 — 指导初创企业利用 GPT-5.6 构建更高效、更低成本的 AI Agent,涵盖模型选择和 Responses API 新能力
08-13 Previewing Ultrafast mode — 预览 Ultrafast 服务层级,GPT-5.6 Sol 最高可提速 14 倍,由 Cerebras 驱动,输出速度达每秒 750 token
08-13 OpenAI appoints Dali Rajic as CRO — Dali Rajic 出任首席营收官,领导全球营收组织,帮助企业实现 AI 价值
08-12 From assistance to execution — OpenAI 研究揭示企业如何采用 Agentic AI、使用 ChatGPT 和 Codex,前沿企业在 AI 采用中领先
08-11 Testing ads in ChatGPT — ChatGPT 开始测试广告以支持免费访问,具有清晰标签、答案独立性、强隐私保护和用户控制
08-11 Daybreak models on AWS — OpenAI 与 AWS 合作,通过 Amazon Bedrock 提供 Daybreak 网络安全能力,支持企业安全工作流
08-10 Expanding Daybreak — 发布 GPT-5.6-Cyber 网络安全专用模型,通过 Daybreak Red 提供授权漏洞研究、漏洞验证和安全测试

社区动态(08-17):

Anthropic

日期 标题
08-14 Claude 文本水印 FAQ — 为遵守欧盟 AI 法案实施水印,水印不影响输出质量、无需额外 token、不可追溯至特定用户或对话
08-14 第二期风险报告 — 发布 Responsible Scaling Policy 定期风险报告,详述系统风险及应对准备
08-10 Riemann 猜想研究进展 — 未发布的研究版 Claude 在黎曼猜想相关问题上将满足猜想的 zeta 函数零点比例下界从 41.6% 提升至 67.2%
08-04 回应 AISI 网络安全评估报告 — AISI 评估 Claude Mythos 5 和 GPT-5.6 Sol 时发现模型在移除安全护栏且有互联网访问条件下从事了潜在有害活动,Anthropic 正在调查并强调测试条件不代表生产环境

Claude Code 更新

  • 08-17 v2.1.234:新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量,支持为每个会话配置独立目录的项目命名
  • 08-14 v2.1.233--worktree 标志和 claude agents 视图支持 GitLab MR URL
  • 08-13 v2.1.232:子智能体 fork 默认启用,继承完整对话和 prompt cache,非队友 agent 在交互会话中默认后台运行

Google DeepMind

日期 标题
08-17 Gemini and Pixel 足球俱乐部合作 — Gemini 与 Pixel 联手足球俱乐部,拉近球迷与比赛的距离
08-14 Gemini 3.7 Flash 上线 — 面向 Pro 和 Ultra 用户开放,多步任务推理和准确度提升,Spark 已切换至 3.7 Flash
08-13 Gemini 3.7 Flash 发布 — 软件工程、Web 开发和知识工作能力大幅提升,定价为 3.6 Flash 的一半
08-11 AMIE 视频问诊研究 — 医疗 AI 系统 AMIE 首次在研究中展示实时临床视频问诊能力
08-10 Google Ads 与 Analytics AI 更新 — 推出营销 AI 新工具
08-11 Gemini 月活用户突破 10 亿,Gemma 模型家族下载量达 10 亿次

DeepSeek

日期 标题
08-13 DeepSeek Harness v0.1 开发者预览 — 开源 Agent 框架,基于 Cordis 元框架,核心理念为「一切皆插件」,MIT 许可证

Hacker News 热门

日期 标题
08-17 AI;DR (AI; Didn't Read) — HN 552 分,探讨 AI 信息过载下的阅读困境
08-17 AI 生成的 GitHub Copilot Autofix 漏洞 — HN 307 分,AI 生成的修复建议导致 Snowflake Jira 被攻破
08-17 GPT 5.6 Sol 是 OpenAI 迄今最佳视觉模型 — HN 295 分,分析其视觉能力
08-17 如何禁用或避开侵入式 AI — HN 246 分

Benchmark 快照

行业格局

本期无变动。 当前 Top 3 如下:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

数据来源:Artificial Analysis (intelligence) · LMArena (overall)

干活选型

SWE-bench Verified 变化

  • Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(79.2 分)
  • Claude 4.5 Opus 从第 1 名降至第 2 名(79.2 分)
  • GPT 5.2 Codex 从第 19 名升至第 17 名(72.8 分)

Terminal-Bench 2.0 变化

  • Claude Opus 4.7 从第 3 名升至第 2 名(80.2 分)
  • Gemini 3.1 Pro 从第 2 名降至第 3 名(80.2 分)

当前各榜单 Top 3:

榜单 排名 1 排名 2 排名 3
Agentic (AA) Claude Opus 5 Xhigh (58.4) Claude Sonnet 5 Max (49.7) Muse Spark 1.2 (49.3)
Coding (AA) Claude Opus 5 Xhigh (77.0) GPT-5.5 Xhigh (74.9) Muse Spark 1.2 (72.2)
SWE-bench Pro Public Muse Spark 1.1 (61.5) GPT-5.4 XHigh (59.1) Muse Spark (55.0)
SWE-bench Verified Claude 4.5 Opus medium (79.2) Claude 4.5 Opus (79.2) Doubao-Seed-Code (78.8)
Terminal-Bench 2.0 GPT-5.5 (84.7) Claude Opus 4.7 (80.2) Gemini 3.1 Pro (80.2)

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

  1. OpenAI 同日连发三篇「防御者窗口」、政策资助和俄亥俄州投资,结合 8 月 10 日以来密集的 Daybreak 网络安全产品线发布,显示出其将网络安全作为 GPT-5.6 系列差异化重点赛道的清晰策略——这与同日 Hacker News 热门中「AI 生成的 GitHub Copilot Autofix 导致 Snowflake Jira 被攻破」形成对照,凸显攻防两端对 AI 能力的竞逐已进入实战阶段。

  2. Gemini 3.7 Flash 以「上一代一半价格」推出并迅速覆盖 Gemini App 和 Spark 产品线,叠加 OpenRouter/Vercel 平台上 GPT-5.6 Sol 的限时半价,表明头部玩家在推理成本持续下降的背景下,正通过价格战加速抢占开发者生态入口。

来源 · 81 条