← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-16

2026-08-16 08:58 CST
快速版 完整版

核心速览

【OpenAI】Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed

OpenAI 推出 Ultrafast 服务层级,GPT-5.6 Sol 速度最高提升 14 倍,达到每秒 750 个输出 token,由 Cerebras 提供算力支持。该服务首先向部分客户开放,后续将扩大访问范围。这意味着高吞吐量场景(如批量数据处理、实时交互)的 API 调用效率将大幅提升。

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed


【Anthropic】Claude 文本水印 FAQ

Anthropic 发布水印功能 FAQ,明确标注是为了遵守欧盟 AI 法案,其他主要模型开发商也已签署相同行为准则。水印不会影响输出质量、不增加隐藏字符、不额外消耗 token、无法追溯到特定用户或对话。

Claude text watermark FAQ


【Google】Gemini 3.7 Flash 发布

Gemini 3.7 Flash 向所有 Pro 和 Ultra 用户开放,在软件工程、网页开发和知识工作任务上带来重大升级,推理和多步骤任务准确度提升。Intro 定价为 3.6 Flash 原价的一半。

Gemini 3.7 Flash is now available


【DeepSeek】DeepSeek Harness v0.1 开发者预览

DeepSeek 发布开源 Agent harness 框架,基于 Cordis 元框架,核心设计理念是"一切皆插件"——模型、工具、技能、沙箱、文件系统、编排和 UI 均可替换和扩展。代码以 MIT 许可证开源。

DeepSeek Harness v0.1


【Anthropic】第二份风险报告发布

作为 Responsible Scaling Policy 一部分,Anthropic 发布第二份风险报告,详细披露系统风险及应对准备情况。

Aug 2026 Risk Report


重大 Benchmark 变化

无符合条件(排名变动≥5 或分数变动≥5%)的重大变化。

快速预览

  • OpenAI 发布 Ultrafast 模式,GPT-5.6 Sol 速度提升至 14 倍,达 750 tokens/秒
  • Gemini 3.7 Flash 上线,软件工程能力升级,价格降至 3.6 Flash 的一半
  • Anthropic 发布第二份风险报告,并澄清 Claude 文本水印技术细节
  • DeepSeek 开源 DeepSeek Harness v0.1,基于「一切皆插件」理念构建 Agent 框架
  • Claude Code 持续迭代,子代理 fork 功能默认开启

新闻

OpenAI

日期 新闻
08-13 Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed — 与 Cerebras 合作推出 Ultrafast 服务层级,GPT-5.6 Sol 速度最高提升 14 倍,输出达 750 tokens/秒
08-13 The builder's guide to GPT-5.6 — 指导初创企业利用 GPT-5.6 构建更高效、更低成本的 AI Agent
08-13 OpenAI appoints Dali Rajic as Chief Revenue Officer — 任命 Dali Rajic 为首席收入官,负责全球收入组织
08-12 From assistance to execution: How enterprises put AI to work — 研究揭示企业如何采用 Agent AI 以及前沿企业的 AI 采用趋势
08-11 Testing ads in ChatGPT — 开始在 ChatGPT 中测试广告,支持免费访问,承诺清晰标注、答案独立性、强隐私保护
08-11 Daybreak models are now available on AWS — Daybreak 网络安全能力通过 Amazon Bedrock 向企业提供
08-10 Expanding Daybreak as the Cyber Defense Window Narrows — 发布 GPT-5.6-Cyber,专为网络安全任务设计的模型

Sam Altman 在 X 平台表示「正朝着无需手动选择模型的方向前进」,回应了多 Agent v2 支持委托至 Luna 模型的功能。

Anthropic / Claude

日期 新闻
08-14 Anthropic 发布 Claude 文本水印 FAQ,澄清:水印为遵守欧盟 AI 法案,不影响输出质量,无隐藏字符,不增加 token 成本,无法追溯至特定用户
08-14 发布 第二份风险报告,详细说明系统风险及应对准备
08-10 研究版 Claude 尝试黎曼猜想,将满足假设的零点比例下界从 41.6% 提升至 67.2%(研究详情

Claude Code 近期密集发布:v2.1.232 子代理 fork 默认开启,v2.1.233 新增 GitLab MR URL 支持。Boris Cherny 分享让 Claude 自动维护应用的实验:几周内提交 388 个 PR,其中 180 个合并。

Google / Gemini

日期 新闻
08-14 Gemini 3.7 Flash 向所有 Pro/Ultra 用户开放,推理与多步骤任务能力提升,Gemini Spark 已切换至该模型
08-13 Demis Hassabis 宣布 3.7 Flash 软件工程、Web 开发与知识工作能力大幅升级,价格降至 3.6 Flash 一半
08-11 Logan Kilpatrick 披露:Gemini 应用月活用户达 10 亿,Gemma 模型家族下载量达 10 亿次
08-11 AMIE 医疗 AI 展示实时临床视频问诊能力

DeepSeek

日期 新闻
08-13 DeepSeek Harness v0.1 开发者预览版发布,MIT 开源,基于 Cordis 元框架,核心理念为「一切皆插件」——模型、工具、技能、会话、沙箱、文件系统等均可替换扩展

其他

日期 新闻
08-15 HN 热门:AI has access to a vastly larger working memory than the human brain 讨论AI与人类工作记忆差异
08-15 HN 热门:Working with AI feels more like leadership than coding 探讨 AI 时代开发者的角色转变

行业格局

本期无变动

当前 Top 3(Artificial Analysis Intelligence 榜单):

  1. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) — 62.5 分
  2. Muse Spark 1.2 (xhigh) — 56.8 分
  3. GPT-5.5 (xhigh) — 56.3 分

当前 Top 3(LMArena 综合榜):

  1. claude-fable-5 — 1506.6 分
  2. claude-opus-4-6-high — 1504.7 分
  3. claude-opus-4-7-high — 1502.2 分

干活选型

有变化

SWE-bench Verified

  • Claude 4.5 Opus medium (20251101) 排名从第 2 升至第 1(79.2 分)
  • Claude 4.5 Opus 排名从第 1 降至第 2(79.2 分)
  • GPT 5.2 Codex 排名从第 19 升至第 17(72.8 分)

当前 Top 5:

  1. Claude 4.5 Opus medium (20251101) — 79.2 分
  2. Claude 4.5 Opus — 79.2 分
  3. Doubao-Seed-Code — 78.8 分
  4. Gemini 3 Pro Preview — 77.4 分
  5. Claude 4 Sonnet — 76.8 分

Terminal-Bench 2.0

  • Claude Opus 4.7 排名从第 3 升至第 2(80.2 分)
  • Gemini 3.1 Pro 排名从第 2 降至第 3(80.2 分)

当前 Top 3:

  1. GPT-5.5 — 84.7 分
  2. Claude Opus 4.7 — 80.2 分
  3. Gemini 3.1 Pro — 80.2 分

Artificial Analysis Coding/Agentic 榜单本期无变动

Coding Top 3:

  1. Claude Opus 5 (Xhigh) — 77.0 分
  2. GPT-5.5 (xhigh) — 74.9 分
  3. Muse Spark 1.2 (xhigh) — 72.2 分

Agentic Top 3:

  1. Claude Opus 5 (Xhigh) — 58.4 分
  2. Claude Sonnet 5 (Max) — 49.7 分
  3. Muse Spark 1.2 (xhigh) — 49.3 分

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI 与 Cerebras 合作的 Ultrafast 模式将 GPT-5.6 Sol 推至 750 tokens/秒,速度提升 14 倍,这对于需要快速迭代的 Agent 应用场景(如实时交互、多轮规划)具有实际价值,但需注意目前仅向部分客户开放,规模化能力待验证。

Gemini 3.7 Flash 在软件工程与知识工作能力上的升级配合半价策略,配合 10 亿月活用户基数,显示出 Google 正在通过「更强更便宜」的产品策略争夺开发者生态。

Anthropic 主动澄清水印技术细节(无隐藏字符、不增成本、不可追溯用户)是对欧盟 AI 法案合规要求的透明化回应,有助于缓解用户对隐私和输出质量的担忧。

来源 · 77 条