← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-15

2026-08-15 08:35 CST
快速版 完整版

核心速览

【OpenAI】Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed

OpenAI 推出 Ultrafast 服务层级,GPT-5.6 Sol 速度提升最高 14 倍,由 Cerebras 驱动,输出速度达 750 tokens/秒。已向部分客户开放 API 预览。这将显著降低高吞吐量场景的延迟成本。

【Anthropic】Claude text watermark FAQ

Anthropic 就水印功能发布 FAQ,明确水印为遵守欧盟 AI 法案而实施,不影响输出质量,不添加隐藏字符,不增加 token 消耗,无法追溯到具体用户或会话。

【Google】Gemini 3.7 Flash 上线

Gemini 3.7 Flash 面向 Pro 和 Ultra 用户全面开放,推理能力和准确度提升,优化多步骤任务和 Google Workspace 工具调用。Gemini 月活用户已达 10 亿。

【DeepSeek】DeepSeek Harness v0.1 发布

DeepSeek 开源 Agent 框架 Harness v0.1,基于 Cordis 元框架,采用"一切皆插件"架构,模型、工具、会话、沙箱等均可自由组合替换,MIT 许可证。


重大 Benchmark 变化

SWE-bench Verified:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 排名互换,前者升至第 1,后者降至第 2(分数均为 79.2)。

Terminal Bench 2.0:Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3(分数均为 80.2)。

新增模型:Nex-N2-Pro 首次进入 AA Agentic 排行榜,位列第 15 名,得分 31.2。

快速预览

  • OpenAI 推出 Ultrafast 模式,GPT-5.6 Sol 速度最高提升 14 倍,由 Cerebras 提供算力支持
  • Gemini 月活用户突破 10 亿,Gemini 3.7 Flash 向 Pro/Ultra 用户开放
  • Anthropic 发布文本水印 FAQ,强调不影响输出质量且无法追溯到特定用户
  • DeepSeek 开源 DeepSeek Harness v0.1,采用"一切皆插件"架构设计
  • Qwen 3.8-27B 发布,登顶 Hacker News AI 热门榜单

新闻

OpenAI

日期 新闻
08-13 Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed:预览 Ultrafast 服务层级,GPT-5.6 Sol 最高可达每秒 750 输出 token,由 Cerebras 提供算力
08-13 The builder's guide to GPT‑5.6:指导初创企业用 GPT-5.6 构建 AI Agent,涵盖模型选择与 Responses API
08-13 OpenAI appoints Dali Rajic as Chief Revenue Officer:任命 Dali Rajic 为首席营收官,负责全球营收组织
08-12 From assistance to execution: How enterprises put AI to work:研究揭示企业如何采用 Agent AI,前沿公司在 AI 采用方面领先
08-12 How RingCentral builds AI-native work from engineering to ops:RingCentral 用 ChatGPT Work 和 Codex 加速产品开发
08-11 Testing ads in ChatGPT:开始在 ChatGPT 测试广告,支持免费访问,附带清晰标注和隐私保护
08-11 Daybreak models are now available on AWS:Daybreak 网络安全模型通过 Amazon Bedrock 提供
08-10 Premium seats are coming to ChatGPT Business:ChatGPT Business 将推出高级席位,8 月 20 日前注册可获 100 美元额度

Anthropic

日期 新闻
08-14 Anthropic 发布 Claude 文本水印 FAQ:为遵守欧盟 AI 法案实施水印,不影响输出质量,无隐藏字符,不增加成本,无法追溯到特定用户或对话 (来源)
08-14 发布第二份风险报告,详述系统风险与应对准备 (来源)
08-10 Claude 研究版尝试黎曼猜想,将满足猜想的零点比例下界从 41.6% 提升至 67.2% (来源)

Google / Gemini

日期 新闻
08-14 Gemini 3.7 Flash 向 Pro/Ultra 用户开放,提升多步推理与工具调用能力 (来源)
08-13 SL2T 手语转文字模型上线,美式手语用户可在 Pixel 11 直接打字 (来源)
08-11 Gemini 月活用户突破 10 亿,为 Google 增长最快产品;Gemma 模型系列下载量达 10 亿次 (来源)
08-13 Bring your spreadsheet data to life with Sheets canvas:Sheets canvas 让表格数据可视化
08-11 AMIE demonstrates real-time clinical video consultation capabilities:医疗 AI 系统 AMIE 展示实时视频问诊能力

DeepSeek

日期 新闻
08-13 DeepSeek Harness v0.1 开发者预览版发布,基于 Cordis 元框架,采用"一切皆插件"架构,MIT 许可证开源 (来源)

Claude Code 更新

版本 日期 更新内容
v2.1.233 08-14 --worktree 标志和 claude agents 视图支持 GitLab MR URL
v2.1.232 08-13 子代理分叉默认启用,继承完整对话和提示缓存
v2.1.231 08-13 修复 MCP OAuth 登录时的 redirect URI 不匹配问题

其他

  • Qwen 3.8-27B 发布,登顶 Hacker News AI 热门榜(848 分)(链接)
  • Google 推进同态加密让私有 AI 更实用,HN 讨论 261 分 (链接)
  • GLM-5.3 发布,定位编程与网络安全防御 (来源)

行业格局

本期变动: SWE-bench Verified 榜单头部名次微调

变化 模型 排名变化 分数
Claude 4.5 Opus medium (20251101) 2 → 1 79.2
Claude 4.5 Opus 1 → 2 79.2

当前 Top 3(AA Intelligence):

  1. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) — 62.5
  2. Muse Spark 1.2 (xhigh) — 56.8
  3. GPT-5.5 (xhigh) — 56.3

当前 Top 3(LMArena Overall):

  1. claude-fable-5 — 1507
  2. claude-opus-4-6-high — 1505
  3. claude-opus-4-7-high — 1502

干活选型

本期变动:

榜单 变化
AA Agentic Nex-N2-Pro 新上榜,排名 15,分数 31.2
Terminal-Bench 2.0 Claude Opus 4.7 3→2,Gemini 3.1 Pro 2→3(同分 80.2)

当前 Top 3(AA Agentic):

  1. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) — 58.4
  2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 49.7
  3. Muse Spark 1.2 (xhigh) — 49.3

当前 Top 3(AA Coding):

  1. Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) — 77.0
  2. GPT-5.5 (xhigh) — 74.9
  3. Muse Spark 1.2 (xhigh) — 72.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI 的 Ultrafast 模式将 GPT-5.6 Sol 推至每秒 750 token,速度提升 14 倍且由 Cerebras 提供算力,表明推理速度竞赛已从模型能力延伸到硬件加速层。Gemini 月活用户破 10 亿、Gemma 系列下载量破 10 亿,显示 Google 在 C 端用户规模和开源生态两端均已形成相当体量。Anthropic 的水印 FAQ 明确"不影响输出质量、不增加成本、无法追溯到特定用户",是对欧盟 AI 法案合规要求的直接回应,也为其他将实施水印的厂商提供了参照口径。

来源 · 77 条