← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-19

2026-08-19 08:54 CST
快速版 完整版

核心速览

【Anthropic】Claude 文本水印 FAQ 及第二份风险报告发布

Anthropic 发布水印 FAQ,明确水印为合规 EU AI Act 而设,不影响输出质量、不增加 token 消耗、不可追溯至个人。同日发布第二份 Responsible Scaling Policy 风险报告,披露系统风险与应对准备度。水印方案已签署同一 Code of Practice,其他主要模型开发商也将跟进实施。

【OpenAI】GPT-5.6 Sol 全平台半价 + Ultrafast 模式预览

OpenAI 预览 Ultrafast 模式,由 Cerebras 驱动,GPT-5.6 Sol 速度达 14×,最高 750 tokens/秒。同期 OpenRouter 和 Vercel AI Gateway 均对 GPT-5.6 Sol 降价 50%,flex 层低至 $1.25/$7.50,Vercel 优惠持续至 9 月 18 日。价格下调直接降低了高频 API 调用方的推理成本,尤其利好批量推理和 flex 层工作负载。

【Google DeepMind】Gemini 3.7 Flash 上线 + 矩阵乘法常数 ω 新纪录

Gemini 3.7 Flash 面向 Pro/Ultra 用户开放,推理与多步任务精度提升,Spark 亦改用该模型。DeepMind 同日宣布矩阵乘法复杂度常数 ω 的新纪录(arXiv:2608.16884)。

【Anthropic】Claude Cowork 上线移动端和 Web 端 + Claude Code 新增 /design 技能

Claude Cowork 开始向 Max 计划滚动,用户可在桌面端交任务、手机端取结果。Claude Code 新增 /design 研究预览(可编辑 UI 画板)及拼写检查设置,CLI p99 CPU 占用降低 2×(修复 Bun GC 定时器问题)。

【DeepSeek】DeepSeek Harness v0.1 开发者预览发布,MIT 协议开源

基于 Cordis 元框架的 agent harness,核心设计为"一切皆插件"——模型、工具、技能、会话、沙箱、文件系统、编排、UI 全部可替换扩展。代码库已开源。

重大 Benchmark 变化

SWE-bench Verified:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换排名——前者升至第 1,后者降至第 2,两者分数均为 79.2,无实际分数变化。GPT 5.2 Codex 从第 19 升至第 17(跳升 2 位,分数 72.8 不变)。其余模型排名变动均 ≤2 位,未达报告阈值。

Terminal Bench 2.0:Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3,两者分数均为 80.2,无分数变化。其余变动均 <5 位,不构成重大变化。

本期无 benchmark 分数变动 ≥5% 的情况,所有变化均为同分排名微调。

快速预览

  • OpenAI 推出国家安全民主监督倡议,同步发布网络安全模型开发节奏报告
  • Claude Code v2.1.235 发布,新增拼写检查;Claude Cowork 上线移动端和 Web 端
  • GPT-5.6 Sol 在 OpenRouter 和 Vercel AI Gateway 均降价 50%,Ultrafast 模式预览最高 14 倍速
  • Google DeepMind 宣布矩阵乘法 ω 新纪录;Gemini 3.7 Flash 向 Pro/Ultra 用户开放
  • SWE-bench Verified 榜单变动:Claude 4.5 Opus medium 与 Claude 4.5 Opus 互换前二

新闻

OpenAI

时间 标题 摘要
08-18 19:00 Strengthening democratic oversight in national security 启动加强国家安全领域 AI 民主监督的倡议,为政府机构提供工具、培训和专业知识支持。
08-18 11:00 Partnering with CodeAI to prepare the first AI generation 与 CodeAI 合作,帮助学生建立 AI 素养、批判性思维及负责任使用 AI 的技能。
08-18 11:00 Pacing model development in an era of cyber-critical capabilities 加强前沿模型的监控、对齐和安全保障,公布指导模型开发节奏的新安全措施。
08-18 11:00 Introducing ChatGPT for Teens 推出面向青少年的 ChatGPT,内置更强保护机制、健康使用功能和家长控制。
08-18 07:00 Asana cleared 5 years of engineering work in 2 weeks with Codex Asana 使用 Codex 两周内完成预计五年的测试系统替换工作,花费约 $12K。
08-18 00:00 How NVIDIA scales expertise with ChatGPT Work NVIDIA 团队使用 ChatGPT Work 减少手动任务、连接快速信号并扩展工作流。
08-17 05:30 The Defender's Window 分析 AI 对攻防双方网络安全的影响,介绍 OpenAI 的防御强化措施。
08-17 05:00 OpenAI joins PORTS-Pike project 加入 PORTS-Pike 项目,扩大社区投资并支持南俄亥俄数千个就业岗位。
08-17 03:15 New policy ideas for the Intelligence Age 资助 14 个独立项目探索 AI 政策新思路,扩大经济机会和增强社会韧性。
08-13 11:00 The builder's guide to GPT-5.6 介绍初创企业如何使用 GPT-5.6 构建更快、更具成本效益的 AI 代理。
08-13 10:00 Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed 预览 Ultrafast API 服务层,由 Cerebras 驱动,GPT-5.6 Sol 最高 750 tokens/s 输出。
08-13 09:00 OpenAI appoints Dali Rajic as Chief Revenue Officer 任命 Dali Rajic 为首席收入官,领导全球收入组织。
08-12 06:00 From assistance to execution: How enterprises put AI to work 研究报告揭示企业如何采用 Agentic AI、使用 ChatGPT 和 Codex。
08-12 00:00 How RingCentral builds AI-native work RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 产品开发。
08-11 10:00 Testing ads in ChatGPT 开始在 ChatGPT 中测试广告,支持免费访问,附带清晰标注和隐私保护。
08-11 10:00 Daybreak models are now available on AWS Daybreak 网络安全能力通过 Amazon Bedrock 提供给企业安全工作流。
08-10 17:00 What building an AI-native finance function taught me CFO Sarah Friar 分享构建 AI 原生财务职能的五条经验。
08-10 14:00 OpenAI's letter to Governor Abbott on responsible AI infrastructure in Texas 向德州州长致信,承诺负责任地建设 AI 基础设施。
08-10 12:00 Model ML completes finance work more efficiently with GPT-5.6 Sol Model ML 使用 GPT-5.6 Sol 将金融研究分析输出为可编辑的 PowerPoint 和 Excel。
08-10 10:00 Putting frontier cyber models in more trusted hands 经批准的 Daybreak 合作伙伴可使用前沿网络安全模型提供授权安全服务。
08-10 10:00 Expanding Daybreak as the Cyber Defense Window Narrows 推出 GPT-5.6-Cyber,通过 Daybreak Red 提供授权漏洞研究和安全测试。
08-10 00:00 Premium seats are coming to ChatGPT Business ChatGPT Business 推出 Premium 席位,8 月 20 前注册可获 $100 工作区额度。
08-10 00:00 Virgin Atlantic sharpens customer journeys with ChatGPT Work Virgin Atlantic 使用 ChatGPT Work 加速研究和产品规划。
08-10 00:00 How Zapier transformed core marketing processes with ChatGPT Work Zapier 营销团队使用 ChatGPT Work 减少漏斗流失、构建营销资产并自动化报告。
08-07 15:20 Responding to the next frontier of critical cyber capabilities 公布 Astra 网络安全初步评估结果及加强安全控制的措施。
08-07 09:00 How HSP GRUPPE builds AI capabilities for tax advisory HSP GRUPPE 使用 ChatGPT Enterprise 提升税务咨询生产力。
08-06 10:00 Improving GPT-5.6 Sol in ChatGPT 改进 GPT-5.6 Sol 准确性和一致性,扩大免费用户对 GPT-5.6 Luna 的访问。
08-06 06:00 Working with the American Psychological Association on youth mental health and AI 与美国心理学会合作推进负责任 AI 使用和青少年心理健康指导。
08-06 00:00 From asking to doing: How the world is putting ChatGPT to work 发布 OpenAI Signals 数据,展示全球 ChatGPT 使用趋势和国家层面洞察。

Sam Altman (OpenAI) — 08-18 16:57 回应 Jensen Huang,表示期待合作;08-14 03:12 转发 Ultrafast 模式预览;08-13 14:37 转发 OpenAI 基金会 $100M 民间社会与公益计划。

Greg Brockman (OpenAI) — 08-17 12:22 呼吁防御者抓住窗口期提升网络安全实践;08-17 02:45 分享 ChatGPT 浏览器使用案例(7 年税务/银行/移民文件数分钟处理)。

OpenAI Devs — 08-18 16:24 转发 NVIDIA TensorRT Model Connect 公开预览,项目全程用 Codex 代理构建;08-17 17:36 转发 OpenRouter GPT-5.6 Sol 半价;08-17 15:24 转发 Vercel AI Gateway GPT-5.6 Sol 半价至 9 月 18 日;08-12 20:36 转发 Codex for Linux 发布(Ubuntu/Debian/Fedora)。


Anthropic / Claude

时间 标题 摘要
08-18 20:38 Claude Code v2.1.235 released 新增可选 spellcheck 设置,输入时用 aspell/hunspell/ispell 下划线标出错拼词。
08-17 20:20 Claude Code v2.1.234 released 新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量,可为每项目 transcript 目录选短名。
08-14 22:20 (08-14) Claude Code v2.1.233 released --worktreeclaude agents 视图新增 GitLab MR URL 支持(显示为 !N)。
08-13 23:29 Claude Code v2.1.232 released Subagent forking 默认开启;交互式会话中非队友 agent 默认后台运行。
08-13 08:38 Claude Code v2.1.231 released 修复 Slack 等预注册 OAuth 客户端的 MCP OAuth 登录重定向 URI 不匹配问题。

Anthropic 官方 — 08-14 19:16 发布水印 FAQ:为遵守 EU AI Act 实施文本水印,不影响输出质量、不添加隐藏字符、不增加 token 费用、不可追溯个人或组织;08-14 18:00 发布第二期 Risk Report。

Boris Cherny (Anthropic) — 08-18 16:48 转发 Claude Cowork 上线移动端和 Web 端(所有付费计划,Max 计划先行 Beta);08-18 02:24 分享 Claude Code CLI p99 CPU 降 2 倍的 GC 优化;08-18 02:20 介绍新 /design 技能(研究预览),将 Claude Design 画板工作流带入 CLI 和 Desktop。

Alex Albert (Anthropic) — 08-14 19:16 转发水印 FAQ。


Google / DeepMind

时间 标题 摘要
08-17 08:00 Get closer to the game with Gemini and Pixel Google 与足球俱乐部合作推广 Gemini 和 Pixel。
08-13 16:45 Bring your spreadsheet data to life with Sheets canvas Google Sheets 推出 Canvas 功能。
08-11 17:00 AMIE demonstrates real-time clinical video consultation capabilities 医疗 AI 系统 AMIE 首次展示实时临床视频问诊能力。
08-10 14:30 Evolve your marketing with new AI tools Google Ads 和 Analytics 推出新 AI 工具。

Google DeepMind — 08-18 14:12 宣布矩阵乘法指数 ω 新纪录(arXiv 论文)。

Gemini 团队 — 08-14 18:06 Gemini 3.7 Flash 向所有 Pro 和 Ultra 用户开放,改进多步推理和准确性;Gemini Spark 也已切换至 3.7 Flash。08-13 17:11 Demis Hassabis 宣布 3.7 Flash 定价为 3.6 Flash 的一半。

Logan Kilpatrick (Google) — 08-13 18:57 确认 3.7 Flash 上线;08-11 19:38 宣布 Gemini 月活用户达 10 亿、Gemma 模型下载量达 10 亿。


DeepSeek

08-13 13:02 — DeepSeek Harness v0.1 开发者预览:MIT 许可开源,基于 Cordis 元框架,核心理念为"一切皆插件"(模型、工具、技能、会话、沙箱、文件系统、循环、编排、UI 均为插件)。GitHub: deepseek-ai/deepseek-harness


其他

Z.ai (GLM) — 08-14 05:17 Simon Willison 转发 GLM-5.3 发布:743B 基座模型后训练,主打编码和网络安全,据称在开源模型中设定了网络安全新标准。

Tibo Sottiaux (OpenAI) — 08-18 06:45 趣味推文赞 Codex;08-17 23:53 征求 Codex/API/模型"显而易见但尚未做"的功能建议;08-17 00:36 称 Codex 已接近 100% 可靠、将开源并支持 Astra。

Swyx — 08-18 19:36 开源 AI Engineer YouTube 缩略图 A/B 测试经验;08-18 17:30 转发生成媒体 Track 直播;08-18 14:49 转发 context engineering 一小时工作坊(可降低 90% token 成本)。

Hacker News — 08-18 17:02 Claude Code 五月–八月 2026 周限额促销(255 分);08-18 19:30 Norway should buy OpenAI(201 分);08-18 21:14 Claude Code 教 macOS 原生打印 HP Laser 1008a(105 分)。


Benchmark 快照

行业格局

[AA / Intelligence]

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

[LMArena / Overall]

排名 模型 分数
1 claude-fable-5 1506.6
2 claude-opus-4-6-high 1504.7
3 claude-opus-4-7-high 1502.2

本期无变动。

干活选型

[AA / Agentic]

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

本期无变动。

[AA / Coding]

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

本期无变动。

[SWE-bench Pro / Public]

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

本期无变动。

[SWE-bench Verified]

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (live-SWE-agent) 79.2
2 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

本期变化:

  • Claude 4.5 Opus medium (20251101) 从第 2 升至第 1,Claude 4.5 Opus 从第 1 降至第 2(同分 79.2,排名互换)。
  • Claude 4 Sonnet + o4-mini 从第 14 升至第 13;GPT-5 从第 13 降至第 14(同分 74.4)。
  • GPT 5.2 Codex 从第 19 升至第 17;GPT 5.2 (high) 从第 18 降至第 19;GLM 5 (high) 从第 17 降至第 18。
  • GPT 5.1 Codex (medium) 从第 32 升至第 31;GPT 5.1 (2025-11-13) (medium) 从第 31 降至第 32。
  • GLM 4.6 (T=1) 从第 50 降至第 51;Qwen3-Coder 480B/A35B Instruct 从第 51 升至第 50。

[Terminal-Bench 2.0]

排名 模型 脚手架 分数
1 GPT-5.5 NexAU-AHE 84.7
2 Claude Opus 4.7 WOZCODE 80.2
3 Gemini 3.1 Pro TongAgents 80.2

本期变化:

  • Claude Opus 4.7 从第 3 升至第 2;Gemini 3.1 Pro 从第 2 降至第 3(同分 80.2,排名互换)。
  • Grok 4 从第 39 升至第 38;Qwen 3 Coder 480B 从第 38 降至第 39(同分 27.2)。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 国家安全民主监督 + 网络安全模型开发节奏报告:同日同时发布民主监督倡议和 cyber-critical 能力时代的模型开发节奏报告,配合上周已推出的 GPT-5.6-Cyber(Daybreak Red)和 Astra 初步安全评估,OpenAI 正在将"安全叙事"从被动合规转向主动塑造政策框架——这是在美国国家安全 AI 监管尚未定型时抢占话语权的明确信号。

  2. GPT-5.6 Sol 全平台降价 50%:OpenRouter 和 Vercel AI Gateway 同步半价,Flex 层最低 $1.25 输入 / $7.50 输出,叠加 Ultrafast 模式(Cerebras 驱动、750 tokens/s)预览——OpenAI 正在用价格 + 速度双降对冲 Gemini 3.7 Flash(定价为 3.6 Flash 一半)的竞争压力,价格战从高端模型延伸到 API 推理层。

  3. Claude 4.5 Opus medium 登顶 SWE-bench Verified:Claude 4.5 Opus medium (20251101) 以 79.2 分与 Claude 4.5 Opus 并列第一但排名互换,说明在 SWE-bench Verified 榜单上 medium 配置的 scaffold(live-SWE-agent)已在统计上追平高配版本——这对实际工程选型意味着用更小的推理预算可获得同等修复能力。

来源 · 82 条