【Anthropic】Claude 文本水印 FAQ 及第二份风险报告发布
Anthropic 发布水印 FAQ,明确水印为合规 EU AI Act 而设,不影响输出质量、不增加 token 消耗、不可追溯至个人。同日发布第二份 Responsible Scaling Policy 风险报告,披露系统风险与应对准备度。水印方案已签署同一 Code of Practice,其他主要模型开发商也将跟进实施。
【OpenAI】GPT-5.6 Sol 全平台半价 + Ultrafast 模式预览
OpenAI 预览 Ultrafast 模式,由 Cerebras 驱动,GPT-5.6 Sol 速度达 14×,最高 750 tokens/秒。同期 OpenRouter 和 Vercel AI Gateway 均对 GPT-5.6 Sol 降价 50%,flex 层低至 $1.25/$7.50,Vercel 优惠持续至 9 月 18 日。价格下调直接降低了高频 API 调用方的推理成本,尤其利好批量推理和 flex 层工作负载。
【Google DeepMind】Gemini 3.7 Flash 上线 + 矩阵乘法常数 ω 新纪录
Gemini 3.7 Flash 面向 Pro/Ultra 用户开放,推理与多步任务精度提升,Spark 亦改用该模型。DeepMind 同日宣布矩阵乘法复杂度常数 ω 的新纪录(arXiv:2608.16884)。
【Anthropic】Claude Cowork 上线移动端和 Web 端 + Claude Code 新增 /design 技能
Claude Cowork 开始向 Max 计划滚动,用户可在桌面端交任务、手机端取结果。Claude Code 新增 /design 研究预览(可编辑 UI 画板)及拼写检查设置,CLI p99 CPU 占用降低 2×(修复 Bun GC 定时器问题)。
【DeepSeek】DeepSeek Harness v0.1 开发者预览发布,MIT 协议开源
基于 Cordis 元框架的 agent harness,核心设计为"一切皆插件"——模型、工具、技能、会话、沙箱、文件系统、编排、UI 全部可替换扩展。代码库已开源。
SWE-bench Verified:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换排名——前者升至第 1,后者降至第 2,两者分数均为 79.2,无实际分数变化。GPT 5.2 Codex 从第 19 升至第 17(跳升 2 位,分数 72.8 不变)。其余模型排名变动均 ≤2 位,未达报告阈值。
Terminal Bench 2.0:Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3,两者分数均为 80.2,无分数变化。其余变动均 <5 位,不构成重大变化。
本期无 benchmark 分数变动 ≥5% 的情况,所有变化均为同分排名微调。
| 时间 | 标题 | 摘要 |
|---|---|---|
| 08-18 19:00 | Strengthening democratic oversight in national security | 启动加强国家安全领域 AI 民主监督的倡议,为政府机构提供工具、培训和专业知识支持。 |
| 08-18 11:00 | Partnering with CodeAI to prepare the first AI generation | 与 CodeAI 合作,帮助学生建立 AI 素养、批判性思维及负责任使用 AI 的技能。 |
| 08-18 11:00 | Pacing model development in an era of cyber-critical capabilities | 加强前沿模型的监控、对齐和安全保障,公布指导模型开发节奏的新安全措施。 |
| 08-18 11:00 | Introducing ChatGPT for Teens | 推出面向青少年的 ChatGPT,内置更强保护机制、健康使用功能和家长控制。 |
| 08-18 07:00 | Asana cleared 5 years of engineering work in 2 weeks with Codex | Asana 使用 Codex 两周内完成预计五年的测试系统替换工作,花费约 $12K。 |
| 08-18 00:00 | How NVIDIA scales expertise with ChatGPT Work | NVIDIA 团队使用 ChatGPT Work 减少手动任务、连接快速信号并扩展工作流。 |
| 08-17 05:30 | The Defender's Window | 分析 AI 对攻防双方网络安全的影响,介绍 OpenAI 的防御强化措施。 |
| 08-17 05:00 | OpenAI joins PORTS-Pike project | 加入 PORTS-Pike 项目,扩大社区投资并支持南俄亥俄数千个就业岗位。 |
| 08-17 03:15 | New policy ideas for the Intelligence Age | 资助 14 个独立项目探索 AI 政策新思路,扩大经济机会和增强社会韧性。 |
| 08-13 11:00 | The builder's guide to GPT-5.6 | 介绍初创企业如何使用 GPT-5.6 构建更快、更具成本效益的 AI 代理。 |
| 08-13 10:00 | Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed | 预览 Ultrafast API 服务层,由 Cerebras 驱动,GPT-5.6 Sol 最高 750 tokens/s 输出。 |
| 08-13 09:00 | OpenAI appoints Dali Rajic as Chief Revenue Officer | 任命 Dali Rajic 为首席收入官,领导全球收入组织。 |
| 08-12 06:00 | From assistance to execution: How enterprises put AI to work | 研究报告揭示企业如何采用 Agentic AI、使用 ChatGPT 和 Codex。 |
| 08-12 00:00 | How RingCentral builds AI-native work | RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 产品开发。 |
| 08-11 10:00 | Testing ads in ChatGPT | 开始在 ChatGPT 中测试广告,支持免费访问,附带清晰标注和隐私保护。 |
| 08-11 10:00 | Daybreak models are now available on AWS | Daybreak 网络安全能力通过 Amazon Bedrock 提供给企业安全工作流。 |
| 08-10 17:00 | What building an AI-native finance function taught me | CFO Sarah Friar 分享构建 AI 原生财务职能的五条经验。 |
| 08-10 14:00 | OpenAI's letter to Governor Abbott on responsible AI infrastructure in Texas | 向德州州长致信,承诺负责任地建设 AI 基础设施。 |
| 08-10 12:00 | Model ML completes finance work more efficiently with GPT-5.6 Sol | Model ML 使用 GPT-5.6 Sol 将金融研究分析输出为可编辑的 PowerPoint 和 Excel。 |
| 08-10 10:00 | Putting frontier cyber models in more trusted hands | 经批准的 Daybreak 合作伙伴可使用前沿网络安全模型提供授权安全服务。 |
| 08-10 10:00 | Expanding Daybreak as the Cyber Defense Window Narrows | 推出 GPT-5.6-Cyber,通过 Daybreak Red 提供授权漏洞研究和安全测试。 |
| 08-10 00:00 | Premium seats are coming to ChatGPT Business | ChatGPT Business 推出 Premium 席位,8 月 20 前注册可获 $100 工作区额度。 |
| 08-10 00:00 | Virgin Atlantic sharpens customer journeys with ChatGPT Work | Virgin Atlantic 使用 ChatGPT Work 加速研究和产品规划。 |
| 08-10 00:00 | How Zapier transformed core marketing processes with ChatGPT Work | Zapier 营销团队使用 ChatGPT Work 减少漏斗流失、构建营销资产并自动化报告。 |
| 08-07 15:20 | Responding to the next frontier of critical cyber capabilities | 公布 Astra 网络安全初步评估结果及加强安全控制的措施。 |
| 08-07 09:00 | How HSP GRUPPE builds AI capabilities for tax advisory | HSP GRUPPE 使用 ChatGPT Enterprise 提升税务咨询生产力。 |
| 08-06 10:00 | Improving GPT-5.6 Sol in ChatGPT | 改进 GPT-5.6 Sol 准确性和一致性,扩大免费用户对 GPT-5.6 Luna 的访问。 |
| 08-06 06:00 | Working with the American Psychological Association on youth mental health and AI | 与美国心理学会合作推进负责任 AI 使用和青少年心理健康指导。 |
| 08-06 00:00 | From asking to doing: How the world is putting ChatGPT to work | 发布 OpenAI Signals 数据,展示全球 ChatGPT 使用趋势和国家层面洞察。 |
Sam Altman (OpenAI) — 08-18 16:57 回应 Jensen Huang,表示期待合作;08-14 03:12 转发 Ultrafast 模式预览;08-13 14:37 转发 OpenAI 基金会 $100M 民间社会与公益计划。
Greg Brockman (OpenAI) — 08-17 12:22 呼吁防御者抓住窗口期提升网络安全实践;08-17 02:45 分享 ChatGPT 浏览器使用案例(7 年税务/银行/移民文件数分钟处理)。
OpenAI Devs — 08-18 16:24 转发 NVIDIA TensorRT Model Connect 公开预览,项目全程用 Codex 代理构建;08-17 17:36 转发 OpenRouter GPT-5.6 Sol 半价;08-17 15:24 转发 Vercel AI Gateway GPT-5.6 Sol 半价至 9 月 18 日;08-12 20:36 转发 Codex for Linux 发布(Ubuntu/Debian/Fedora)。
| 时间 | 标题 | 摘要 |
|---|---|---|
| 08-18 20:38 | Claude Code v2.1.235 released | 新增可选 spellcheck 设置,输入时用 aspell/hunspell/ispell 下划线标出错拼词。 |
| 08-17 20:20 | Claude Code v2.1.234 released | 新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量,可为每项目 transcript 目录选短名。 |
| 08-14 22:20 (08-14) | Claude Code v2.1.233 released | --worktree 和 claude agents 视图新增 GitLab MR URL 支持(显示为 !N)。 |
| 08-13 23:29 | Claude Code v2.1.232 released | Subagent forking 默认开启;交互式会话中非队友 agent 默认后台运行。 |
| 08-13 08:38 | Claude Code v2.1.231 released | 修复 Slack 等预注册 OAuth 客户端的 MCP OAuth 登录重定向 URI 不匹配问题。 |
Anthropic 官方 — 08-14 19:16 发布水印 FAQ:为遵守 EU AI Act 实施文本水印,不影响输出质量、不添加隐藏字符、不增加 token 费用、不可追溯个人或组织;08-14 18:00 发布第二期 Risk Report。
Boris Cherny (Anthropic) — 08-18 16:48 转发 Claude Cowork 上线移动端和 Web 端(所有付费计划,Max 计划先行 Beta);08-18 02:24 分享 Claude Code CLI p99 CPU 降 2 倍的 GC 优化;08-18 02:20 介绍新 /design 技能(研究预览),将 Claude Design 画板工作流带入 CLI 和 Desktop。
Alex Albert (Anthropic) — 08-14 19:16 转发水印 FAQ。
| 时间 | 标题 | 摘要 |
|---|---|---|
| 08-17 08:00 | Get closer to the game with Gemini and Pixel | Google 与足球俱乐部合作推广 Gemini 和 Pixel。 |
| 08-13 16:45 | Bring your spreadsheet data to life with Sheets canvas | Google Sheets 推出 Canvas 功能。 |
| 08-11 17:00 | AMIE demonstrates real-time clinical video consultation capabilities | 医疗 AI 系统 AMIE 首次展示实时临床视频问诊能力。 |
| 08-10 14:30 | Evolve your marketing with new AI tools | Google Ads 和 Analytics 推出新 AI 工具。 |
Google DeepMind — 08-18 14:12 宣布矩阵乘法指数 ω 新纪录(arXiv 论文)。
Gemini 团队 — 08-14 18:06 Gemini 3.7 Flash 向所有 Pro 和 Ultra 用户开放,改进多步推理和准确性;Gemini Spark 也已切换至 3.7 Flash。08-13 17:11 Demis Hassabis 宣布 3.7 Flash 定价为 3.6 Flash 的一半。
Logan Kilpatrick (Google) — 08-13 18:57 确认 3.7 Flash 上线;08-11 19:38 宣布 Gemini 月活用户达 10 亿、Gemma 模型下载量达 10 亿。
08-13 13:02 — DeepSeek Harness v0.1 开发者预览:MIT 许可开源,基于 Cordis 元框架,核心理念为"一切皆插件"(模型、工具、技能、会话、沙箱、文件系统、循环、编排、UI 均为插件)。GitHub: deepseek-ai/deepseek-harness。
Z.ai (GLM) — 08-14 05:17 Simon Willison 转发 GLM-5.3 发布:743B 基座模型后训练,主打编码和网络安全,据称在开源模型中设定了网络安全新标准。
Tibo Sottiaux (OpenAI) — 08-18 06:45 趣味推文赞 Codex;08-17 23:53 征求 Codex/API/模型"显而易见但尚未做"的功能建议;08-17 00:36 称 Codex 已接近 100% 可靠、将开源并支持 Astra。
Swyx — 08-18 19:36 开源 AI Engineer YouTube 缩略图 A/B 测试经验;08-18 17:30 转发生成媒体 Track 直播;08-18 14:49 转发 context engineering 一小时工作坊(可降低 90% token 成本)。
Hacker News — 08-18 17:02 Claude Code 五月–八月 2026 周限额促销(255 分);08-18 19:30 Norway should buy OpenAI(201 分);08-18 21:14 Claude Code 教 macOS 原生打印 HP Laser 1008a(105 分)。
[AA / Intelligence]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
[LMArena / Overall]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1506.6 |
| 2 | claude-opus-4-6-high | 1504.7 |
| 3 | claude-opus-4-7-high | 1502.2 |
本期无变动。
[AA / Agentic]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
本期无变动。
[AA / Coding]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
本期无变动。
[SWE-bench Pro / Public]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
本期无变动。
[SWE-bench Verified]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
本期变化:
[Terminal-Bench 2.0]
| 排名 | 模型 | 脚手架 | 分数 |
|---|---|---|---|
| 1 | GPT-5.5 | NexAU-AHE | 84.7 |
| 2 | Claude Opus 4.7 | WOZCODE | 80.2 |
| 3 | Gemini 3.1 Pro | TongAgents | 80.2 |
本期变化:
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 国家安全民主监督 + 网络安全模型开发节奏报告:同日同时发布民主监督倡议和 cyber-critical 能力时代的模型开发节奏报告,配合上周已推出的 GPT-5.6-Cyber(Daybreak Red)和 Astra 初步安全评估,OpenAI 正在将"安全叙事"从被动合规转向主动塑造政策框架——这是在美国国家安全 AI 监管尚未定型时抢占话语权的明确信号。
GPT-5.6 Sol 全平台降价 50%:OpenRouter 和 Vercel AI Gateway 同步半价,Flex 层最低 $1.25 输入 / $7.50 输出,叠加 Ultrafast 模式(Cerebras 驱动、750 tokens/s)预览——OpenAI 正在用价格 + 速度双降对冲 Gemini 3.7 Flash(定价为 3.6 Flash 一半)的竞争压力,价格战从高端模型延伸到 API 推理层。
Claude 4.5 Opus medium 登顶 SWE-bench Verified:Claude 4.5 Opus medium (20251101) 以 79.2 分与 Claude 4.5 Opus 并列第一但排名互换,说明在 SWE-bench Verified 榜单上 medium 配置的 scaffold(live-SWE-agent)已在统计上追平高配版本——这对实际工程选型意味着用更小的推理预算可获得同等修复能力。