← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-21

2026-08-21 08:59 CST
快速版 完整版

核心速览

【OpenAI】OpenAI 首批 NVIDIA Vera Rubin 机架上线运行

OpenAI 基础设施团队确认首批 NVIDIA Vera Rubin 机架已到货并运行训练栈,用于下一代前沿模型预训练。这是 OpenAI 与 NVIDIA 合作的重要里程碑,标志着算力扩容进入新阶段。此前 GPT-5.6 系列已发布多个变体(Luna/Sol/Terra),Vera Rubin 的投运将直接支撑后续模型迭代。

首批 NVIDIA Vera Rubin 机架上线


【OpenAI】Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动

Replit 基于 GPT-5.6 Luna 推出 Free Mode,用户无需关心 token 成本即可将想法转化为可运行软件。这意味着 GPT-5.6 Luna 已进入第三方产品落地阶段,OpenAI 通过 Replit 将模型能力直接面向终端开发者开放。

Replit Free Mode


【Google】Gemini 3.7 Flash 登顶 ARC-AGI 及 AA-AnalystAgent 排行榜

Gemini 3.7 Flash 在 ARC-AGI-2 取得 84.6%($0.25/task)、ARC-AGI-1 取得 95.5%($0.12/task),同时在 Artificial Analysis 的 AA-AnalystAgent 排行榜排名第一,完成 80 项真实数据分析任务时速度比竞品快 60%-90%。该模型已上线 Gemini 应用。

Gemini 3.7 Flash ARC-AGI 成绩


【Anthropic】Anthropic 将于今年秋季推出零数据保留方案

Anthropic 确认正在开发零数据保留(Zero Data Retention)方案,客户可完全拥有和控制自己的数据,Anthropic 不保留任何数据。该功能面向 Mythos 级模型,预计今年秋季推出,与 OpenAI 同期推出的 Zero Data Retention + Private Safety Processing 形成直接竞争。

Anthropic 数据保留政策变更


【DeepSeek】DeepSeek Harness v0.1 开发者预览版发布

DeepSeek 发布 Harness v0.1,基于 Cordis 元框架构建的 agent harness,核心设计理念为"一切皆插件"——模型、工具、技能、会话、沙箱、文件系统等均以插件形式实现,可自由组合替换。代码以 MIT 协议开源。

DeepSeek Harness v0.1


重大 Benchmark 变化

LMArena Overall:

  • qwen3.8-max 大幅下滑:排名从 #9 跌至 #17,分数从 1490.66 降至 1481.85(降幅约 0.6%)。这是本周期排名跌幅最大的模型,跌出前十阵营。
  • gpt-5.5 排名下降 4 位:从 #20 跌至 #24,分数从 1476.59 降至 1476.16。
  • claude-opus-5-max 排名下降 4 位:从 #8 跌至 #12,分数从 1491.09 降至 1486.80(降幅约 0.3%)。
  • gemini-3.6-flash-high 排名下降 5 位:从 #15 跌至 #20,分数从 1484.49 降至 1480.88(降幅约 0.2%)。
  • 新模型上榜:gemini-3.7-flash-high 以 1490.20 分直接进入第 9 名;glm-5.3-max 以 1483.77 分进入第 15 名;deepseek-v4-pro-high-20260813 以 1462.15 分进入第 45 名。
  • muse-spark-1.1 上升 2 位:从 #10 升至 #8,分数从 1489.00 升至 1491.09,进入前三区间附近。

SWE-bench Verified:

  • Claude 4.5 Opus medium (20251101) 升至第 1,Claude 4.5 Opus 降至第 2,两者分数均为 79.2%,为同分换位。
  • GPT 5.2 Codex 上升 2 位:从 #19 升至 #17,分数 72.8%。

Terminal Bench 2.0:

  • Claude Opus 4.7 与 Gemini 3.1 Pro 交换位置:Claude Opus 4.7 从 #3 升至 #2,Gemini 3.1 Pro 从 #2 降至 #3,两者分数均为 80.2%。

快速预览

  • OpenAI 发布 AI Futures 博客,探讨变革性 AI 对权力、治理和经济的影响
  • Gemini 3.7 Flash 高分新入 LMArena 总榜第 9 名,AA-AnalystAgent 排名第一
  • OpenAI 首批 NVIDIA Vera Rubin 机柜到位,开始运行训练栈
  • Anthropic 计划今秋为 Mythos 级模型推出零数据保留方案
  • Qwen3.8-max 在 LMArena 总榜从第 9 跌至第 17,分数下降约 9 分

新闻

OpenAI

日期 新闻 要点
08-20 Introducing AI Futures 新博客,探讨变革性 AI 如何重塑权力、治理、经济与个人自由
08-20 Stampli cuts launch hours by 68% using ChatGPT Work Stampli 用 Codex 和 ChatGPT Work 将数周发布压缩至数天
08-19 Offering Zero Data Retention for frontier models 重申 ZDR 适用合格 API 客户,预览 Private Safety Processing
08-19 Replit expands access to software creation with GPT-5.6 Luna Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,无需担心 token 成本
08-18 ChatGPT Ads expands across Europe ChatGPT 广告扩展至 31 个欧洲市场
08-18 Strengthening democratic oversight in national security 启动项目加强国家安全领域 AI 的民主监督
08-18 Partnering with CodeAI 合作帮助学生建立 AI 素养与批判性思维
08-18 Pacing model development in an era of cyber-critical capabilities 加强前沿模型监控、对齐和安全保障
08-18 ChatGPT for Teens 面向青少年的 ChatGPT,内置保护和家长控制
08-18 How NVIDIA scales expertise with ChatGPT Work NVIDIA 团队用 ChatGPT Work 减少手动任务并扩展工作流
08-18 Asana cleared 5 years of engineering work in 2 weeks with Codex Asana 用 Codex 两周完成预计五年的测试迁移,花费约 $12K
08-17 The Defender's Window AI 正在重塑攻防双方的网络安全格局
08-17 OpenAI joins PORTS-Pike project 加入 PORTS-Pike 项目,支持南俄亥俄数千就业
08-17 New policy ideas for the Intelligence Age 资助 14 个独立 AI 政策研究项目
08-13 The builder's guide to GPT-5.6 创业公司用 GPT-5.6 构建更高效的 AI Agent
08-13 Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed Cerebras 驱动,最高 750 tokens/s
08-13 OpenAI appoints Dali Rajic as CRO 任命 Dali Rajic 为首席收入官

开发者动态(X / @OpenAIDevs):

日期 动态 要点
08-20 Exa plugin for Codex & ChatGPT 接入 100B+ 网站、论文、文档搜索
08-19 Asana Codex 案例 两周完成原计划五年的 Enzyme→RTL 测试迁移
08-18 NVIDIA TensorRT Model Connect 公开预览,用 Codex agents 构建全部代码,已开源
08-17 GPT-5.6 Sol 半价 on OpenRouter flex 层低至 $1.25 输入 / $7.50 输出
08-17 GPT-5.6 Sol 半价 on Vercel AI Gateway 至 9 月 18 日,标准与 fast 模式均半价

Greg Brockman(@gdb)与 Sam Altman(@sama)动态:

日期 动态 要点
08-20 NVIDIA Vera Rubin 机柜到位 首批 Vera Rubin 机柜到场并运行训练栈
08-20 Codex 浏览器用例 用 Codex browser 关账、清理收件箱、设置 Stripe 规则等
08-20 Asana 代码迁移案例 "从数年到数周"
08-19 Private Safety Processing 预览 ZDR 部署下内容留在客户基础设施,仅返回有限安全信号
08-19 Replit Free Mode GPT-5.6 Luna 驱动,免费软件创建
08-19 支持企业隐私 Sam Altman 转发 ZDR 博客

Tibo(@thsottiaux)动态:

日期 动态 要点
08-20 ChatGPT Sites 协作 支持多人协作编辑 ChatGPT Sites
08-20 Apple Messages 插件 ChatGPT 可搜索/回复 iMessage,适用 Mac 桌面端

Anthropic / Claude

日期 新闻 要点
08-20 Anthropic 计划修改数据保留政策(Bloomberg) Mythos 级模型需额外安全措施,客户可拥有并控制数据,Anthropic 不保留,今秋推出
08-20 Claude Code Concise 输出模式 /config → Output style 或 settings.json 设置 "outputStyle": "Concise"
08-19 Claude Code auto mode 可用自然语言配置 分类器模型审查每个操作,支持 $defaults 保留内置规则
08-14 Claude 文本水印 FAQ 为合规 EU AI Act 实施水印,不影响输出质量,不增加 token 成本,不可追溯个人
08-14 第二份 Risk Report 发布 按 Responsible Scaling Policy 定期发布风险报告
08-10 Claude 研究版攻黎曼假设 未解决但将 zeta 函数零点满足假设的下界从 41.6% 提升至 67.2%

Claude Code 版本发布:

版本 日期 要点
v2.1.238 08-20 新增 keybindingFlavor 设置,"readline" 模式下 Ctrl+W 删除至前一个空格
v2.1.237 08-20 修复使用 LLM 网关/自定义 base URL 时的 prompt caching
v2.1.236 08-19 新增 ANTHROPIC_DEFAULT_MODEL 环境变量设置新会话默认模型
v2.1.235 08-18 新增可选 spellcheck 设置,调用 aspell/hunspell/ispell
v2.1.234 08-17 新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量

Google

日期 新闻 要点
08-19 5 new ways to level up your learning with Search 搜索新增学习工具
08-17 Get closer to the game with Gemini and Pixel Gemini 与 Pixel 足球俱乐部合作
08-13 Sheets canvas Google Sheets 新增画布功能
08-11 AMIE 实时临床视频问诊 研究医学 AI 系统首次展示实时视频问诊能力
08-10 Evolve your marketing with new AI tools Google Ads 与 Analytics 新增 AI 工具

DeepMind / Gemini 动态:

日期 动态 要点
08-20 Gemini 3.7 Flash ARC-AGI 成绩 ARC-AGI-2: 84.6% ($0.25/task),ARC-AGI-1: 95.5% ($0.12/task)
08-19 Gemini 3.7 Flash AA-AnalystAgent 第一 80 项真实任务 14 个领域,速度比次快模型快 2.4 倍
08-18 矩阵乘法 ω 新纪录 DeepMind 宣布矩阵乘法指数 ω 新纪录
08-14 Gemini 3.7 Flash 上线 Gemini chat 面向 Pro 和 Ultra 用户,改进多步推理

DeepSeek

日期 新闻 要点
08-13 DeepSeek Harness v0.1 Developer Preview MIT 开源,基于 Cordis meta-framework,一切皆插件(模型/工具/技能/会话/沙箱等)

社区与开源

日期 来源 要点
08-20 Show HN: 钢琴自动补全 125M 模型 本地设备端运行,HN 490 分
08-20 Show HN: Huzzah – AI 编程新方法 HN 206 分
08-20 Vomit: 清理 Claude 5 token 输出 用独立 LLM 清理输出,HN 182 分
08-20 Anti-AI 字体无用且有害 HN 109 分
08-14 GLM-5.3 发布 743B 基座后训练,主打编码与网络安全,开源模型新标杆

Benchmark 快照

行业格局

AA Intelligence(综合智能)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

LMArena Overall

排名 模型 分数
1 claude-fable-5 1507.33
2 claude-opus-4-6-high 1504.58
3 claude-opus-4-7-high 1502.08

LMArena 变化(本期有变动,摘录重要项):

模型 变化类型 前排名 → 现排名 前分数 → 现分数
gemini-3.7-flash-high 新入榜 — → 9 — → 1490.20
glm-5.3-max 新入榜 — → 15 — → 1483.77
deepseek-v4-pro-high-20260813 新入榜 — → 45 — → 1462.15
qwen3.8-max 排名+分数下降 9 → 17 1490.66 → 1481.85
claude-opus-5-max 排名+分数下降 8 → 12 1491.09 → 1486.80
gemini-3.6-flash-high 排名+分数下降 15 → 20 1484.49 → 1480.88
gpt-5.5 排名下降 20 → 24 1476.59 → 1476.16
muse-spark-1.1 排名+分数上升 10 → 8 1489.00 → 1491.09
kimi-k3-max 排名+分数上升 11 → 10 1488.57 → 1489.66
grok-4.5 排名+分数上升 35 → 36 1468.40 → 1469.71

干活选型

AA Agentic(Agent 能力)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

AA Coding

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

SWE-bench Pro (Public)

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

SWE-bench Verified 变化:

模型 变化 前排名 → 现排名
Claude 4.5 Opus medium (20251101) 排名上升 2 → 1
Claude 4.5 Opus 排名下降 1 → 2
GPT 5.2 Codex 排名上升 19 → 17
GPT 5.2 (high) 排名下降 18 → 19

Terminal-Bench 2.0

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

Terminal-Bench 2.0 变化:

模型 变化 前排名 → 现排名
Claude Opus 4.7 排名上升 3 → 2
Gemini 3.1 Pro 排名下降 2 → 3

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Gemini 3.7 Flash 新入 LMArena 总榜第 9 名(1490.20 分),同时占据 AA-AnalystAgent 第一。 该模型在 ARC-AGI-2 拿到 84.6% 且单任务成本仅 $0.25,在 80 项真实数据分析任务中比次快模型快 2.4 倍——这是少有的同时在质量榜和性价比上同时冲击前排的 Flash 级模型,说明 Google 的蒸馏路线正在产生结构性回报。

  2. OpenAI 首批 NVIDIA Vera Rubin 机柜到场并运行训练栈。 这是下一代前沿模型预训练算力上线的第一步,结合 8 月 13 日 GPT-5.6 Sol Ultrafast 预览(Cerebras 驱动,750 tokens/s)和 GPT-5.6 半价促销,OpenAI 正在推理侧和训练侧同时推进,但 Vera Rubin 刚到位意味着下一轮前沿模型发布仍有较长窗口期。

  3. Anthropic 计划今秋为 Mythos 级模型推出零数据保留,与 OpenAI 8 月 19 日预览的 Private Safety Processing 形成直接对位。 OpenAI 的方案在 ZDR 部署下内容留在客户基础设施、仅返回有限安全信号;Anthropic 的方案同样承诺客户拥有并控制数据、Anthropic 不保留。两家同期推进企业隐私能力,说明零数据保留正在从合规选项变为前沿模型供应商争夺大客户的标配门槛。

来源 · 86 条