【OpenAI】OpenAI 首批 NVIDIA Vera Rubin 机架上线运行
OpenAI 基础设施团队确认首批 NVIDIA Vera Rubin 机架已到货并运行训练栈,用于下一代前沿模型预训练。这是 OpenAI 与 NVIDIA 合作的重要里程碑,标志着算力扩容进入新阶段。此前 GPT-5.6 系列已发布多个变体(Luna/Sol/Terra),Vera Rubin 的投运将直接支撑后续模型迭代。
【OpenAI】Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动
Replit 基于 GPT-5.6 Luna 推出 Free Mode,用户无需关心 token 成本即可将想法转化为可运行软件。这意味着 GPT-5.6 Luna 已进入第三方产品落地阶段,OpenAI 通过 Replit 将模型能力直接面向终端开发者开放。
【Google】Gemini 3.7 Flash 登顶 ARC-AGI 及 AA-AnalystAgent 排行榜
Gemini 3.7 Flash 在 ARC-AGI-2 取得 84.6%($0.25/task)、ARC-AGI-1 取得 95.5%($0.12/task),同时在 Artificial Analysis 的 AA-AnalystAgent 排行榜排名第一,完成 80 项真实数据分析任务时速度比竞品快 60%-90%。该模型已上线 Gemini 应用。
【Anthropic】Anthropic 将于今年秋季推出零数据保留方案
Anthropic 确认正在开发零数据保留(Zero Data Retention)方案,客户可完全拥有和控制自己的数据,Anthropic 不保留任何数据。该功能面向 Mythos 级模型,预计今年秋季推出,与 OpenAI 同期推出的 Zero Data Retention + Private Safety Processing 形成直接竞争。
【DeepSeek】DeepSeek Harness v0.1 开发者预览版发布
DeepSeek 发布 Harness v0.1,基于 Cordis 元框架构建的 agent harness,核心设计理念为"一切皆插件"——模型、工具、技能、会话、沙箱、文件系统等均以插件形式实现,可自由组合替换。代码以 MIT 协议开源。
LMArena Overall:
SWE-bench Verified:
Terminal Bench 2.0:
开发者动态(X / @OpenAIDevs):
| 日期 | 动态 | 要点 |
|---|---|---|
| 08-20 | Exa plugin for Codex & ChatGPT | 接入 100B+ 网站、论文、文档搜索 |
| 08-19 | Asana Codex 案例 | 两周完成原计划五年的 Enzyme→RTL 测试迁移 |
| 08-18 | NVIDIA TensorRT Model Connect | 公开预览,用 Codex agents 构建全部代码,已开源 |
| 08-17 | GPT-5.6 Sol 半价 on OpenRouter | flex 层低至 $1.25 输入 / $7.50 输出 |
| 08-17 | GPT-5.6 Sol 半价 on Vercel AI Gateway | 至 9 月 18 日,标准与 fast 模式均半价 |
Greg Brockman(@gdb)与 Sam Altman(@sama)动态:
| 日期 | 动态 | 要点 |
|---|---|---|
| 08-20 | NVIDIA Vera Rubin 机柜到位 | 首批 Vera Rubin 机柜到场并运行训练栈 |
| 08-20 | Codex 浏览器用例 | 用 Codex browser 关账、清理收件箱、设置 Stripe 规则等 |
| 08-20 | Asana 代码迁移案例 | "从数年到数周" |
| 08-19 | Private Safety Processing 预览 | ZDR 部署下内容留在客户基础设施,仅返回有限安全信号 |
| 08-19 | Replit Free Mode | GPT-5.6 Luna 驱动,免费软件创建 |
| 08-19 | 支持企业隐私 | Sam Altman 转发 ZDR 博客 |
Tibo(@thsottiaux)动态:
| 日期 | 动态 | 要点 |
|---|---|---|
| 08-20 | ChatGPT Sites 协作 | 支持多人协作编辑 ChatGPT Sites |
| 08-20 | Apple Messages 插件 | ChatGPT 可搜索/回复 iMessage,适用 Mac 桌面端 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-20 | Anthropic 计划修改数据保留政策(Bloomberg) | Mythos 级模型需额外安全措施,客户可拥有并控制数据,Anthropic 不保留,今秋推出 |
| 08-20 | Claude Code Concise 输出模式 | /config → Output style 或 settings.json 设置 "outputStyle": "Concise" |
| 08-19 | Claude Code auto mode 可用自然语言配置 | 分类器模型审查每个操作,支持 $defaults 保留内置规则 |
| 08-14 | Claude 文本水印 FAQ | 为合规 EU AI Act 实施水印,不影响输出质量,不增加 token 成本,不可追溯个人 |
| 08-14 | 第二份 Risk Report 发布 | 按 Responsible Scaling Policy 定期发布风险报告 |
| 08-10 | Claude 研究版攻黎曼假设 | 未解决但将 zeta 函数零点满足假设的下界从 41.6% 提升至 67.2% |
Claude Code 版本发布:
| 版本 | 日期 | 要点 |
|---|---|---|
| v2.1.238 | 08-20 | 新增 keybindingFlavor 设置,"readline" 模式下 Ctrl+W 删除至前一个空格 |
| v2.1.237 | 08-20 | 修复使用 LLM 网关/自定义 base URL 时的 prompt caching |
| v2.1.236 | 08-19 | 新增 ANTHROPIC_DEFAULT_MODEL 环境变量设置新会话默认模型 |
| v2.1.235 | 08-18 | 新增可选 spellcheck 设置,调用 aspell/hunspell/ispell |
| v2.1.234 | 08-17 | 新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-19 | 5 new ways to level up your learning with Search | 搜索新增学习工具 |
| 08-17 | Get closer to the game with Gemini and Pixel | Gemini 与 Pixel 足球俱乐部合作 |
| 08-13 | Sheets canvas | Google Sheets 新增画布功能 |
| 08-11 | AMIE 实时临床视频问诊 | 研究医学 AI 系统首次展示实时视频问诊能力 |
| 08-10 | Evolve your marketing with new AI tools | Google Ads 与 Analytics 新增 AI 工具 |
DeepMind / Gemini 动态:
| 日期 | 动态 | 要点 |
|---|---|---|
| 08-20 | Gemini 3.7 Flash ARC-AGI 成绩 | ARC-AGI-2: 84.6% ($0.25/task),ARC-AGI-1: 95.5% ($0.12/task) |
| 08-19 | Gemini 3.7 Flash AA-AnalystAgent 第一 | 80 项真实任务 14 个领域,速度比次快模型快 2.4 倍 |
| 08-18 | 矩阵乘法 ω 新纪录 | DeepMind 宣布矩阵乘法指数 ω 新纪录 |
| 08-14 | Gemini 3.7 Flash 上线 Gemini chat | 面向 Pro 和 Ultra 用户,改进多步推理 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-13 | DeepSeek Harness v0.1 Developer Preview | MIT 开源,基于 Cordis meta-framework,一切皆插件(模型/工具/技能/会话/沙箱等) |
| 日期 | 来源 | 要点 |
|---|---|---|
| 08-20 | Show HN: 钢琴自动补全 125M 模型 | 本地设备端运行,HN 490 分 |
| 08-20 | Show HN: Huzzah – AI 编程新方法 | HN 206 分 |
| 08-20 | Vomit: 清理 Claude 5 token 输出 | 用独立 LLM 清理输出,HN 182 分 |
| 08-20 | Anti-AI 字体无用且有害 | HN 109 分 |
| 08-14 | GLM-5.3 发布 | 743B 基座后训练,主打编码与网络安全,开源模型新标杆 |
AA Intelligence(综合智能)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
LMArena Overall
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.33 |
| 2 | claude-opus-4-6-high | 1504.58 |
| 3 | claude-opus-4-7-high | 1502.08 |
LMArena 变化(本期有变动,摘录重要项):
| 模型 | 变化类型 | 前排名 → 现排名 | 前分数 → 现分数 |
|---|---|---|---|
| gemini-3.7-flash-high | 新入榜 | — → 9 | — → 1490.20 |
| glm-5.3-max | 新入榜 | — → 15 | — → 1483.77 |
| deepseek-v4-pro-high-20260813 | 新入榜 | — → 45 | — → 1462.15 |
| qwen3.8-max | 排名+分数下降 | 9 → 17 | 1490.66 → 1481.85 |
| claude-opus-5-max | 排名+分数下降 | 8 → 12 | 1491.09 → 1486.80 |
| gemini-3.6-flash-high | 排名+分数下降 | 15 → 20 | 1484.49 → 1480.88 |
| gpt-5.5 | 排名下降 | 20 → 24 | 1476.59 → 1476.16 |
| muse-spark-1.1 | 排名+分数上升 | 10 → 8 | 1489.00 → 1491.09 |
| kimi-k3-max | 排名+分数上升 | 11 → 10 | 1488.57 → 1489.66 |
| grok-4.5 | 排名+分数上升 | 35 → 36 | 1468.40 → 1469.71 |
AA Agentic(Agent 能力)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
AA Coding
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
SWE-bench Pro (Public)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
SWE-bench Verified
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
SWE-bench Verified 变化:
| 模型 | 变化 | 前排名 → 现排名 |
|---|---|---|
| Claude 4.5 Opus medium (20251101) | 排名上升 | 2 → 1 |
| Claude 4.5 Opus | 排名下降 | 1 → 2 |
| GPT 5.2 Codex | 排名上升 | 19 → 17 |
| GPT 5.2 (high) | 排名下降 | 18 → 19 |
Terminal-Bench 2.0
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
Terminal-Bench 2.0 变化:
| 模型 | 变化 | 前排名 → 现排名 |
|---|---|---|
| Claude Opus 4.7 | 排名上升 | 3 → 2 |
| Gemini 3.1 Pro | 排名下降 | 2 → 3 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Gemini 3.7 Flash 新入 LMArena 总榜第 9 名(1490.20 分),同时占据 AA-AnalystAgent 第一。 该模型在 ARC-AGI-2 拿到 84.6% 且单任务成本仅 $0.25,在 80 项真实数据分析任务中比次快模型快 2.4 倍——这是少有的同时在质量榜和性价比上同时冲击前排的 Flash 级模型,说明 Google 的蒸馏路线正在产生结构性回报。
OpenAI 首批 NVIDIA Vera Rubin 机柜到场并运行训练栈。 这是下一代前沿模型预训练算力上线的第一步,结合 8 月 13 日 GPT-5.6 Sol Ultrafast 预览(Cerebras 驱动,750 tokens/s)和 GPT-5.6 半价促销,OpenAI 正在推理侧和训练侧同时推进,但 Vera Rubin 刚到位意味着下一轮前沿模型发布仍有较长窗口期。
Anthropic 计划今秋为 Mythos 级模型推出零数据保留,与 OpenAI 8 月 19 日预览的 Private Safety Processing 形成直接对位。 OpenAI 的方案在 ZDR 部署下内容留在客户基础设施、仅返回有限安全信号;Anthropic 的方案同样承诺客户拥有并控制数据、Anthropic 不保留。两家同期推进企业隐私能力,说明零数据保留正在从合规选项变为前沿模型供应商争夺大客户的标配门槛。