← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-23

2026-08-23 08:42 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 Sol API 降价超 20%,多平台同步促销 OpenAI 宣布 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%,持续 3 个月。Cloudflare、Devin Desktop、OpenCode 等平台同步推出 50%-70% 折扣。此举正值 GPT-5.6 Sol 在 LM Arena 排名上升至第 16 位,降价叠加排名上升,表明 OpenAI 正以价换量争夺开发者份额。 来源

【OpenAI】首批 NVIDIA Vera Rubin 机架上线,用于下一代前沿模型预训练 OpenAI 首批 NVIDIA Vera Rubin 机架已到货并运行训练栈,标志基础设施扩容进入新阶段。 来源

【Anthropic】Claude 平台四大功能 GA:Computer use、浏览器工具、Skills API、Files API Anthropic 宣布 Computer use、浏览器工具、Skills API 和 Files API 正式 GA,支持无 API 的应用自动化、减少任务往返次数,并可在版本化技能上构建 Claude Managed Agents。同日 Claude Security 扫描上线 Mythos 5 公测。 来源

【OpenAI】Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动 Replit 上线 Free Mode,用户无需担心 token 成本即可将想法转化为可运行软件,由 GPT-5.6 Luna 提供支持。 来源

【Google DeepMind】Gemini 3.7 Flash 创 Gemini 史上最快增长纪录,ARC-AGI-2 得分 84.6% Sundar Pichai 确认 Gemini 3.7 Flash 首周增长打破 Gemini 历史纪录,已接入 Search 和 Gemini 应用。ARC-AGI-2 验证得分 84.6%,单次仅 $0.25,在前沿模型中性价比突出。 来源


重大 Benchmark 变化

LM Arena Overall:GLM-5.3-Max 排名上升 2 位至第 13 名,分数从 1483.77 升至 1486.94(+0.21%)。 该模型超越 gemini-3-pro 和 Claude Opus 4.8 High,进入全球前 15。 来源

LM Arena Overall:DeepSeek-V4-Pro-High-20260813 排名从第 45 跌至第 50,下降 5 位,分数从 1462.15 降至 1459.42(-0.19%)。 来源

SWE-bench Verified:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 互换排名,前者升至第 1,后者降至第 2,两者分数均为 79.2。 同区间 GPT 5.2 Codex 排名从 19 升至 17,GPT-5 从 13 降至 14。 来源

快速预览

  • OpenAI 下调 GPT-5.6 Sol API 与信用定价超 20%,为期三个月;多家平台同步跟进打折
  • Anthropic 计划今秋为 Mythos 级模型推出零数据保留政策,Bloomberg 已报道
  • Claude Code 连发三个版本(v2.1.238–v2.1.240),新增 readline 快捷键与数据驻留成本估算
  • Gemini 3.7 Flash 被 Sundar Pichai 称为 Gemini 史上增长最快模型,ARC-AGI-2 得分 84.6%
  • Terminal-Bench 2.0:Claude Opus 4.7 与 Gemini 3.1 Pro 互换第二、第三名

详细正文

OpenAI

日期 标题 摘要
08-22 agentic adoption has been super fast Greg Brockman 转发称代理式 AI 采用速度极快,有人已每周消耗超 10B tokens
08-22 towards giving our customers the lowest price GPT-5.6 Sol API 与信用定价下调超 20%,为期三个月
08-21 RT Adam Fry: ChatGPT feature drop - Aug 21 ChatGPT 新增:iOS 快速附加最近照片、时间理解改进、长对话加载加速、网络断连提示优化
08-21 RT OpenAI: GPT-5.6 Sol 降价超 20% Sam Altman 转发 GPT-5.6 Sol 降价消息
08-20 Introducing AI Futures OpenAI 推出新博客"AI Futures",探讨变革性 AI 对权力、治理、经济和个人自由的影响
08-20 Stampli cuts launch hours by 68% Stampli 使用 Codex 和 ChatGPT Work 将数周上线工作压缩至数天
08-20 huge milestone: NVIDIA Vera Rubin racks 首批 NVIDIA Vera Rubin 机架到货并运行训练栈
08-20 RT Exa plugin for Codex & ChatGPT Exa 插件为 ChatGPT Work 和 Codex 提供超 1000 亿网站/论文/文档访问
08-20 RT Eric Glyman: GPT-5.6 Sol 50% off on router Router.com 上 GPT-5.6 Sol 五折至 9 月 18 日
08-20 RT Cloudflare: GPT-5.6 Sol 50% off Cloudflare AI Gateway 同步五折一个月
08-19 Offering Zero Data Retention for frontier models 重申符合条件的 API 客户零数据保留,预告 Private Safety Processing
08-19 Replit expands access with GPT-5.6 Luna Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动
08-19 RT Devin Desktop: GPT-5.6 Sol 70% off Devin Desktop 和 CLI 中 Sol 七折至 10 月 3 日
08-19 RT OpenCode: GPT-5.6 Sol 50% off OpenCode Zen 上 Sol 五折至 9 月 18 日
08-19 we support business privacy! Sam Altman 推广零数据保留政策

其余 OpenAI 旧条目(08-18 及更早)见来源链接:ChatGPT Ads expands across EuropeStrengthening democratic oversightPartnering with CodeAIPacing model developmentChatGPT for TeensNVIDIA scales with ChatGPT WorkAsana cleared 5 years of work in 2 weeksThe Defender's WindowOpenAI joins PORTS-PikeNew policy ideas for the Intelligence AgeBuilder's guide to GPT-5.6Previewing Ultrafast modeDali Rajic as CROFrom assistance to executionRingCentral builds AI-native workTesting ads in ChatGPTDaybreak on AWSLetter to Governor AbbottModel ML uses GPT-5.6 SolBuilding an AI-native finance functionFrontier cyber modelsExpanding DaybreakPremium seats in ChatGPT BusinessVirgin Atlantic with ChatGPT WorkZapier transformed marketing

Anthropic / Claude Code

日期 标题 摘要
08-22 Claude Code v2.1.240 Bug 修复与可靠性提升
08-21 Claude Code v2.1.239 成本估算(/cost、状态栏、--max-budget-usd)现包含数据驻留工作区的 1.1× 美国专用推理溢价
08-20 Claude Code v2.1.238 新增 keybindingFlavor 设置,设为 "readline" 时 Ctrl+W 删除至前一个空格
08-20 Claude Code v2.1.237 修复使用 LLM 网关或自定义 base URL 时 prompt caching 失效问题
08-20 Anthropic plans data retention policy change Mythos 级模型零数据保留今秋推出,客户自主控制数据,Anthropic 不保留
08-20 Computer use / browser tool / Skills API / Files API GA 四项 Claude Platform 功能正式发布
08-21 Claude Security scans on Mythos 5 Claude Security 扫描现运行于 Claude Mythos 5,面向所有 Claude Enterprise 客户公开测试
08-14 Claude text watermark FAQ 为遵守 EU AI Act 实施文本水印,不影响输出质量,不增加 token 成本
08-14 Second Risk Report 发布第二份 Responsible Scaling Policy 风险报告
08-10 Riemann hypothesis research 未发布研究版 Claude 将 zeta 函数零点满足假设的比例下界从 41.6% 提升至 67.2%

Google / DeepMind

日期 标题 摘要
08-22 Gemini 3.7 fastest growing model Logan Kerr 称 Gemini 3.7 是 Gemini 史上增长最快的模型发布
08-22 RT Sundar Pichai: Gemini 3.7 Flash 破增长纪录 Pichai 确认 3.7 Flash 首周增长破纪录,已进入 Search 和 Gemini app;ARC-AGI-2 得分 84.6%($0.25/task)
08-21 Games as AI testbed / FenrisCreations partnership 探索持续学习、深度记忆、长期规划、多代理动态等开放挑战
08-20 RT ARC Prize: Gemini 3.7 Flash scores ARC-AGI-2: 84.6%, $0.25/task;ARC-AGI-1: 95.5%, $0.12/task
08-18 New record for matrix multiplication omega 创矩阵乘法指数 ω 新纪录
08-19 5 new ways to level up learning with Search 搜索新增学习工具
08-14 Gemini 3.7 Flash available in Gemini chat Pro/Ultra 用户可用,Gemini Spark 也切换至 3.7 Flash

DeepSeek

日期 标题 摘要
08-13 DeepSeek Harness v0.1 Developer Preview MIT 许可开源,基于 Cordis 元框架,一切皆为插件(模型、工具、技能、会话等)

社区 & HN 热帖

日期 标题 摘要
08-22 Why your local LLM feels dumber than it is HN 161 分,讨论本地 LLM 性能被低估的原因
08-22 Munder Difflin – Agent harness HN 244 分,运行"克隆办公室"的代理框架
08-21 A week of using Codex more than Claude HN 117 分,Codex 与 Claude Code 一周使用对比
08-20 Autolith: A programming agent with a live runtime HN 109 分,带实时运行时的编程代理

其他动态

  • Tibo(OpenAI):Codex 部分用户本周缓存命中率下降,正在调查;banked reset 已上线,面向 ChatGPT Work 和 Codex 所有付费用户。
  • Simon Willison 转发 GLM-5.3 发布:743B 基座后训练,主打编码与网络安全。
  • swyx 讨论 RSI 与模拟人类:Simile 的数字双生技术获 Fortune 100 客户验证。

行业格局

[aa / intelligence]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

[lmarena / overall]

有变动。Top 5 不变,但排名 13–18 区间出现显著变化:

模型 变化 前排名 → 现排名 前分数 → 现分数
glm-5.3-max ↑2 15 → 13 1483.77 → 1486.94
gpt-5.6-sol-xhigh ↑2 18 → 16 1481.68 → 1482.26
gpt-5.5-high ↑2 19 → 17 1481.52 → 1481.89
qwen3.8-max ↓2 17 → 19 1481.85 → 1481.01
gemini-3.1-pro-preview ↓1 13 → 14 1486.18 → 1486.27
gemini-3-pro ↓1 14 → 15 1485.41 → 1485.46
deepseek-v4-pro-high-20260813 ↓5 45 → 50 1462.15 → 1459.42
gemini-3.5-flash-medium ↓1 25 → 26 1475.11 → 1474.04
qwen3.8-27b 🆕 — → 81 — → 1439.67

当前 Top 3(未变):

排名 模型 分数
1 claude-fable-5 1507.77
2 claude-opus-4-6-high 1504.49
3 claude-opus-4-7-high 1502.01

干活选型

[aa / agentic]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

[aa / coding]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

[swebench_pro_public / Public]

本期无变动。当前 Top 3:

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

[swebench_verified / Verified]

有变动。Top 1/2 互换,分数不变:

模型 变化 前排名 → 现排名 分数
Claude 4.5 Opus medium (20251101) ↑1 2 → 1 79.2
Claude 4.5 Opus ↓1 1 → 2 79.2
GPT 5.2 Codex ↑2 19 → 17 72.8
GPT 5.2 (high) ↓1 18 → 19 72.8
GLM 5 (high) ↓1 17 → 18 72.8

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

[terminal_bench_2 / [email protected]]

有变动。第二、三名互换,分数不变:

模型 变化 前排名 → 现排名 分数
Claude Opus 4.7 ↑1 3 → 2 80.2
Gemini 3.1 Pro ↓1 2 → 3 80.2
Grok 4 ↑1 39 → 38 27.2
Qwen 3 Coder 480B ↓1 38 → 39 27.2

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. GPT-5.6 Sol 降价超 20% 且多平台同步打折:OpenAI 官方降价 20%+ 的同时,Router.com 五折、Cloudflare 五折、Devin 七折、OpenCode 五折——这不是单一平台促销而是跨渠道联动,说明 OpenAI 正在以 Sol 为锚点争夺开发者 API 份额,且时间窗口高度集中在 9 月中下旬。结合 Greg Brockman 同日所说的"最低价格、最高能力上限",价格战意图明确。

  2. Anthropic 今秋将为 Mythos 级模型推出零数据保留:Boris Cherny 明确指出"Mythos-class models require additional safety measures and enterprises need to meet their own privacy and compliance rules",且 Bloomberg 已独立报道。这直接对标 OpenAI 8 月 19 日重申的 Zero Data Retention 政策——两家头部厂商在同一周内围绕企业隐私打擂台,企业数据主权已成为前沿模型商用的硬门槛。

  3. glm-5.3-max 在 LMArena 排名从 15 升至 13,分数上涨 3.17 分:这是本期 LMArena Top 20 中唯一的实质性分数跃升(多数模型分数波动在 ±0.5 以内),与 Simon Willison 8 月 14 日转发的 GLM-5.3 发布消息时间吻合,说明 GLM-5.3 上线后正在快速获取竞技场投票并爬升排名。

来源 · 86 条