【OpenAI】GPT-5.6 Sol API 降价超 20%,多平台同步促销 OpenAI 宣布 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%,持续 3 个月。Cloudflare、Devin Desktop、OpenCode 等平台同步推出 50%-70% 折扣。此举正值 GPT-5.6 Sol 在 LM Arena 排名上升至第 16 位,降价叠加排名上升,表明 OpenAI 正以价换量争夺开发者份额。 来源
【OpenAI】首批 NVIDIA Vera Rubin 机架上线,用于下一代前沿模型预训练 OpenAI 首批 NVIDIA Vera Rubin 机架已到货并运行训练栈,标志基础设施扩容进入新阶段。 来源
【Anthropic】Claude 平台四大功能 GA:Computer use、浏览器工具、Skills API、Files API Anthropic 宣布 Computer use、浏览器工具、Skills API 和 Files API 正式 GA,支持无 API 的应用自动化、减少任务往返次数,并可在版本化技能上构建 Claude Managed Agents。同日 Claude Security 扫描上线 Mythos 5 公测。 来源
【OpenAI】Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动 Replit 上线 Free Mode,用户无需担心 token 成本即可将想法转化为可运行软件,由 GPT-5.6 Luna 提供支持。 来源
【Google DeepMind】Gemini 3.7 Flash 创 Gemini 史上最快增长纪录,ARC-AGI-2 得分 84.6% Sundar Pichai 确认 Gemini 3.7 Flash 首周增长打破 Gemini 历史纪录,已接入 Search 和 Gemini 应用。ARC-AGI-2 验证得分 84.6%,单次仅 $0.25,在前沿模型中性价比突出。 来源
LM Arena Overall:GLM-5.3-Max 排名上升 2 位至第 13 名,分数从 1483.77 升至 1486.94(+0.21%)。 该模型超越 gemini-3-pro 和 Claude Opus 4.8 High,进入全球前 15。 来源
LM Arena Overall:DeepSeek-V4-Pro-High-20260813 排名从第 45 跌至第 50,下降 5 位,分数从 1462.15 降至 1459.42(-0.19%)。 来源
SWE-bench Verified:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 互换排名,前者升至第 1,后者降至第 2,两者分数均为 79.2。 同区间 GPT 5.2 Codex 排名从 19 升至 17,GPT-5 从 13 降至 14。 来源
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-22 | agentic adoption has been super fast | Greg Brockman 转发称代理式 AI 采用速度极快,有人已每周消耗超 10B tokens |
| 08-22 | towards giving our customers the lowest price | GPT-5.6 Sol API 与信用定价下调超 20%,为期三个月 |
| 08-21 | RT Adam Fry: ChatGPT feature drop - Aug 21 | ChatGPT 新增:iOS 快速附加最近照片、时间理解改进、长对话加载加速、网络断连提示优化 |
| 08-21 | RT OpenAI: GPT-5.6 Sol 降价超 20% | Sam Altman 转发 GPT-5.6 Sol 降价消息 |
| 08-20 | Introducing AI Futures | OpenAI 推出新博客"AI Futures",探讨变革性 AI 对权力、治理、经济和个人自由的影响 |
| 08-20 | Stampli cuts launch hours by 68% | Stampli 使用 Codex 和 ChatGPT Work 将数周上线工作压缩至数天 |
| 08-20 | huge milestone: NVIDIA Vera Rubin racks | 首批 NVIDIA Vera Rubin 机架到货并运行训练栈 |
| 08-20 | RT Exa plugin for Codex & ChatGPT | Exa 插件为 ChatGPT Work 和 Codex 提供超 1000 亿网站/论文/文档访问 |
| 08-20 | RT Eric Glyman: GPT-5.6 Sol 50% off on router | Router.com 上 GPT-5.6 Sol 五折至 9 月 18 日 |
| 08-20 | RT Cloudflare: GPT-5.6 Sol 50% off | Cloudflare AI Gateway 同步五折一个月 |
| 08-19 | Offering Zero Data Retention for frontier models | 重申符合条件的 API 客户零数据保留,预告 Private Safety Processing |
| 08-19 | Replit expands access with GPT-5.6 Luna | Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动 |
| 08-19 | RT Devin Desktop: GPT-5.6 Sol 70% off | Devin Desktop 和 CLI 中 Sol 七折至 10 月 3 日 |
| 08-19 | RT OpenCode: GPT-5.6 Sol 50% off | OpenCode Zen 上 Sol 五折至 9 月 18 日 |
| 08-19 | we support business privacy! | Sam Altman 推广零数据保留政策 |
其余 OpenAI 旧条目(08-18 及更早)见来源链接:ChatGPT Ads expands across Europe、Strengthening democratic oversight、Partnering with CodeAI、Pacing model development、ChatGPT for Teens、NVIDIA scales with ChatGPT Work、Asana cleared 5 years of work in 2 weeks、The Defender's Window、OpenAI joins PORTS-Pike、New policy ideas for the Intelligence Age、Builder's guide to GPT-5.6、Previewing Ultrafast mode、Dali Rajic as CRO、From assistance to execution、RingCentral builds AI-native work、Testing ads in ChatGPT、Daybreak on AWS、Letter to Governor Abbott、Model ML uses GPT-5.6 Sol、Building an AI-native finance function、Frontier cyber models、Expanding Daybreak、Premium seats in ChatGPT Business、Virgin Atlantic with ChatGPT Work、Zapier transformed marketing。
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-22 | Claude Code v2.1.240 | Bug 修复与可靠性提升 |
| 08-21 | Claude Code v2.1.239 | 成本估算(/cost、状态栏、--max-budget-usd)现包含数据驻留工作区的 1.1× 美国专用推理溢价 |
| 08-20 | Claude Code v2.1.238 | 新增 keybindingFlavor 设置,设为 "readline" 时 Ctrl+W 删除至前一个空格 |
| 08-20 | Claude Code v2.1.237 | 修复使用 LLM 网关或自定义 base URL 时 prompt caching 失效问题 |
| 08-20 | Anthropic plans data retention policy change | Mythos 级模型零数据保留今秋推出,客户自主控制数据,Anthropic 不保留 |
| 08-20 | Computer use / browser tool / Skills API / Files API GA | 四项 Claude Platform 功能正式发布 |
| 08-21 | Claude Security scans on Mythos 5 | Claude Security 扫描现运行于 Claude Mythos 5,面向所有 Claude Enterprise 客户公开测试 |
| 08-14 | Claude text watermark FAQ | 为遵守 EU AI Act 实施文本水印,不影响输出质量,不增加 token 成本 |
| 08-14 | Second Risk Report | 发布第二份 Responsible Scaling Policy 风险报告 |
| 08-10 | Riemann hypothesis research | 未发布研究版 Claude 将 zeta 函数零点满足假设的比例下界从 41.6% 提升至 67.2% |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-22 | Gemini 3.7 fastest growing model | Logan Kerr 称 Gemini 3.7 是 Gemini 史上增长最快的模型发布 |
| 08-22 | RT Sundar Pichai: Gemini 3.7 Flash 破增长纪录 | Pichai 确认 3.7 Flash 首周增长破纪录,已进入 Search 和 Gemini app;ARC-AGI-2 得分 84.6%($0.25/task) |
| 08-21 | Games as AI testbed / FenrisCreations partnership | 探索持续学习、深度记忆、长期规划、多代理动态等开放挑战 |
| 08-20 | RT ARC Prize: Gemini 3.7 Flash scores | ARC-AGI-2: 84.6%, $0.25/task;ARC-AGI-1: 95.5%, $0.12/task |
| 08-18 | New record for matrix multiplication omega | 创矩阵乘法指数 ω 新纪录 |
| 08-19 | 5 new ways to level up learning with Search | 搜索新增学习工具 |
| 08-14 | Gemini 3.7 Flash available in Gemini chat | Pro/Ultra 用户可用,Gemini Spark 也切换至 3.7 Flash |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-13 | DeepSeek Harness v0.1 Developer Preview | MIT 许可开源,基于 Cordis 元框架,一切皆为插件(模型、工具、技能、会话等) |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-22 | Why your local LLM feels dumber than it is | HN 161 分,讨论本地 LLM 性能被低估的原因 |
| 08-22 | Munder Difflin – Agent harness | HN 244 分,运行"克隆办公室"的代理框架 |
| 08-21 | A week of using Codex more than Claude | HN 117 分,Codex 与 Claude Code 一周使用对比 |
| 08-20 | Autolith: A programming agent with a live runtime | HN 109 分,带实时运行时的编程代理 |
[aa / intelligence]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
[lmarena / overall]
有变动。Top 5 不变,但排名 13–18 区间出现显著变化:
| 模型 | 变化 | 前排名 → 现排名 | 前分数 → 现分数 |
|---|---|---|---|
| glm-5.3-max | ↑2 | 15 → 13 | 1483.77 → 1486.94 |
| gpt-5.6-sol-xhigh | ↑2 | 18 → 16 | 1481.68 → 1482.26 |
| gpt-5.5-high | ↑2 | 19 → 17 | 1481.52 → 1481.89 |
| qwen3.8-max | ↓2 | 17 → 19 | 1481.85 → 1481.01 |
| gemini-3.1-pro-preview | ↓1 | 13 → 14 | 1486.18 → 1486.27 |
| gemini-3-pro | ↓1 | 14 → 15 | 1485.41 → 1485.46 |
| deepseek-v4-pro-high-20260813 | ↓5 | 45 → 50 | 1462.15 → 1459.42 |
| gemini-3.5-flash-medium | ↓1 | 25 → 26 | 1475.11 → 1474.04 |
| qwen3.8-27b | 🆕 | — → 81 | — → 1439.67 |
当前 Top 3(未变):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.77 |
| 2 | claude-opus-4-6-high | 1504.49 |
| 3 | claude-opus-4-7-high | 1502.01 |
[aa / agentic]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
[aa / coding]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
[swebench_pro_public / Public]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
[swebench_verified / Verified]
有变动。Top 1/2 互换,分数不变:
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude 4.5 Opus medium (20251101) | ↑1 | 2 → 1 | 79.2 |
| Claude 4.5 Opus | ↓1 | 1 → 2 | 79.2 |
| GPT 5.2 Codex | ↑2 | 19 → 17 | 72.8 |
| GPT 5.2 (high) | ↓1 | 18 → 19 | 72.8 |
| GLM 5 (high) | ↓1 | 17 → 18 | 72.8 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
[terminal_bench_2 / [email protected]]
有变动。第二、三名互换,分数不变:
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude Opus 4.7 | ↑1 | 3 → 2 | 80.2 |
| Gemini 3.1 Pro | ↓1 | 2 → 3 | 80.2 |
| Grok 4 | ↑1 | 39 → 38 | 27.2 |
| Qwen 3 Coder 480B | ↓1 | 38 → 39 | 27.2 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-5.6 Sol 降价超 20% 且多平台同步打折:OpenAI 官方降价 20%+ 的同时,Router.com 五折、Cloudflare 五折、Devin 七折、OpenCode 五折——这不是单一平台促销而是跨渠道联动,说明 OpenAI 正在以 Sol 为锚点争夺开发者 API 份额,且时间窗口高度集中在 9 月中下旬。结合 Greg Brockman 同日所说的"最低价格、最高能力上限",价格战意图明确。
Anthropic 今秋将为 Mythos 级模型推出零数据保留:Boris Cherny 明确指出"Mythos-class models require additional safety measures and enterprises need to meet their own privacy and compliance rules",且 Bloomberg 已独立报道。这直接对标 OpenAI 8 月 19 日重申的 Zero Data Retention 政策——两家头部厂商在同一周内围绕企业隐私打擂台,企业数据主权已成为前沿模型商用的硬门槛。
glm-5.3-max 在 LMArena 排名从 15 升至 13,分数上涨 3.17 分:这是本期 LMArena Top 20 中唯一的实质性分数跃升(多数模型分数波动在 ±0.5 以内),与 Simon Willison 8 月 14 日转发的 GLM-5.3 发布消息时间吻合,说明 GLM-5.3 上线后正在快速获取竞技场投票并爬升排名。