← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-24

2026-08-24 08:47 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 Sol 降价超 20%,多家平台同步打折 OpenAI 将 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%,为期 3 个月。Cloudflare、Router、Devin Desktop 等平台同步推出 50%-70% 折扣。Greg Brockman 称目标是为客户提供市场最低价和最高能力上限。 原文链接

【OpenAI】首台 NVIDIA Vera Rubin 机架上线,用于前沿模型预训练 OpenAI 基础设施团队确认首批 NVIDIA Vera Rubin 机架已到货并运行训练栈,标志着下一代前沿模型预训练算力扩容的实质性启动。 原文链接

【Google DeepMind】Gemini 3.7 Flash 创 Gemini 史上最快增长纪录,ARC-AGI-2 达 84.6% Gemini 3.7 Flash 首周增长打破此前所有 Gemini 模型记录,已接入 Search 和 Gemini App。在 ARC-AGI-2 验证测试中得分 84.6%($0.25/task),ARC-AGI-1 得分 95.5%($0.12/task),成本得分比在前沿模型中突出。Sundar Pichai 和 Demis Hassabis 均确认该增长数据。 原文链接

【Anthropic】Claude 平台多项 API 正式 GA,并计划今秋推出零数据留存 Computer use、browser tool、Skills API、Files API 现已正式发布。Boris Cherny 透露 Anthropic 今秋将推出零数据留存政策,客户完全拥有并控制数据,Anthropic 不保留任何数据——这是 Mythos 级模型上线所需的额外安全措施。 原文链接

【OpenAI】ChatGPT 广告扩展至 31 个欧洲市场 ChatGPT Ads 正式进入 31 个欧洲市场,广告主可在用户探索、比较和决策过程中投放广告。OpenAI 强调广告有清晰标注,不影响回答独立性。 原文链接

重大 Benchmark 变化

SWE-bench Verified:GPT 5.2 Codex 排名升至第 17 GPT 5.2 Codex 排名从第 19 升至第 17(上升 2 位),分数 72.8% 不变。同分区 GPT-5 从第 13 降至第 14。Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换了第 1、2 名位置,两者分数均为 79.2%,无实质分数变化。

Terminal-Bench 2.0:Claude Opus 4.7 升至第 2 Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3,两者分数均为 80.2%,无分数变动。

注:以上排名变动均未达到≥5 的阈值或分数变动≥5% 的标准,仅 GPT 5.2 Codex 的 2 位上升和 Claude Opus 4.7 的 1 位上升为本周内最大变动,严格来说不构成"重大"级别变化。

快速预览

  • OpenAI GPT-5.6 Sol 降价超 20%,多家平台同步打折(Cloudflare、Devin、OpenCode 等)
  • Anthropic 计划今秋推出零数据保留政策,Mythos 级模型需额外安全措施
  • Google Gemini 3.7 Flash 增长破纪录,ARC-AGI-2 得分 84.6%
  • Claude Code 连发三版(v2.1.239–241),含数据驻留成本估算修正
  • DeepSeek Harness v0.1 开源发布,MIT 协议,基于 Cordis 元框架

详细正文

OpenAI

日期 新闻 要点
08-23 2026 is the year companies start caring about model efficiency Tibo(OpenAI)称 2026 年模型效率与可靠性成为关键基础设施指标
08-22 Codex rate limit 更新 部分用户缓存命中率本周下降,团队调查中
08-22 banked reset 已上线 ChatGPT Work 和 Codex 付费用户的 banked reset 已于 8pm PST 落地
08-22 agentic adoption 速度惊人 Greg Brockman 引用:不到一年前 10B tokens/年是里程碑,现在单周即超 10B
08-22 GPT-5.6 Sol 降价 20%+ API 与 credit 定价下调超 20%,持续 3 个月
08-21 GPT-5.6 Sol 降价(Sam Altman 转发) 同上,Sam Altman 确认降价策略
08-21 ChatGPT 周功能更新 iOS 快捷附图、时间理解改进、长对话加载提速、网络错误提示优化
08-20 NVIDIA Vera Rubin 机架到位 首批 Vera Rubin 机架已运行 OpenAI 训练栈
08-20 Exa 插件接入 Codex/ChatGPT 100B+ 网站、论文、文档可搜索
08-20 GPT-5.6 Sol 多平台打折 Router.com 50% off 至 9/18;Cloudflare AI Gateway 50% off;OpenCode Zen 50% off
08-19 Replit Free Mode 上线 GPT-5.6 Luna 驱动,用户无需担心 token 成本
08-19 Zero Data Retention for frontier models 重申符合条件的 API 客户零数据保留,预告 Private Safety Processing
08-18 Devin Desktop: GPT-5.6 Sol 70% off 至 10/3,FrontierCode 1.1 上 Sol 表现顶级
08-20 Introducing AI Futures 新博客探讨 AI 对权力、治理、经济的影响
08-20 Stampli 用 ChatGPT Work 缩短 68% 发布时间 Codex + ChatGPT Work 将数周发布压缩为数天
08-18 ChatGPT Ads 扩展至 31 个欧洲市场
08-18 加强国家安全中的民主监督 为政府机构提供工具、培训和专业知识
08-18 与 CodeAI 合作培养 AI 原生代 帮助学生建立 AI 素养
08-18 网络安全关键能力时代的发展节奏 加强前沿模型监控、对齐和安全
08-18 ChatGPT for Teens 发布 内置保护、健康使用功能、家长控制
08-18 NVIDIA 团队用 ChatGPT Work 减少手动任务,扩展全球工作流
08-18 Asana 用 Codex 两周完成五年工作量 替换旧测试系统,成本约 $12K
08-17 The Defender's Window AI 正重塑攻防双方网络安全
08-17 OpenAI 加入 PORTS-Pike 项目 扩大社区投资,支持南俄亥俄就业
08-17 Intelligence Age 新政策创意 资助 14 个独立 AI 政策项目
08-13 GPT-5.6 构建者指南 智能模型选择与 Responses API
08-13 Ultrafast 预览:GPT-5.6 Sol 14 倍速 Cerebras 驱动,750 tokens/s
08-13 Dali Rajic 任 CRO 领导全球收入组织
08-12 企业如何用 AI 前沿企业在 agentic AI 采用中领先
08-12 RingCentral AI-native 实践 ChatGPT Work + Codex 加速产品开发
08-11 ChatGPT 开始测试广告 支持免费访问,清晰标注
08-11 Daybreak 模型上线 AWS 通过 Amazon Bedrock 提供网络安全能力
08-10 致德州州长信 承诺负责任 AI 基础设施
08-10 Model ML 用 GPT-5.6 Sol 做金融 研究到可编辑 PPT/Excel
08-10 AI-native 财务五课 CFO Sarah Friar 分享
08-10 Daybreak 网安模型扩展 GPT-5.6-Cyber via Daybreak Red

Anthropic / Claude

日期 新闻 要点
08-21 Claude Security 扫描上线 Mythos 5 公测 Claude Enterprise 客户可用,无需单独模型权限
08-20 Anthropic 计划更改数据保留政策 Mythos 级模型需额外安全措施,今秋推出,客户自控数据、Anthropic 不保留
08-20 Computer use / Browser tool / Skills API / Files API GA Claude 平台正式可用
08-14 Claude 文本水印 FAQ 为合规 EU AI Act,不影响输出质量,不加 token 成本,不可追溯到个人
08-14 第二份 Risk Report 发布 Responsible Scaling Policy 常规更新
08-10 Claude 研究 Riemann 假设 未解决,但将 zeta 函数零点下界从 41.6% 提升至 67.2%

Claude Code 版本更新

版本 日期 要点
v2.1.241 08-23 Bug 修复与稳定性改进
v2.1.240 08-22 Bug 修复与稳定性改进
v2.1.239 08-21 成本估算含 1.1× 美国独占推理溢价(数据驻留工作区)
v2.1.238 08-20 新增 keybindingFlavor 设为 "readline" 时 Ctrl+W 按空格删词
v2.1.237 08-20 修复 LLM 网关/自定义 base URL 的 prompt caching

Google / DeepMind

日期 新闻 要点
08-22 Gemini 3.7 为史上增长最快模型 Logan 称 3.7 Flash 增长破纪录
08-22 Sundar Pichai 转发 3.7 Flash 记录 首周即破 Gemini 增长记录,已入 Search 和 Gemini app
08-21 DeepMind 与 FenrisCreations 游戏研究合作 持续学习、深度记忆、长周期规划、多智能体动态
08-20 ARC-AGI 验证结果 Gemini 3.7 Flash: ARC-AGI-2 84.6%($0.25/task),ARC-AGI-1 95.5%($0.12/task)
08-19 Search 5 种学习新功能
08-17 Gemini + Pixel 体育合作
08-13 Sheets canvas 发布 表格数据可视化
08-11 AMIE 实时临床视频问诊 首创研究验证
08-10 Google Ads AI 新工具

DeepSeek

日期 新闻 要点
08-13 DeepSeek Harness v0.1 开发者预览 MIT 协议开源,基于 Cordis 元框架,一切皆插件

其他

日期 新闻 要点
08-23 Qwen 3.8 27B 30 分钟完成逆向工程 HN 159 分
08-22 Why your local LLM feels dumber than it is HN 417 分
08-22 swyx: Simulation 是新 scaling law 引用 Joon Sung Park 社会模拟研究
08-21 德州学生举报 AI 黑客攻击 HN 188 分
08-18 DeepMind 宣布矩阵乘法 omega 新记录 arxiv.org/abs/2608.16884v1
08-14 GLM-5.3 发布 743B 基座后训练,开源模型中网络安全新标准

Benchmark 快照

行业格局

[Artificial Analysis / Intelligence]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

[LMArena / Overall]

本期无变动。当前 Top 3:

排名 模型 分数
1 claude-fable-5 1507.77
2 claude-opus-4-6-high 1504.49
3 claude-opus-4-7-high 1502.01

干活选型

[Artificial Analysis / Agentic]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

[Artificial Analysis / Coding]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

[SWE-bench Pro / Public]

本期无变动。当前 Top 3:

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

[SWE-bench Verified]

有变动:

  • Claude 4.5 Opus medium (20251101)(live-SWE-agent)从第 2 升至第 1,分数 79.2 不变
  • Claude 4.5 Opus(Sonar Foundation Agent)从第 1 降至第 2,分数 79.2 不变
  • GPT 5.2 Codex 从第 19 升至第 17,分数 72.8 不变
  • GPT 5.2 (high) 从第 18 降至第 19,分数 72.8 不变
  • GPT-5 从第 13 降至第 14,分数 74.4 不变
  • Claude 4 Sonnet + o4-mini 从第 14 升至第 13,分数 74.4 不变

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

[Terminal-Bench 2.0]

有变动:

  • Claude Opus 4.7 从第 3 升至第 2,分数 80.2 不变
  • Gemini 3.1 Pro 从第 2 降至第 3,分数 80.2 不变

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI GPT-5.6 Sol 大幅降价:Greg Brockman 原文称「dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months」,叠加 Cloudflare、Devin、OpenCode 等第三方平台同步 50%–70% off,说明 OpenAI 正以价格杠杆抢占开发者侧 frontier 模型份额——这不是单纯让利,而是 GPT-5.6 Sol 在 SWE-bench Verified 和 Terminal-Bench 2.0 均未进入 Top 3(coding 77.0 排名第二但落后于 Claude Opus 5 的 77.0 同分),需要通过渠道补贴维持采用率。

  2. Anthropic 计划今秋推出零数据保留:Boris Cherny 原文明确「Mythos-class models require additional safety measures and enterprises need to meet their own privacy and compliance rules. Customers can own and control their own data and Anthropic retains none」,这直接对标 OpenAI 8 月 19 日的 Zero Data Retention 公告——两家在同周内争夺企业隐私合规叙事,但 Anthropic 将其与 Mythos 级新模型绑定,暗示零数据保留是更高阶模型的前置条件而非通用 API 功能,策略差异明显。

  3. Gemini 3.7 Flash 增长破纪录:Logan Kerr 原文「Gemini 3.7 is our fastest growing model launch to date」,叠加 ARC-AGI-2 验证得分 84.6%($0.25/task)的低成本高分特征,Google 在低成本高效率段位的竞争力正在形成——但 Artificial Analysis Intelligence 榜单中 Gemini 系列未进 Top 5,说明在纯能力维度仍落后于 Claude Opus 5 和 GPT-5.5,增长来自价格/速度而非能力领先。

来源 · 82 条