← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-22

2026-08-22 08:52 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 Sol 降价超 20%,多家平台同步促销

OpenAI 将 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%,为期 3 个月。同时 Cloudflare、Router、OpenCode 等平台推出 50%–70% 折扣,Devin Desktop 折扣延续至 10 月 3 日。叠加 Ultrafast 模式(最高 14 倍速、750 tokens/s),Sol 在性价比上对竞争模型形成直接压力。

GPT-5.6 Sol 降价Ultrafast 预览

【OpenAI】Zero Data Retention 适用于前沿模型,预览 Private Safety Processing

OpenAI 重申合格 API 客户可享受 Zero Data Retention,并预览 Private Safety Processing,在不损害数据隐私的前提下进行高级 AI 安全处理。同日,Bloomberg 报道 Anthropic 也将于今秋为 Mythos 级模型推出类似数据零保留政策。两大前沿模型厂商在企业隐私合规上同步收紧。

Zero Data RetentionAnthropic 数据保留政策变动

【Anthropic】Claude 平台 Computer Use、Browser Tool、Skills API、Files API 正式 GA

四项核心能力从预览转为正式可用。Computer use 可自动化无 API 的应用操作,Browser tool 减少 per-task 往返次数,Skills API 支持版本化技能,Files API 支持可复用文件。企业可在 Claude 平台上构建 Managed Agent,跨无 API 应用自动化工作流。

Claude 平台 GA 公告

【Google DeepMind】Gemini 3.7 Flash 登顶 ARC-AGI-2(84.6%)和 AA-AnalystAgent 排行榜

Gemini 3.7 Flash 在 ARC-AGI-2 取得 84.6%($0.25/task),ARC-AGI-1 达 95.5%($0.12/task),成本效率领先同类前沿模型。在 AA-AnalystAgent 80 项真实任务测试中排名第一,完成任务速度比次优模型快 2.4 倍。

ARC-AGI 成绩AA-AnalystAgent 排名

【Asana / OpenAI】Codex 两周完成原预计五年的前端测试迁移,成本约 $12K

Asana 用 OpenAI Codex 将前端测试从 Enzyme 迁移至 React Testing Library,两周完成原计划五年的工作量,总成本约 1.2 万美元。这是目前 Codex 在大规模工程迁移场景中公开的最具说服力的案例之一。

Asana 案例

重大 Benchmark 变化

SWE-bench Verified:Claude 4.5 Opus medium (20251101) 升至第 1,Claude 4.5 Opus 降至第 2

两者分数均为 79.2,排名互换。同期 GPT 5.2 Codex 从第 19 升至第 17(72.8 分),GPT-5 从第 13 降至第 14(74.4 分)。所有变动均为同分排名微调,无分数变化。

Terminal-Bench 2:Claude Opus 4.7 升至第 2,Gemini 3.1 Pro 降至第 3

两者分数均为 80.2,排名互换。无其他重大变动。

快速预览

  • OpenAI 上线 AI Futures 博客,探讨 AI 对权力、治理与经济的影响;同日发布 Stampli 用 Codex 将上线工时压缩 68% 的案例。
  • Anthropic 计划今秋为零数据保留政策推出 Mythos 级模型支持,Claude 平台 GA 了 Computer use、Browser tool、Skills API 与 Files API。
  • GPT-5.6 Sol 降价超 20%,多家平台(Router、Cloudflare、OpenCode、Devin)同步推出折扣。
  • DeepSeek-v4-flash-vision-exp 上 HN 热榜,453 分。
  • Claude Code 连发 5 个版本(v2.1.235–v2.1.239),新增拼写检查、readline 键绑定、默认模型环境变量等。

详细新闻

OpenAI

日期 新闻 要点
08-21 ChatGPT 周功能更新 iOS 快捷附图、时间理解改善、长对话加载加速、网络断连提示优化
08-20 Introducing AI Futures 新博客,探讨 AI 对权力、治理、经济与个人自由的重塑
08-20 Stampli 用 ChatGPT Work 压缩上线工时 68% 设计资源不足时用 Codex + ChatGPT Work 将数周上线生产压缩至数天
08-20 GPT-5.6 Sol 降价超 20% API 与 credit 定价下调,持续 3 个月
08-20 Exa 插件接入 Codex & ChatGPT 可搜索 100B+ 网站、论文、文档等
08-20 GPT-5.6 Sol 多平台折扣 Router 50% off(至 9/18)、Cloudflare 50% off、OpenCode 50% off、Devin 70% off(至 10/3)
08-20 首批 NVIDIA Vera Rubin 机架到位 已运行 OpenAI 训练栈,扩展前沿预训练算力
08-19 为零数据保留提供前沿模型 重申合格 API 客户零数据保留,预览 Private Safety Processing
08-19 Replit 用 GPT-5.6 Luna 推出 Free Mode 用户无需担心 token 成本即可创建软件
08-18 ChatGPT 广告扩展至 31 个欧洲市场 广告主可在用户探索和决策时触达
08-18 加强国家安全中的民主监督 为政府机构提供工具、培训和专业知识
08-18 与 CodeAI 合作培养首代 AI 原生代 帮助学生建立 AI 素养与批判性思维
08-18 网络关键能力时代下的模型开发节奏 强化前沿模型监控、对齐与安全
08-18 ChatGPT for Teens 发布 面向青少年,内置更强保护与健康使用功能
08-18 Asana 用 Codex 两周完成五年工程量 前端测试从 Enzyme 迁移至 React Testing Library,花费约 $12K
08-18 NVIDIA 团队用 ChatGPT Work 扩展专业知识 减少手工任务、连接快速信号、全球扩展工作流
08-17 The Defender's Window AI 重塑攻防双方网络安全,分享防御建议
08-17 OpenAI 加入 PORTS-Pike 项目 扩大社区投资,支持南俄亥俄州数千岗位
08-17 Intelligence Age 新政策构想 资助 14 个独立项目探索 AI 政策
08-13 GPT-5.6 开发者指南 创业公司用 GPT-5.6 构建 AI agent,更智能模型选择
08-13 预览 Ultrafast 模式 GPT-5.6 Sol 速度达 14×,由 Cerebras 驱动,750 tokens/s
08-13 任命 Dali Rajic 为首席收入官 领导全球收入组织
08-12 从辅助到执行:企业如何用 AI 研究揭示企业采用 agentic AI 的现状
08-12 RingCentral 用 ChatGPT Work 构建 AI 原生工作 加速 AI 产品开发,集中运营智能
08-11 ChatGPT 开始测试广告 支持免费访问,清晰标注、答案独立、隐私保护
08-11 Daybreak 模型上线 AWS 通过 Amazon Bedrock 提供网络安全能力
08-10 致德州州长 Abbott 的信 承诺负责任 AI 基础设施建设
08-10 Model ML 用 GPT-5.6 Sol 做金融工作 从研究分析到可编辑 PowerPoint 和 Excel 交付
08-10 构建 AI 原生财务函数的五个教训 CFO Sarah Friar 分享自动化预测与 AI ROI
08-10 GPT-5.6-Cyber 发布 网络安全专用模型,通过 Daybreak Red 提供漏洞研究
08-10 前沿网络模型开放给受信伙伴 授权 Daybreak 伙伴可提供网络安全服务
08-10 ChatGPT Business 将推 Premium seats 8/20 前注册可获 $100 工作区额度
08-10 Virgin Atlantic 用 ChatGPT Work 加速研究与产品规划
08-10 Zapier 用 ChatGPT Work 变革营销流程 减少线索漏斗流失、自动化报告

Anthropic / Claude

日期 新闻 要点
08-21 Claude Code v2.1.239 成本估算纳入 1.1× 美国独占推理溢价(数据驻留工作区)
08-20 Claude Code v2.1.238 新增 keybindingFlavor 设置,支持 readline 风格 Ctrl+W
08-20 Claude 平台 GA 多项能力 Computer use、Browser tool、Skills API、Files API 正式可用
08-20 Anthropic 计划修改数据保留政策 Mythos 级模型将支持客户拥有和控制数据,Anthropic 不保留,今秋推出
08-20 Claude Code v2.1.237 修复使用 LLM 网关或自定义 base URL 时的 prompt 缓存
08-19 Claude Code v2.1.236 新增 ANTHROPIC_DEFAULT_MODEL 环境变量设置默认模型
08-18 Claude Code v2.1.235 新增可选 spellcheck 设置,输入时下划线标拼写错误
08-14 Claude 文本水印 FAQ 为合规 EU AI Act 实施水印,不影响输出质量、不增加成本、不可追溯个人
08-14 第二份 Risk Report 发布 作为 Responsible Scaling Policy 一部分,公开风险与应对信息
08-10 Claude 研究版挑战黎曼猜想 未解决但将零点占比下界从 41.6% 提至 67.2%

Google / DeepMind

日期 新闻 要点
08-21 DeepMind 与 Fenris Creations 研究合作 探索持续学习、深度记忆、长周期规划、多 agent 动态等开放问题
08-20 Gemini 3.7 Flash 上 ARC-AGI 验证 ARC-AGI-2: 84.6% ($0.25/task),ARC-AGI-1: 95.5% ($0.12/task)
08-19 Gemini 3.7 Flash 登顶 AA-AnalystAgent 榜 80 项真实任务、14 个领域,准确率最高且速度快 60%–90%
08-19 Google Search 推出 5 项学习新功能 Notebook 集成、Ask Google 等
08-18 DeepMind 宣布矩阵乘法速度新纪录 ω arxiv: 2608.16884
08-17 Gemini 和 Pixel 与足球俱乐部合作
08-14 Gemini 3.7 Flash 向 Pro/Ultra 用户开放 改进多步推理与准确性;Spark 也切换到 3.7 Flash
08-13 Google Sheets Canvas 发布 将表格数据可视化
08-11 AMIE 实现实时临床视频问诊 首个同类研究
08-10 Google Ads 推出新 AI 工具 Advisor UI 等
08-11 Gemini 月活破 10 亿,Gemma 下载破 10 亿

DeepSeek

日期 新闻 要点
08-21 DeepSeek-v4-flash-vision-exp 上 HN 热榜 HN 453 分,视觉能力文档
08-13 DeepSeek Harness v0.1 开发者预览 MIT 协议开源,基于 Cordis 元框架,一切皆插件

其他

日期 来源 新闻 要点
08-21 ChatGPT Work/Codex banked reset 上线 付费用户额度重置已落地
08-21 HN AI 公司销毁实体书——趁早扫描稀有书籍 HN 520 分
08-21 HN I'm becoming AI-blind HN 255 分
08-21 HN Claudette: 让 Claude 不再像 BuzzFeed 文章 HN 188 分
08-19 HN AI 提高了作业分数但考试分数下降 HN 223 分
08-14 Z.ai GLM-5.3 发布 743B 基座后训练,主打编码与网络安全

当前 Benchmark 快照

行业格局

AA Intelligence 排行(本期无变动)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

LMArena Overall 排行(本期无变动)

排名 模型 分数
1 claude-fable-5 1507.33
2 claude-opus-4-6-high 1504.58
3 claude-opus-4-7-high 1502.08

干活选型

AA Agentic 排行(本期无变动)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

AA Coding 排行(本期无变动)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

SWE-bench Pro Public 排行(本期无变动)

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified 排行(有变动 ↓)

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

变化明细:

  • Claude 4.5 Opus medium (20251101):第 2 → 第 1(分数不变 79.2),与 Claude 4.5 Opus 互换首位。
  • Claude 4.5 Opus:第 1 → 第 2(分数不变 79.2)。
  • GPT 5.2 Codex:第 19 → 第 17(分数不变 72.8),上升 2 位。
  • GPT 5.2 (high):第 18 → 第 19(分数不变 72.8),与 GPT 5.2 Codex 互换。
  • Claude 4 Sonnet + o4-mini:第 14 → 第 13(分数不变 74.4),上升 1 位。
  • GPT-5:第 13 → 第 14(分数不变 74.4),与上条对应下调。
  • GPT 5.1 Codex (medium):第 32 → 第 31(分数不变 66.0)。
  • GPT 5.1 (2025-11-13) (medium):第 31 → 第 32(分数不变 66.0)。
  • GLM 5 (high):第 17 → 第 18(分数不变 72.8)。
  • GLM 4.6 (T=1):第 50 → 第 51(分数不变 55.4)。
  • Qwen3-Coder 480B/A35B Instruct:第 51 → 第 50(分数不变 55.4)。

Terminal-Bench 2.0 排行(有变动 ↓)

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

变化明细:

  • Claude Opus 4.7:第 3 → 第 2(分数不变 80.2),与 Gemini 3.1 Pro 互换。
  • Gemini 3.1 Pro:第 2 → 第 3(分数不变 80.2)。
  • Grok 4:第 39 → 第 38(分数不变 27.2)。
  • Qwen 3 Coder 480B:第 38 → 第 39(分数不变 27.2)。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. GPT-5.6 Sol 降价超 20% 且多家平台同步推出 50%–70% 折扣——Router、Cloudflare、OpenCode 将折扣持续到 9 月 18 日,Devin 持续到 10 月 3 日,叠加 OpenAI 官方 3 个月降价,说明 Sol 当前在 agentic/coding benchmark 上尚未取得绝对领先(AA Coding 第 5 名 72.2 低于 Claude Opus 5 的 77.0、GPT-5.5 的 74.9),厂商正在用价格换量。

  2. Anthropic 计划今秋为零数据保留推出 Mythos 级模型支持——Boris Cherny 明确提到 "Mythos-class models require additional safety measures" 且 "Customers can own and control their own data and Anthropic retains none",这比 OpenAI 8/19 重申的零数据保留更进一步,针对的是尚未发布的 Mythos 级模型而非现有产品线,预示下一轮企业客户的竞争焦点在隐私合规而非能力本身。

  3. SWE-bench Verified Top 2 同分 79.2 却互换排名——Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 的分数完全相同,排名互换说明榜单在区分 scaffold(live-SWE-agent vs Sonar Foundation Agent)而非模型本身,这两个条目本质是同一模型搭配不同脚手架的并列成绩,开发者选型时应关注 scaffold 而非纠结排名先后。

来源 · 87 条