← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-25

2026-08-25 08:58 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 登陆 Kiro,提升开发者性价比 GPT-5.6 现已在 Kiro 中可用,帮助开发者进行软件规划、构建、审查和测试,主打更好的性价比。同期 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%,持续 3 个月,多家平台(Cloudflare、Devin、Router)同步推出 50%-70% 折扣。Sol 降价直接降低了前沿模型的调用门槛,Devin Desktop 上 70% 的折扣使其成为当前最具性价比的前沿编码模型之一。

【OpenAI】Ultrafast 模式预览:GPT-5.6 Sol 速度提升 14 倍 OpenAI 预览 Ultrafast API 服务层级,由 Cerebras 驱动,GPT-5.6 Sol 最高可达 750 output tokens/秒,速度提升 14 倍,面向实时语音、客服、金融研究等对延迟敏感的场景,首批向选定客户开放。

【OpenAI】Zero Data Retention 持续提供,预览 Private Safety Processing OpenAI 重申为符合条件的 API 客户户提供 Zero Data Retention,并预览 Private Safety Processing,在不接触用户原始内容的前提下进行安全检测。该机制面向更长、更自主的 AI 任务场景,解决企业隐私合规与安全审查之间的矛盾。

【xAI】Grok 4.6 进入 AA 榜单,多项类别排名第二 Grok 4.6 (medium) 作为新模型进入 AA benchmark 的 agentic(56.3 分)、coding(74.4 分)、intelligence(59.0 分)三个类别,均位列第 2 名,直接将 Claude Sonnet 5、GPT-5.5、Muse Spark 1.2 等模型各推后一名。

  • 相关排名变动详见下方 Benchmark 部分

【Anthropic】Claude 平台多项工具 GA,Mythos 5 安全扫描公测 Computer use、Browser tool、Skills API、Files API 正式 GA;Claude Security 扫描基于 Mythos 5 面向 Enterprise 客户公开测试。同期 Bloomberg 报道 Anthropic 计划今秋调整数据保留策略,企业可完全拥有和控制数据,Anthropic 不留存。


重大 Benchmark 变化

Grok 4.6 (medium) 新模型进入 AA 榜单,三类均排第 2

类别 排名 分数
Agentic #2 56.3
Coding #3 74.4
Intelligence #2 59.0

该模型入榜导致多个现有模型排名各后移 1 位(均未超 5 位变动阈值),但 Grok 4.6 本身作为新进入者直接占据第 2,是本周期最重要的排名事件。

SWE-bench Verified:GPT 5.2 Codex 排名上升 GPT 5.2 Codex 从第 19 名升至第 17 名(+2 位),Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 互换第 1/第 2 名,两者分数均为 79.2。

Terminal Bench 2.0:Claude Opus 4.7 升至第 2 Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3,两者分数均为 80.2。

快速预览

  • OpenAI 将 GPT-5.6 Sol API 降价超 20%,多家平台同步推出 50%-70% 折扣
  • GPT-5.6 正式进入 Kiro 开发者工具,Replit 推出基于 GPT-5.6 Luna 的免费模式
  • Grok 4.6 空降三大 AA 榜单第 2 名,Claude Opus 5 仍居多项榜首
  • Anthropic Claude Code 发布 v2.1.243,新增 Loops 用量分析
  • Gemini 3.7 Flash 成 Google 史上增长最快模型,ARC-AGI-2 拿到 84.6%

详细正文

OpenAI

日期 标题 摘要
08-24 Advancing price-performance for developers with GPT-5.6 in Kiro GPT-5.6 进入 Kiro,帮助开发者规划、构建、审查和测试软件,提供更好的性价比。
08-21 GPT-5.6 Sol 降价超 20%(X) API 和 credit 价格下调超 20%,持续 3 个月。多家平台同步折扣:Cloudflare 50%OpenCode 50%Devin 70%Router 50%
08-20 Introducing AI Futures 新博客,探讨变革性 AI 如何重塑权力、治理、经济和个人自由。
08-20 Stampli 使用 ChatGPT Work 将启动时间缩短 68% 使用 Codex 和 ChatGPT Work 将数周发布工作压缩到几天。
08-19 Offering Zero Data Retention for frontier models 重申为合格 API 客户提供零数据留存,预览 Private Safety Processing。
08-19 Replit 使用 GPT-5.6 Luna 扩展软件创建 Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,无需担心 token 成本。
08-18 ChatGPT Ads 扩展至欧洲 ChatGPT 广告扩展至 31 个欧洲市场。
08-18 Strengthening democratic oversight in national security 启动加强国家安全 AI 民主监督的倡议。
08-18 Pacing model development in an era of cyber-critical capabilities 加强前沿模型的监控、对齐和安全;曾暂停 RL 训练两周进行加固和红队测试。
08-18 ChatGPT for Teens 面向青少年推出,内置更强保护和家长控制。
08-18 Asana 用 Codex 两周完成五年工程量 替换过时测试系统,约花费 1.2 万美元。
08-17 The Defender's Window AI 正在重塑网络安全的攻防格局。
08-13 The builder's guide to GPT-5.6 介绍初创公司如何用 GPT-5.6 构建更快的 AI agents。
08-13 Previewing Ultrafast: GPT-5.6 Sol 最快 14 倍 由 Cerebras 驱动,最高 750 tokens/秒。
08-13 任命 Dali Rajic 为首席收入官 领导全球收入组织。
08-11 Testing ads in ChatGPT 开始在 ChatGPT 中测试广告以支持免费访问。
08-11 Daybreak models now available on AWS 通过 Amazon Bedrock 提供网络安全能力。

Anthropic / Claude Code

日期 标题 摘要
08-24 Claude Code v2.1.243 /usage 新增 Loops 用量分析:每次 loop 运行次数、总 token、每轮 token 和最近运行。
08-23 Claude Code v2.1.241 Bug 修复和稳定性改进。
08-22 Claude Code v2.1.240 Bug 修复和稳定性改进。
08-21 Claude Code v2.1.239 成本估算现包含 1.1× 美国专属推理溢价(针对数据驻留工作区)。
08-20 Claude Code v2.1.238 新增 keybindingFlavor 设置,可选 "readline" 使 Ctrl+W 行为与 Bash 一致。
08-21 Claude Security 扫描运行于 Claude Mythos 5(X) 公开测试版面向所有 Claude Enterprise 客户。
08-20 Claude Platform 多项 API 正式发布(X) Computer use、浏览器工具、Skills API 和 Files API 正式发布。
08-20 Anthropic 计划更改高级 AI 数据留存政策(X) 客户可拥有和控制自身数据,Anthropic 不保留,今年秋季推出。
08-14 Claude 文本水印 FAQ(X) 为遵守 EU AI Act 实施水印;不影响输出质量,无隐藏字符,不增加成本,不可追溯。
08-14 第二份 Risk Report(X) 公布系统风险及应对准备情况的详细信息。

Google / DeepMind

日期 标题 摘要
08-22 Gemini 3.7 是 Google 增长最快的模型发布(X) Gemini 3.7 Flash 首周增长超此前所有 Gemini 模型。
08-21 DeepMind 与 FenrisCreations 游戏研究合作(X) 探索持续学习、深度记忆、长期规划和多智能体动态。
08-20 Gemini 3.7 Flash ARC-AGI 成绩(X) ARC-AGI-2: 84.6%($0.25/task),ARC-AGI-1: 95.5%($0.12/task)。
08-19 5 new ways to level up your learning with Search 搜索学习工具更新。
08-17 Gemini and Pixel 足球俱乐部合作 通过 Gemini 和 Pixel 提供更贴近比赛的体验。
08-13 Sheets canvas 发布 将电子表格数据可视化。
08-11 AMIE 实时临床视频问诊研究 首项实时临床视频问诊能力研究。

其他厂商与社区

日期 来源 标题 摘要
08-24 X/GDB Codex 采用数据(X) a16z 数据:Codex 自 2 月以来增长最快的行业为法律 108×、销售 41×、招聘 41×。
08-24 X/Tibo Codex 速率限制更新(X) 已修复用量问题,发现图片长会话、Computer History 和标题生成消耗过多用量。
08-14 X/Simon GLM-5.3 发布(X) Z.ai 发布 GLM-5.3,743B 基座后训练,主打编码和网络安全。
08-13 X/DeepSeek DeepSeek Harness v0.1 开发者预览(X) MIT 协议开源,基于 Cordis 元框架,"一切皆插件"理念。
08-24 HN Coding expertise is going to collapse from AI reliance HN 446 分讨论 AI 依赖导致编码能力退化。
08-24 HN GPT 5.6 Sol price reduction HN 287 分讨论降价。

行业格局

AA Intelligence — 本期有变动:

Grok 4.6 (medium) 作为新模型空降第 2 名(59.0 分),将 Muse Spark 1.2 从第 2 推至第 3,GPT-5.5 从第 3 降至第 4,Claude Sonnet 5 从第 4 降至第 5。

当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Grok 4.6 (medium) 59.0
3 Muse Spark 1.2 (xhigh) 56.8

LMArena Overall — 本期无变动。

当前 Top 3:

排名 模型 分数
1 claude-fable-5 1507.8
2 claude-opus-4-6-high 1504.5
3 claude-opus-4-7-high 1502.0

干活选型

AA Agentic — 本期有变动:

Grok 4.6 (medium) 新入榜即排第 2(56.3 分),导致 Claude Sonnet 5 从第 2 降至第 3,Muse Spark 1.2 从第 3 降至第 4,GPT-5.5 从第 4 降至第 5。

当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Grok 4.6 (medium) 56.3
3 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7

AA Coding — 本期有变动:

Grok 4.6 (medium) 新入榜即排第 3(74.4 分),Muse Spark 1.2 从第 3 降至第 4,Kimi K3 从第 4 降至第 5。

当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Grok 4.6 (medium) 74.4

SWE-bench Verified — 本期有变动:

Claude 4.5 Opus medium (20251101) 从第 2 升至第 1(79.2 分),Claude 4.5 Opus 从第 1 降至第 2(同为 79.2 分)。GPT 5.2 Codex 从第 19 升至第 17,GPT 5.2 (high) 从第 18 降至第 19。GPT 5.1 Codex (medium) 从第 32 升至第 31,GPT 5.1 (2025-11-13) (medium) 从第 31 降至第 32。

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

Terminal-Bench 2.0 — 本期有变动:

Claude Opus 4.7 从第 3 升至第 2(80.2 分),Gemini 3.1 Pro 从第 2 降至第 3(同为 80.2 分)。Grok 4 从第 39 升至第 38,Qwen 3 Coder 480B 从第 38 降至第 39。

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

SWE-bench Pro Public — 本期无变动。

当前 Top 3:

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. GPT-5.6 Sol 降价超 20%:OpenAI 官方降价叠加 Cloudflare 50%、Router 50%、OpenCode 50%、Devin 70% 等多平台同步折扣,且 GPT-5.6 同时进入 Kiro 和 Replit Free Mode——这说明 GPT-5.6 Sol 已进入以价换量阶段,OpenAI 正用价格杠杆加速生态渗透而非仅靠模型能力竞争。

  2. Grok 4.6 空降三大 AA 榜单第 2:一个新模型同时在 Intelligence(59.0)、Agentic(56.3)、Coding(74.4)三项榜单直接排在第 2、仅次于 Claude Opus 5,这在近几期 AA 榜单中极为罕见,说明 xAI 的 Grok 4.6 已具备与 Anthropic 旗舰模型正面竞争的基准性能。

来源 · 92 条