【OpenAI】GPT-5.6 Sol 降价超 20%,多家平台同步促销
OpenAI 将 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%,为期 3 个月。同时 Cloudflare、Router、OpenCode 等平台推出 50%–70% 折扣,Devin Desktop 折扣延续至 10 月 3 日。叠加 Ultrafast 模式(最高 14 倍速、750 tokens/s),Sol 在性价比上对竞争模型形成直接压力。
【OpenAI】Zero Data Retention 适用于前沿模型,预览 Private Safety Processing
OpenAI 重申合格 API 客户可享受 Zero Data Retention,并预览 Private Safety Processing,在不损害数据隐私的前提下进行高级 AI 安全处理。同日,Bloomberg 报道 Anthropic 也将于今秋为 Mythos 级模型推出类似数据零保留政策。两大前沿模型厂商在企业隐私合规上同步收紧。
Zero Data Retention | Anthropic 数据保留政策变动
【Anthropic】Claude 平台 Computer Use、Browser Tool、Skills API、Files API 正式 GA
四项核心能力从预览转为正式可用。Computer use 可自动化无 API 的应用操作,Browser tool 减少 per-task 往返次数,Skills API 支持版本化技能,Files API 支持可复用文件。企业可在 Claude 平台上构建 Managed Agent,跨无 API 应用自动化工作流。
【Google DeepMind】Gemini 3.7 Flash 登顶 ARC-AGI-2(84.6%)和 AA-AnalystAgent 排行榜
Gemini 3.7 Flash 在 ARC-AGI-2 取得 84.6%($0.25/task),ARC-AGI-1 达 95.5%($0.12/task),成本效率领先同类前沿模型。在 AA-AnalystAgent 80 项真实任务测试中排名第一,完成任务速度比次优模型快 2.4 倍。
ARC-AGI 成绩 | AA-AnalystAgent 排名
【Asana / OpenAI】Codex 两周完成原预计五年的前端测试迁移,成本约 $12K
Asana 用 OpenAI Codex 将前端测试从 Enzyme 迁移至 React Testing Library,两周完成原计划五年的工作量,总成本约 1.2 万美元。这是目前 Codex 在大规模工程迁移场景中公开的最具说服力的案例之一。
SWE-bench Verified:Claude 4.5 Opus medium (20251101) 升至第 1,Claude 4.5 Opus 降至第 2
两者分数均为 79.2,排名互换。同期 GPT 5.2 Codex 从第 19 升至第 17(72.8 分),GPT-5 从第 13 降至第 14(74.4 分)。所有变动均为同分排名微调,无分数变化。
Terminal-Bench 2:Claude Opus 4.7 升至第 2,Gemini 3.1 Pro 降至第 3
两者分数均为 80.2,排名互换。无其他重大变动。
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-21 | ChatGPT 周功能更新 | iOS 快捷附图、时间理解改善、长对话加载加速、网络断连提示优化 |
| 08-20 | Introducing AI Futures | 新博客,探讨 AI 对权力、治理、经济与个人自由的重塑 |
| 08-20 | Stampli 用 ChatGPT Work 压缩上线工时 68% | 设计资源不足时用 Codex + ChatGPT Work 将数周上线生产压缩至数天 |
| 08-20 | GPT-5.6 Sol 降价超 20% | API 与 credit 定价下调,持续 3 个月 |
| 08-20 | Exa 插件接入 Codex & ChatGPT | 可搜索 100B+ 网站、论文、文档等 |
| 08-20 | GPT-5.6 Sol 多平台折扣 | Router 50% off(至 9/18)、Cloudflare 50% off、OpenCode 50% off、Devin 70% off(至 10/3) |
| 08-20 | 首批 NVIDIA Vera Rubin 机架到位 | 已运行 OpenAI 训练栈,扩展前沿预训练算力 |
| 08-19 | 为零数据保留提供前沿模型 | 重申合格 API 客户零数据保留,预览 Private Safety Processing |
| 08-19 | Replit 用 GPT-5.6 Luna 推出 Free Mode | 用户无需担心 token 成本即可创建软件 |
| 08-18 | ChatGPT 广告扩展至 31 个欧洲市场 | 广告主可在用户探索和决策时触达 |
| 08-18 | 加强国家安全中的民主监督 | 为政府机构提供工具、培训和专业知识 |
| 08-18 | 与 CodeAI 合作培养首代 AI 原生代 | 帮助学生建立 AI 素养与批判性思维 |
| 08-18 | 网络关键能力时代下的模型开发节奏 | 强化前沿模型监控、对齐与安全 |
| 08-18 | ChatGPT for Teens 发布 | 面向青少年,内置更强保护与健康使用功能 |
| 08-18 | Asana 用 Codex 两周完成五年工程量 | 前端测试从 Enzyme 迁移至 React Testing Library,花费约 $12K |
| 08-18 | NVIDIA 团队用 ChatGPT Work 扩展专业知识 | 减少手工任务、连接快速信号、全球扩展工作流 |
| 08-17 | The Defender's Window | AI 重塑攻防双方网络安全,分享防御建议 |
| 08-17 | OpenAI 加入 PORTS-Pike 项目 | 扩大社区投资,支持南俄亥俄州数千岗位 |
| 08-17 | Intelligence Age 新政策构想 | 资助 14 个独立项目探索 AI 政策 |
| 08-13 | GPT-5.6 开发者指南 | 创业公司用 GPT-5.6 构建 AI agent,更智能模型选择 |
| 08-13 | 预览 Ultrafast 模式 | GPT-5.6 Sol 速度达 14×,由 Cerebras 驱动,750 tokens/s |
| 08-13 | 任命 Dali Rajic 为首席收入官 | 领导全球收入组织 |
| 08-12 | 从辅助到执行:企业如何用 AI | 研究揭示企业采用 agentic AI 的现状 |
| 08-12 | RingCentral 用 ChatGPT Work 构建 AI 原生工作 | 加速 AI 产品开发,集中运营智能 |
| 08-11 | ChatGPT 开始测试广告 | 支持免费访问,清晰标注、答案独立、隐私保护 |
| 08-11 | Daybreak 模型上线 AWS | 通过 Amazon Bedrock 提供网络安全能力 |
| 08-10 | 致德州州长 Abbott 的信 | 承诺负责任 AI 基础设施建设 |
| 08-10 | Model ML 用 GPT-5.6 Sol 做金融工作 | 从研究分析到可编辑 PowerPoint 和 Excel 交付 |
| 08-10 | 构建 AI 原生财务函数的五个教训 | CFO Sarah Friar 分享自动化预测与 AI ROI |
| 08-10 | GPT-5.6-Cyber 发布 | 网络安全专用模型,通过 Daybreak Red 提供漏洞研究 |
| 08-10 | 前沿网络模型开放给受信伙伴 | 授权 Daybreak 伙伴可提供网络安全服务 |
| 08-10 | ChatGPT Business 将推 Premium seats | 8/20 前注册可获 $100 工作区额度 |
| 08-10 | Virgin Atlantic 用 ChatGPT Work | 加速研究与产品规划 |
| 08-10 | Zapier 用 ChatGPT Work 变革营销流程 | 减少线索漏斗流失、自动化报告 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-21 | Claude Code v2.1.239 | 成本估算纳入 1.1× 美国独占推理溢价(数据驻留工作区) |
| 08-20 | Claude Code v2.1.238 | 新增 keybindingFlavor 设置,支持 readline 风格 Ctrl+W |
| 08-20 | Claude 平台 GA 多项能力 | Computer use、Browser tool、Skills API、Files API 正式可用 |
| 08-20 | Anthropic 计划修改数据保留政策 | Mythos 级模型将支持客户拥有和控制数据,Anthropic 不保留,今秋推出 |
| 08-20 | Claude Code v2.1.237 | 修复使用 LLM 网关或自定义 base URL 时的 prompt 缓存 |
| 08-19 | Claude Code v2.1.236 | 新增 ANTHROPIC_DEFAULT_MODEL 环境变量设置默认模型 |
| 08-18 | Claude Code v2.1.235 | 新增可选 spellcheck 设置,输入时下划线标拼写错误 |
| 08-14 | Claude 文本水印 FAQ | 为合规 EU AI Act 实施水印,不影响输出质量、不增加成本、不可追溯个人 |
| 08-14 | 第二份 Risk Report 发布 | 作为 Responsible Scaling Policy 一部分,公开风险与应对信息 |
| 08-10 | Claude 研究版挑战黎曼猜想 | 未解决但将零点占比下界从 41.6% 提至 67.2% |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-21 | DeepMind 与 Fenris Creations 研究合作 | 探索持续学习、深度记忆、长周期规划、多 agent 动态等开放问题 |
| 08-20 | Gemini 3.7 Flash 上 ARC-AGI 验证 | ARC-AGI-2: 84.6% ($0.25/task),ARC-AGI-1: 95.5% ($0.12/task) |
| 08-19 | Gemini 3.7 Flash 登顶 AA-AnalystAgent 榜 | 80 项真实任务、14 个领域,准确率最高且速度快 60%–90% |
| 08-19 | Google Search 推出 5 项学习新功能 | Notebook 集成、Ask Google 等 |
| 08-18 | DeepMind 宣布矩阵乘法速度新纪录 ω | arxiv: 2608.16884 |
| 08-17 | Gemini 和 Pixel 与足球俱乐部合作 | — |
| 08-14 | Gemini 3.7 Flash 向 Pro/Ultra 用户开放 | 改进多步推理与准确性;Spark 也切换到 3.7 Flash |
| 08-13 | Google Sheets Canvas 发布 | 将表格数据可视化 |
| 08-11 | AMIE 实现实时临床视频问诊 | 首个同类研究 |
| 08-10 | Google Ads 推出新 AI 工具 | Advisor UI 等 |
| 08-11 | Gemini 月活破 10 亿,Gemma 下载破 10 亿 | — |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-21 | DeepSeek-v4-flash-vision-exp 上 HN 热榜 | HN 453 分,视觉能力文档 |
| 08-13 | DeepSeek Harness v0.1 开发者预览 | MIT 协议开源,基于 Cordis 元框架,一切皆插件 |
| 日期 | 来源 | 新闻 | 要点 |
|---|---|---|---|
| 08-21 | ChatGPT Work/Codex | banked reset 上线 | 付费用户额度重置已落地 |
| 08-21 | HN | AI 公司销毁实体书——趁早扫描稀有书籍 | HN 520 分 |
| 08-21 | HN | I'm becoming AI-blind | HN 255 分 |
| 08-21 | HN | Claudette: 让 Claude 不再像 BuzzFeed 文章 | HN 188 分 |
| 08-19 | HN | AI 提高了作业分数但考试分数下降 | HN 223 分 |
| 08-14 | Z.ai | GLM-5.3 发布 | 743B 基座后训练,主打编码与网络安全 |
AA Intelligence 排行(本期无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
LMArena Overall 排行(本期无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.33 |
| 2 | claude-opus-4-6-high | 1504.58 |
| 3 | claude-opus-4-7-high | 1502.08 |
AA Agentic 排行(本期无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
AA Coding 排行(本期无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
SWE-bench Pro Public 排行(本期无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
SWE-bench Verified 排行(有变动 ↓)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
变化明细:
Terminal-Bench 2.0 排行(有变动 ↓)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
变化明细:
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-5.6 Sol 降价超 20% 且多家平台同步推出 50%–70% 折扣——Router、Cloudflare、OpenCode 将折扣持续到 9 月 18 日,Devin 持续到 10 月 3 日,叠加 OpenAI 官方 3 个月降价,说明 Sol 当前在 agentic/coding benchmark 上尚未取得绝对领先(AA Coding 第 5 名 72.2 低于 Claude Opus 5 的 77.0、GPT-5.5 的 74.9),厂商正在用价格换量。
Anthropic 计划今秋为零数据保留推出 Mythos 级模型支持——Boris Cherny 明确提到 "Mythos-class models require additional safety measures" 且 "Customers can own and control their own data and Anthropic retains none",这比 OpenAI 8/19 重申的零数据保留更进一步,针对的是尚未发布的 Mythos 级模型而非现有产品线,预示下一轮企业客户的竞争焦点在隐私合规而非能力本身。
SWE-bench Verified Top 2 同分 79.2 却互换排名——Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 的分数完全相同,排名互换说明榜单在区分 scaffold(live-SWE-agent vs Sonar Foundation Agent)而非模型本身,这两个条目本质是同一模型搭配不同脚手架的并列成绩,开发者选型时应关注 scaffold 而非纠结排名先后。