← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-20

2026-08-20 08:34 CST
快速版 完整版

核心速览

【OpenAI】为前沿模型提供零数据保留,预览 Private Safety Processing

OpenAI 重申为符合条件的 API 客户提供 Zero Data Retention(零数据保留),同时预览 Private Safety Processing——在客户控制的基础设施上运行自动安全检测,返回有限安全信号但不暴露原始 prompt 和响应。计划 9 月开始推出。

Offering Zero Data Retention for frontier models

【OpenAI/Greg Brockman】暂停前沿 RL 训练两周以强化安全

OpenAI 临时放慢了前沿训练规模,包括最大的前沿 RL 计划,暂停两周以加固和红队测试安全系统。Greg Brockman 表示对安全信心将日益决定 AI 开发节奏。

Pacing model development in an era of cyber-critical capabilities

【Replit + OpenAI】Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动

Replit 引入 Free Mode,任何人可在不担心 token 成本的情况下将想法变为可运行的软件,无需付费即可使用。

Replit expands access to software creation with GPT-5.6 Luna

【Anthropic】Claude 自主设计蛋白质结合体,14/15 靶点成功

Anthropic 让 Claude 从零设计蛋白质结合体(de novo design),针对 15 个靶点中 14 个成功设计出候选分子,由 Adaptyv Bio 和 Twist Bioscience 独立合成和测试。这一结果表明前沿 LLM 在结构生物学任务上已具备实际可用的生成能力,将药物发现早期筛选阶段从数周压缩至数小时量级。

Anthropic 蛋白质设计研究

【Google DeepMind】矩阵乘法指数 ω 创下新纪录

DeepMind 宣布矩阵乘法的理论最快速度指数 ω 取得新进展,论文已发布在 arXiv。矩阵乘法是现代计算(含 AI)的基础运算,该结果直接影响 AI 计算效率的理论下界。

Google DeepMind 矩阵乘法新纪录

重大 Benchmark 变化

SWE-bench Verified:GPT 5.2 Codex 排名上升 2 位

GPT 5.2 Codex 从第 19 名升至第 17 名(分数 72.8,未变),同时 GPT-5 从第 13 降至第 14,Claude 4.5 Opus 从第 1 降至第 2。Claude 4.5 Opus medium (20251101) 取代其成为第 1 名。两次排名变动均为同分模型间的微小位移,分数无变化,不构成实质性能力差距改变。

Terminal-Bench 2.0:Claude Opus 4.7 升至第 2

Claude Opus 4.7 从第 3 升至第 2(80.2 分),Gemini 3.1 Pro 从第 2 降至第 3(同分 80.2)。同为同分位移,无实际性能差异。

快速预览

  • OpenAI 重申 Zero Data Retention 并预览 Private Safety Processing,9 月开始向客户推出
  • Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,用户无需担心 token 成本
  • OpenAI 暂停前沿 RL 训练两周以加固安全,称安全信心将决定模型开发节奏
  • Claude Code 连发三个版本:默认模型环境变量、拼写检查、项目目录命名
  • SWE-bench Verified 榜单头部小幅洗牌:Claude 4.5 Opus medium 升至第 1

详细正文

OpenAI

日期 新闻 要点
08-19 Offerering Zero Data Retention for frontier models 重申为合格 API 客户提供零数据保留,预览 Private Safety Processing——在不暴露提示词和响应的前提下返回有限安全信号,9 月开始推出
08-19 Replit expands access to software creation with GPT-5.6 Luna Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,用户无需担心 token 成本
08-18 ChatGPT Ads expands across Europe ChatGPT 广告扩展至 31 个欧洲市场
08-18 Strengthening democratic oversight in national security 启动国家安全领域 AI 民主监督倡议,为政府机构提供工具、培训和专业知识
08-18 Pacing model development in an era of cyber-critical capabilities 加强前沿模型监控、对齐和安全,以安全信心指导开发节奏
08-18 Introducing ChatGPT for Teens 面向青少年的 ChatGPT,内置更强保护和家长控制
08-18 Partnering with CodeAI 与 CodeAI 合作帮助学生建立 AI 素养
08-18 How NVIDIA scales expertise with ChatGPT Work NVIDIA 团队使用 ChatGPT Work 减少手动任务
08-18 Asana cleared 5 years of engineering work in 2 weeks with Codex Asana 用 Codex 两周完成预计五年的前端测试迁移(Enzyme→React Testing Library),成本约 1.2 万美元

OpenAI 高管在 X 上的补充信息:

  • Greg Brockman(08-18):OpenAI 暂时放缓了前沿训练(包括最大规模的 frontier RL),以加强安全和监控;安全信心将越来越决定 AI 开发节奏。前沿模型 RL 训练暂停了两周用于加固和红队测试。
  • Sam Altman(08-19):明确表态支持商业隐私。
  • Tibo(08-19):回顾 Codex 近两周安全改动——此前发现 GPT-5.6 在 Codex 中执行了破坏性操作(清理临时目录时误删用户文件,如复用 $HOME 变量导致指向实际 home 目录)。已添加多层防护:明确检查删除目标、创建新临时目录、避免复用系统环境变量、加强高风险删除命令审查、Full access 更难意外启用、Auto-review 更好识别破坏性操作,并添加针对性评估和 RL 训练任务。

其他 OpenAI 近期新闻(08-07 至 08-17):

日期 新闻 要点
08-17 The Defender's Window AI 正在重塑攻防双方网络安全态势
08-17 OpenAI joins PORTS-Pike project 加入俄亥俄州南部社区投资项目
08-17 New policy ideas for the Intelligence Age 资助 14 个独立 AI 政策研究项目
08-13 The builder's guide to GPT-5.6 创业公司用 GPT-5.6 构建更快的 AI agent
08-13 Previewing Ultrafast mode GPT-5.6 Sol 最快 14 倍速度,由 Cerebras 驱动,最高 750 tokens/s
08-13 OpenAI appoints Dali Rajic as CRO 任命 Dali Rajic 为首席收入官
08-11 Testing ads in ChatGPT 开始在 ChatGPT 中测试广告
08-11 Daybreak models on AWS Daybreak 网络安全能力通过 Amazon Bedrock 提供
08-10 Expanding Daybreak GPT-5.6-Cyber 通过 Daybreak Red 提供授权漏洞研究
08-07 Responding to the next frontier of critical cyber capabilities 分享 Astra 初步网络安全评估
08-06 Improving GPT-5.6 Sol in ChatGPT 改进 GPT-5.6 Sol 准确性,免费用户扩展 GPT-5.6 Luna 访问

OpenAI 开发者动态


Anthropic / Claude

日期 来源 要点
08-19 Claude Code v2.1.236 新增 ANTHROPIC_DEFAULT_MODEL 环境变量,设定新会话默认模型,/model 选择仍可覆盖并跨重启持久化
08-18 Claude Code v2.1.235 新增可选 spellcheck 设置,用 aspell/hunspell/ispell 实时拼写检查
08-17 Claude Code v2.1.234 新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量,为每项目 transcript 目录选短名
08-14 Claude Cowork 移动端/网页版 Cowork 向所有付费计划开放移动端和网页版,Max 计划率先 Beta
08-14 Claude 文本水印 FAQ 为遵守 EU AI Act 实施水印,不影响输出质量、不加额外 token、不可追溯个人
08-14 第二份风险报告 发布 Responsible Scaling Policy 第二份风险报告
08-18 Claude 设计蛋白质结合体 Anthropic 用 Claude 从头设计蛋白质结合体,15 个靶标中 14 个成功,由 Adaptyv Bio 和 Twist Bioscience 独立测试
08-19 Claude Desktop 启动提速 比一个月前快约 2 倍,修复后台启动时计时器被限流导致 JS 引擎降速问题

早期 Claude Code 版本:

日期 版本 要点
08-14 v2.1.233 GitLab MR URL 支持加入 --worktreeclaude agents 视图
08-13 v2.1.232 Subagent forking 默认开启,fork 子 agent 继承完整对话和 prompt cache

Google

日期 新闻 要点
08-19 5 new ways to level up your learning with Search Google Search 新增 5 个学习功能
08-17 Get closer to the game with Gemini and Pixel Gemini 和 Pixel 与足球俱乐部合作
08-13 Sheets canvas Google Sheets 新增 canvas 可视化功能
08-11 AMIE 视频问诊 医疗 AI 系统 AMIE 展示实时临床视频问诊能力
08-10 AI marketing tools Google Ads 和 Analytics 新增 AI 工具

Google DeepMind / Gemini 动态:


DeepSeek


其他社区动态


Benchmark 快照

行业格局

Artificial Analysis — 综合智能

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

本期无变动。

LMArena — 总榜

排名 模型 分数
1 claude-fable-5 1506.63
2 claude-opus-4-6-high 1504.71
3 claude-opus-4-7-high 1502.23

本期无变动。

干活选型

Artificial Analysis — Agentic

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

本期无变动。

Artificial Analysis — Coding

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

本期无变动。

SWE-bench Verified — 榜单变化

头部洗牌:

模型 变化 前排名 现排名 分数
Claude 4.5 Opus medium (20251101) 2 1 79.2
Claude 4.5 Opus 1 2 79.2

两者分数相同(79.2),排名互换。Claude 4.5 Opus medium 版本升至第 1。

其他排名变化:

模型 前排名 现排名 分数
GPT 5.2 Codex 19 17 72.8
GPT 5.2 (high) 18 19 72.8
GLM 5 (high) 17 18 72.8
GPT-5 13 14 74.4
Claude 4 Sonnet + o4-mini 14 13 74.4
GPT 5.1 Codex (medium) 32 31 66.0
GPT 5.1 (2025-11-13) (medium) 31 32 66.0
Qwen3-Coder 480B/A35B Instruct 51 50 55.4
GLM 4.6 (T=1) 50 51 55.4

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (live-SWE-agent) 79.2
2 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

Terminal-Bench 2.0 — 榜单变化

模型 变化 前排名 现排名 分数
Claude Opus 4.7 3 2 80.2
Gemini 3.1 Pro 2 3 80.2
Grok 4 39 38 27.2
Qwen 3 Coder 480B 38 39 27.2

Claude Opus 4.7 和 Gemini 3.1 Pro 分数相同(80.2),排名互换。Grok 4 与 Qwen 3 Coder 480B 在尾部互换。

当前 Top 3:

排名 模型 scaffold 分数
1 GPT-5.5 NexAU-AHE 84.7
2 Claude Opus 4.7 WOZCODE 80.2
3 Gemini 3.1 Pro TongAgents 80.2

SWE-bench Pro Public — 本期无变动

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 暂停前沿 RL 训练两周以加固安全——Greg Brockman 明确表示"暂时放缓了前沿训练,包括最大规模的 frontier RL",且 OpenAI 官方文章确认暂停两周用于加固和红队测试。这不是公关姿态,而是首次有前沿实验室公开承认主动放慢训练节奏,并将安全信心确立为开发节奏的约束变量。如果后续其他实验室跟进类似做法,行业竞争逻辑将从"谁先训出更大模型"转向"谁的安全治理更可信"。

  2. Codex 破坏性操作事件暴露 agent 自主性的真实风险——Tibo 的复盘披露了具体故障模式:GPT-5.6 在 Codex 中复用 $HOME 等系统环境变量做临时目录,清理命令变形后指向用户 home 目录导致误删文件。这是目前 agent 安全领域少有的公开根因分析,防护措施(删除前检查目标、禁止复用系统变量、高风险命令审查升级)也具有工程参考价值。随着 agent 自主性增强,此类"低概率高破坏"事件的治理将成为所有 coding agent 的必修课。

  3. SWE-bench Verified 头部排名互换但分数不变——Claude 4.5 Opus medium 与 Claude 4.5 Opus 分数均为 79.2,排名从 1/2 互换为 2/1,说明榜单背后可能有新的同分排序规则或数据更新,而非模型本身变化。Doubao-Seed-Code 以 78.8 紧追其后,差距仅 0.4 分,头部竞争非常接近。

来源 · 86 条