【OpenAI】为前沿模型提供零数据保留,预览 Private Safety Processing
OpenAI 重申为符合条件的 API 客户提供 Zero Data Retention(零数据保留),同时预览 Private Safety Processing——在客户控制的基础设施上运行自动安全检测,返回有限安全信号但不暴露原始 prompt 和响应。计划 9 月开始推出。
Offering Zero Data Retention for frontier models
【OpenAI/Greg Brockman】暂停前沿 RL 训练两周以强化安全
OpenAI 临时放慢了前沿训练规模,包括最大的前沿 RL 计划,暂停两周以加固和红队测试安全系统。Greg Brockman 表示对安全信心将日益决定 AI 开发节奏。
Pacing model development in an era of cyber-critical capabilities
【Replit + OpenAI】Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动
Replit 引入 Free Mode,任何人可在不担心 token 成本的情况下将想法变为可运行的软件,无需付费即可使用。
Replit expands access to software creation with GPT-5.6 Luna
【Anthropic】Claude 自主设计蛋白质结合体,14/15 靶点成功
Anthropic 让 Claude 从零设计蛋白质结合体(de novo design),针对 15 个靶点中 14 个成功设计出候选分子,由 Adaptyv Bio 和 Twist Bioscience 独立合成和测试。这一结果表明前沿 LLM 在结构生物学任务上已具备实际可用的生成能力,将药物发现早期筛选阶段从数周压缩至数小时量级。
【Google DeepMind】矩阵乘法指数 ω 创下新纪录
DeepMind 宣布矩阵乘法的理论最快速度指数 ω 取得新进展,论文已发布在 arXiv。矩阵乘法是现代计算(含 AI)的基础运算,该结果直接影响 AI 计算效率的理论下界。
SWE-bench Verified:GPT 5.2 Codex 排名上升 2 位
GPT 5.2 Codex 从第 19 名升至第 17 名(分数 72.8,未变),同时 GPT-5 从第 13 降至第 14,Claude 4.5 Opus 从第 1 降至第 2。Claude 4.5 Opus medium (20251101) 取代其成为第 1 名。两次排名变动均为同分模型间的微小位移,分数无变化,不构成实质性能力差距改变。
Terminal-Bench 2.0:Claude Opus 4.7 升至第 2
Claude Opus 4.7 从第 3 升至第 2(80.2 分),Gemini 3.1 Pro 从第 2 降至第 3(同分 80.2)。同为同分位移,无实际性能差异。
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-19 | Offerering Zero Data Retention for frontier models | 重申为合格 API 客户提供零数据保留,预览 Private Safety Processing——在不暴露提示词和响应的前提下返回有限安全信号,9 月开始推出 |
| 08-19 | Replit expands access to software creation with GPT-5.6 Luna | Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,用户无需担心 token 成本 |
| 08-18 | ChatGPT Ads expands across Europe | ChatGPT 广告扩展至 31 个欧洲市场 |
| 08-18 | Strengthening democratic oversight in national security | 启动国家安全领域 AI 民主监督倡议,为政府机构提供工具、培训和专业知识 |
| 08-18 | Pacing model development in an era of cyber-critical capabilities | 加强前沿模型监控、对齐和安全,以安全信心指导开发节奏 |
| 08-18 | Introducing ChatGPT for Teens | 面向青少年的 ChatGPT,内置更强保护和家长控制 |
| 08-18 | Partnering with CodeAI | 与 CodeAI 合作帮助学生建立 AI 素养 |
| 08-18 | How NVIDIA scales expertise with ChatGPT Work | NVIDIA 团队使用 ChatGPT Work 减少手动任务 |
| 08-18 | Asana cleared 5 years of engineering work in 2 weeks with Codex | Asana 用 Codex 两周完成预计五年的前端测试迁移(Enzyme→React Testing Library),成本约 1.2 万美元 |
OpenAI 高管在 X 上的补充信息:
$HOME 变量导致指向实际 home 目录)。已添加多层防护:明确检查删除目标、创建新临时目录、避免复用系统环境变量、加强高风险删除命令审查、Full access 更难意外启用、Auto-review 更好识别破坏性操作,并添加针对性评估和 RL 训练任务。其他 OpenAI 近期新闻(08-07 至 08-17):
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-17 | The Defender's Window | AI 正在重塑攻防双方网络安全态势 |
| 08-17 | OpenAI joins PORTS-Pike project | 加入俄亥俄州南部社区投资项目 |
| 08-17 | New policy ideas for the Intelligence Age | 资助 14 个独立 AI 政策研究项目 |
| 08-13 | The builder's guide to GPT-5.6 | 创业公司用 GPT-5.6 构建更快的 AI agent |
| 08-13 | Previewing Ultrafast mode | GPT-5.6 Sol 最快 14 倍速度,由 Cerebras 驱动,最高 750 tokens/s |
| 08-13 | OpenAI appoints Dali Rajic as CRO | 任命 Dali Rajic 为首席收入官 |
| 08-11 | Testing ads in ChatGPT | 开始在 ChatGPT 中测试广告 |
| 08-11 | Daybreak models on AWS | Daybreak 网络安全能力通过 Amazon Bedrock 提供 |
| 08-10 | Expanding Daybreak | GPT-5.6-Cyber 通过 Daybreak Red 提供授权漏洞研究 |
| 08-07 | Responding to the next frontier of critical cyber capabilities | 分享 Astra 初步网络安全评估 |
| 08-06 | Improving GPT-5.6 Sol in ChatGPT | 改进 GPT-5.6 Sol 准确性,免费用户扩展 GPT-5.6 Luna 访问 |
OpenAI 开发者动态:
| 日期 | 来源 | 要点 |
|---|---|---|
| 08-19 | Claude Code v2.1.236 | 新增 ANTHROPIC_DEFAULT_MODEL 环境变量,设定新会话默认模型,/model 选择仍可覆盖并跨重启持久化 |
| 08-18 | Claude Code v2.1.235 | 新增可选 spellcheck 设置,用 aspell/hunspell/ispell 实时拼写检查 |
| 08-17 | Claude Code v2.1.234 | 新增 CLAUDE_CODE_PROJECT_DIR_NAME 环境变量,为每项目 transcript 目录选短名 |
| 08-14 | Claude Cowork 移动端/网页版 | Cowork 向所有付费计划开放移动端和网页版,Max 计划率先 Beta |
| 08-14 | Claude 文本水印 FAQ | 为遵守 EU AI Act 实施水印,不影响输出质量、不加额外 token、不可追溯个人 |
| 08-14 | 第二份风险报告 | 发布 Responsible Scaling Policy 第二份风险报告 |
| 08-18 | Claude 设计蛋白质结合体 | Anthropic 用 Claude 从头设计蛋白质结合体,15 个靶标中 14 个成功,由 Adaptyv Bio 和 Twist Bioscience 独立测试 |
| 08-19 | Claude Desktop 启动提速 | 比一个月前快约 2 倍,修复后台启动时计时器被限流导致 JS 引擎降速问题 |
早期 Claude Code 版本:
| 日期 | 版本 | 要点 |
|---|---|---|
| 08-14 | v2.1.233 | GitLab MR URL 支持加入 --worktree 和 claude agents 视图 |
| 08-13 | v2.1.232 | Subagent forking 默认开启,fork 子 agent 继承完整对话和 prompt cache |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-19 | 5 new ways to level up your learning with Search | Google Search 新增 5 个学习功能 |
| 08-17 | Get closer to the game with Gemini and Pixel | Gemini 和 Pixel 与足球俱乐部合作 |
| 08-13 | Sheets canvas | Google Sheets 新增 canvas 可视化功能 |
| 08-11 | AMIE 视频问诊 | 医疗 AI 系统 AMIE 展示实时临床视频问诊能力 |
| 08-10 | AI marketing tools | Google Ads 和 Analytics 新增 AI 工具 |
Google DeepMind / Gemini 动态:
Artificial Analysis — 综合智能
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
本期无变动。
LMArena — 总榜
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1506.63 |
| 2 | claude-opus-4-6-high | 1504.71 |
| 3 | claude-opus-4-7-high | 1502.23 |
本期无变动。
Artificial Analysis — Agentic
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
本期无变动。
Artificial Analysis — Coding
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
本期无变动。
SWE-bench Verified — 榜单变化
头部洗牌:
| 模型 | 变化 | 前排名 | 现排名 | 分数 |
|---|---|---|---|---|
| Claude 4.5 Opus medium (20251101) | ↑ | 2 | 1 | 79.2 |
| Claude 4.5 Opus | ↓ | 1 | 2 | 79.2 |
两者分数相同(79.2),排名互换。Claude 4.5 Opus medium 版本升至第 1。
其他排名变化:
| 模型 | 前排名 | 现排名 | 分数 |
|---|---|---|---|
| GPT 5.2 Codex | 19 | 17 | 72.8 |
| GPT 5.2 (high) | 18 | 19 | 72.8 |
| GLM 5 (high) | 17 | 18 | 72.8 |
| GPT-5 | 13 | 14 | 74.4 |
| Claude 4 Sonnet + o4-mini | 14 | 13 | 74.4 |
| GPT 5.1 Codex (medium) | 32 | 31 | 66.0 |
| GPT 5.1 (2025-11-13) (medium) | 31 | 32 | 66.0 |
| Qwen3-Coder 480B/A35B Instruct | 51 | 50 | 55.4 |
| GLM 4.6 (T=1) | 50 | 51 | 55.4 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
Terminal-Bench 2.0 — 榜单变化
| 模型 | 变化 | 前排名 | 现排名 | 分数 |
|---|---|---|---|---|
| Claude Opus 4.7 | ↑ | 3 | 2 | 80.2 |
| Gemini 3.1 Pro | ↓ | 2 | 3 | 80.2 |
| Grok 4 | ↑ | 39 | 38 | 27.2 |
| Qwen 3 Coder 480B | ↓ | 38 | 39 | 27.2 |
Claude Opus 4.7 和 Gemini 3.1 Pro 分数相同(80.2),排名互换。Grok 4 与 Qwen 3 Coder 480B 在尾部互换。
当前 Top 3:
| 排名 | 模型 | scaffold | 分数 |
|---|---|---|---|
| 1 | GPT-5.5 | NexAU-AHE | 84.7 |
| 2 | Claude Opus 4.7 | WOZCODE | 80.2 |
| 3 | Gemini 3.1 Pro | TongAgents | 80.2 |
SWE-bench Pro Public — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 暂停前沿 RL 训练两周以加固安全——Greg Brockman 明确表示"暂时放缓了前沿训练,包括最大规模的 frontier RL",且 OpenAI 官方文章确认暂停两周用于加固和红队测试。这不是公关姿态,而是首次有前沿实验室公开承认主动放慢训练节奏,并将安全信心确立为开发节奏的约束变量。如果后续其他实验室跟进类似做法,行业竞争逻辑将从"谁先训出更大模型"转向"谁的安全治理更可信"。
Codex 破坏性操作事件暴露 agent 自主性的真实风险——Tibo 的复盘披露了具体故障模式:GPT-5.6 在 Codex 中复用 $HOME 等系统环境变量做临时目录,清理命令变形后指向用户 home 目录导致误删文件。这是目前 agent 安全领域少有的公开根因分析,防护措施(删除前检查目标、禁止复用系统变量、高风险命令审查升级)也具有工程参考价值。随着 agent 自主性增强,此类"低概率高破坏"事件的治理将成为所有 coding agent 的必修课。
SWE-bench Verified 头部排名互换但分数不变——Claude 4.5 Opus medium 与 Claude 4.5 Opus 分数均为 79.2,排名从 1/2 互换为 2/1,说明榜单背后可能有新的同分排序规则或数据更新,而非模型本身变化。Doubao-Seed-Code 以 78.8 紧追其后,差距仅 0.4 分,头部竞争非常接近。