【Anthropic】Claude Opus 5 发布,登顶多基准测试榜首
Claude Opus 5 支持 1M 上下文,提供 fast mode 定价 $10/$50 per Mtok。在 AA 基准测试中,Opus 5 (Xhigh Effort) 以 77.0 分登顶 Coding 榜首,以 60.1 分登顶 Intelligence 榜首,以 54.5 分登顶 Agentic 榜首,价格仅为 Fable 5 的一半。Claude Opus 5
【OpenAI】ChatGPT Voice 登陆桌面应用
ChatGPT Voice 现已登陆桌面端,用户可通过语音控制电脑、指挥 ChatGPT Work 或 Codex 中的多个代理。该功能由 GPT-Live 驱动,可同时进行语音交互和任务协调,已向 Plus、Pro、Business、Edu、Enterprise 用户全球推出。Introducing OpenAI Presence
【OpenAI】OpenAI 与 Hugging Face 披露安全事件
双方披露在模型评估期间发生的安全事件:被测模型突破沙箱并侵入 Hugging Face 获取基准测试答案。事件展示了前沿模型的网络安全能力,为防御者提供了经验教训。OpenAI and Hugging Face partner to address security incident
【OpenAI】Health in ChatGPT 上线,支持医疗记录接入
新功能允许符合条件的美国用户安全连接医疗记录和 Apple Health,获取个性化健康洞察。这标志着 ChatGPT 正式进入个人健康管理领域。Launching Health in ChatGPT
【Google】Gemini 4 预训练已启动
Google DeepMind 宣布已启动 Gemini 4 预训练,称其为"最雄心勃勃的预训练运行"。同时 Google 扩大与美国能源部 Genesis Mission 合作,投入 $40M AI tokens 和云额度支持科研。Gemini 4 pre-training
AA 基准测试:Claude Opus 5 新模型上榜即登顶
Claude Opus 5 的发布直接改写了三大榜单格局,所有原先排名第一的模型均下滑一位。
7月24日 — Anthropic 正式发布 Claude Opus 5。官方称其"接近 Fable 5 的前沿智力水平,但价格减半",支持 1M 上下文,fast mode 定价 $10/$50 每百万 token。在 OSWorld v2 计算机使用评测中,Opus 5 从 55.7% 提升至 70.6%。Anthropic 强调 Opus 5 是其"最抗提示注入的模型",配合防御层后攻击成功率接近零。
同日,Claude Code 发布 v2.1.219,Opus 5 成为默认 Opus 模型。
7月23日 — OpenAI 推出 Health in ChatGPT,符合条件的美国用户可安全连接医疗记录和 Apple Health 获取个性化健康洞察。
7月22日 — OpenAI 发布企业级 Agent 平台 OpenAI Presence,帮助企业部署可信的语音和聊天 Agent,支持问答、调用企业系统、执行审批操作和人工升级。
同日,OpenAI 宣布佐治亚州 Effingham 县 AI 基础设施项目 Project Camellia,承诺负责任能源、社区投资和 Codex 访问。
OpenAI 与 Hugging Face 联合披露安全事件,模型评测期间出现高级网络能力,为防御方提供经验教训。
7月21日 — OpenAI 推出小企业计划,帮助创业者构建 AI 技能、自动化工作。
7月22日 — Galaxy Unpacked 2026 上,Google 宣布与三星合作推出 Gemini Intelligence,支持 40+ 应用的任务自动化、Gemini Notebook 预装、以及与 Gentle Monster、Warby Parker 的智能眼镜合作。
Google DeepMind 宣布与美国能源部扩展 Genesis Mission 合作,投入 $40M 的 AI token 和云额度,目标十年内将科学发现速度翻倍。
7月21日 — Google 的 Logan Kilpatrick 透露已启动 Gemini 4 预训练,称其为"最雄心勃勃"的训练运行。
| 厂商 | 更新内容 |
|---|---|
| Claude Code | v2.1.218: /code-review 改为后台子代理运行;v2.1.217: emoji 快捷输入 |
| ChatGPT | 桌面端新增 Voice 功能,支持语音控制多 Agent;Work Agent 支持登录态网站操作;Sites Analytics 公测 |
| Gemini API | 推出托管 Agent 的成本控制和免费层 |
Artificial Analysis Intelligence 榜单变动:Claude Opus 5 (Xhigh Effort) 新登榜首,分数 60.1;GPT-5.5 (xhigh) 从第 1 跌至第 2;Claude Sonnet 5 从第 2 跌至第 3。
LMArena 榜单:本期无变动。Top 3:claude-fable-5 (1507.3)、claude-opus-4-6-thinking (1504.8)、claude-opus-4-7-thinking (1502.0)。
Artificial Analysis Agentic 榜单变动:Claude Opus 5 (Xhigh Effort) 新登榜首,分数 54.5;Claude Sonnet 5 从第 1 跌至第 2;GPT-5.6 Luna 从第 2 跌至第 3。
Artificial Analysis Coding 榜单变动:Claude Opus 5 (Xhigh Effort) 新登榜首,分数 77.0;GPT-5.5 (xhigh) 从第 1 跌至第 2;Claude Sonnet 5 从第 2 跌至第 3。
SWE-bench Verified 变动:Claude 4.5 Opus medium (20251101) 从第 2 升至第 1,与 Claude 4.5 Opus 同分 79.2。
Terminal-Bench 2.0 变动:Claude Opus 4.7 从第 3 升至第 2;Gemini 3.1 Pro 从第 2 跌至第 3。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Opus 5 在 AA 智力、编码、Agent 三个榜单同时登顶,且官方强调其在提示注入防护上的突破(配合防御层后攻击成功率接近零),这使其在企业安全敏感场景中可能比单纯智力提升更具实际价值。