【Anthropic】Claude Opus 5 发布 Anthropic 推出 Claude Opus 5,接近 Fable 5 前沿智能水平,价格仅为后者一半。模型在编码、数据分析、知识工作等多项评测中达到新 SOTA,OSWorld v2 分数从 55.7% 提升至 70.6%,是迄今最抗提示注入攻击的模型。Opus 5 的安全性和智能同步提升,为企业级 Agent 部署扫清关键障碍。 原文链接
【OpenAI】Health in ChatGPT 上线 OpenAI 推出 Health 功能,允许美国用户安全连接医疗记录和 Apple Health 数据至 ChatGPT,获取个性化健康洞察。功能面向符合条件的美国用户开放。 原文链接
【OpenAI】Presence 企业 Agent 平台发布 OpenAI 发布 Presence,企业级 AI Agent 平台,支持部署语音和聊天 Agent 处理客户及内部工作流。Agent 可回答问题、使用公司系统、执行批准操作,并根据需要转人工。 原文链接
【Google】Gemini 4 预训练启动 Google 已启动 Gemini 4 的预训练,称这是迄今最雄心勃勃的训练运行。Gemini App 月活用户达 9.5 亿,模型 API 每分钟处理 220 亿 token。 原文链接
【OpenAI】ChatGPT Work 支持登录网站 ChatGPT Work Agent 现可使用需要登录的网站。用户可接管云浏览器登录,登录状态跨会话保持,只需登录一次即可让 Agent 继续执行任务。 原文链接
无符合条件(排名变动≥5 或分数变动≥5%)的重大变化。SWE-bench Verified 和 Terminal Bench 2 本周仅有微小的排名调整(1-2 位),分数均无变化。
| 日期 | 新闻 |
|---|---|
| 07-23 | Launching Health in ChatGPT — 美国用户可安全连接医疗记录和 Apple Health,获取个性化健康洞察 |
| 07-22 | Introducing OpenAI Presence — 企业级 AI Agent 平台,部署可信语音/聊天代理,有限 GA |
| 07-22 | Building AI infrastructure with the Effingham County community — 佐治亚州 Project Camellia 项目,承诺负责任能源和社区投资 |
| 07-22 | How news organizations are using AI — 新闻机构用 AI 加强报道、增长受众、改善运营 |
| 07-22 | Advancing the next era of national science — 与美国能源部和国家实验室合作,用前沿 AI 加速发现 |
| 07-21 | Introducing the ChatGPT for small business program — 帮助企业家构建 AI 技能、自动化工作 |
| 07-21 | OpenAI and Hugging Face partner to address security incident — 模型评估期间安全事件早期发现,分享防御经验 |
产品更新(来自 X):
| 日期 | 新闻 |
|---|---|
| 07-24 | Introducing Claude Opus 5 — 深思型模型,接近 Fable 5 智力水平,价格减半 |
| 07-22 | Anthropic Economic Index 对话功能 — 可直接向 Claude 查询 AI 经济指数数据 |
| 07-20 | 罕见病研究资助计划 — 最高 $50,000 Claude 使用额度支持罕见病研究 |
| 07-14 | Claude for Teachers — 美国 K-12 教师免费使用高级功能,含教学技能库 |
| 07-14 | 加拿大 AI 研究投资 — 承诺 1000 万加元资助加拿大 AI 研究 |
Claude Code 更新:
/code-review 改为后台子 Agent 运行,不占用对话空间| 日期 | 新闻 |
|---|---|
| 07-22 | Galaxy Unpacked 2026 — Gentle Monster、Warby Parker 眼镜支持,可用照片识别建筑历史或预订餐厅 |
| 07-22 | Genesis Mission 扩展 — 与美能源部合作,投入 $40M AI tokens 和云额度,十年内将科学发现速度翻倍 |
| 07-21 | Gemini 4 预训练启动 — 最具野心的预训练运行已开始 |
| 07-16 | Search Connected Apps — 更多应用可连接至搜索 |
| 07-16 | Google Vids 更新 — Gemini Omni 和个人化 Avatar 功能 |
本期变动:无重大变动
当前 Top 3(Artificial Analysis Intelligence):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 60.1 |
| 2 | GPT-5.5 (xhigh) | 54.8 |
| 3 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
当前 Top 3(LMArena Overall):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.3 |
| 2 | claude-opus-4-6-thinking | 1504.8 |
| 3 | claude-opus-4-7-thinking | 1502.0 |
本期变动:
| 榜单 | 变化 |
|---|---|
| SWE-bench Verified | Claude 4.5 Opus medium (20251101) 排名从第 2 升至第 1(分数 79.2);Claude 4.5 Opus 从第 1 降至第 2 |
| Terminal-Bench 2.0 | Claude Opus 4.7 从第 3 升至第 2;Gemini 3.1 Pro 从第 2 降至第 3 |
当前 Top 3(Artificial Analysis Agentic):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 54.5 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 3 | GPT-5.6 Luna (max) | 45.6 |
当前 Top 3(Artificial Analysis Coding):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Opus 5 发布:在 Artificial Analysis 的 Intelligence 和 Agentic 榜单均居首位,且价格仅为 Fable 5 的一半,对需要高智力模型的开发者具有直接吸引力。
OpenAI Health 功能:首个允许美国用户直接连接医疗记录的 AI 产品,相比之前仅能分析用户提供的信息,现在可主动获取并整合医疗数据,健康领域的实用性显著提升。