【Anthropic】发布 Claude Opus 5 Claude Opus 5 是一款「深思熟虑且主动」的模型,接近 Fable 5 的前沿智能水平,价格减半。在 OSWorld v2 基准测试中从 55.7% 提升至 70.6%,并在多个编码和知识工作评测中达到 SOTA。该模型的提示注入抗性显著增强,配合多层防御后攻击成功率接近零。原文链接
【OpenAI】推出 ChatGPT Health 功能 美国用户现可安全连接医疗记录和 Apple Health 数据至 ChatGPT,获得个性化健康洞察。该功能旨在帮助用户更好理解自身健康状况。原文链接
【OpenAI】发布企业级 AI 代理平台 Presence OpenAI Presence 帮助企业部署可信的语音和聊天代理,支持问答、系统操作、审批行动及人工升级。该平台已向合格企业客户开放有限 GA 试用。原文链接
【OpenAI】ChatGPT Work 新增登录网站能力 ChatGPT Work 代理现可操作需要登录的网站。用户可在云端浏览器中登录一次,代理后续任务可持续使用该登录状态。原文链接
【Google】启动 Gemini 4 预训练 Google 已启动「迄今最雄心勃勃」的 Gemini 4 预训练运行,并称进展令人振奋。原文链接
无重大变化。本次监控到的排名变动均为 1-2 位的微调,分数无实质性变化,未达到「排名变动≥5 或分数变动≥5%」的报告阈值。
/code-review 改为后台子代理运行| 日期 | 新闻 |
|---|---|
| 07-24 | Claude Opus 5 发布:接近 Fable 5 智力水平,价格减半;Claude Code v2.1.219 已支持,现为默认 Opus 模型(1M 上下文) |
| 07-22 | Anthropic Economic Index 数据集现可直接向 Claude 查询,支持查询各职业 AI 使用情况 |
| 07-20 | 罕见病研究资助计划:提供最高 $50,000 Claude 使用额度 |
| 07-14 | Claude for Teachers 上线:美国 K-12 认证教师免费使用高级功能;加拿大 AI 研究基金:承诺 1000 万加元 |
| 日期 | 新闻 |
|---|---|
| 07-23 | Health in ChatGPT 上线:美国用户可安全连接医疗记录和 Apple Health 获取个性化健康洞察 |
| 07-22 | OpenAI Presence 发布:企业级 AI agent 平台,支持语音/聊天代理,有限 GA;Project Camellia:乔治亚州 AI 基础设施项目;与美国能源部合作:推进国家科学计划 |
| 07-21 | 小型企业 ChatGPT 计划:帮助创业者构建 AI 技能;与 Hugging Face 联合披露安全事件:模型评测期间发现高级网络能力 |
| 07-20 | 长时程模型安全对齐研究:分享部署长运行模型的安全风险与改进措施 |
| 日期 | 新闻 |
|---|---|
| 07-24 | ChatGPT Work 代理现可使用需登录网站:接管云浏览器登录后代理继续任务,登录状态跨会话保持 |
| 07-23 | Sites Analytics 公测:Codex 发布的站点可查看基本性能指标 |
| 日期 | 新闻 |
|---|---|
| 07-22 | Galaxy Unpacked 2026:Gentle Monster/Warby Parker 眼镜集成 AI 功能;Genesis Mission 扩展:与能源部合作,投入 $40M AI tokens 和云额度加速科学发现 |
| 07-21 | Gemini 4 预训练启动:Logan Kilpatrick 称为"最雄心勃勃的预训练运行" |
| 07-23 | Gemma 4 下载量突破 3 亿 |
| 07-16 | Google Vids 更新:Gemini Omni 和 Personal Avatars 功能;Search 连接更多应用 |
| 版本 | 日期 | 变更 |
|---|---|---|
| v2.1.220 | 07-25 | Bug 修复和可靠性改进 |
| v2.1.219 | 07-24 | 新增 Claude Opus 5,现为默认 Opus 模型(1M 上下文,fast mode $10/$50 per Mtok) |
| v2.1.218 | 07-22 | /code-review 改为后台子代理运行,评测内容不再填满对话 |
| v2.1.217 | 07-21 | 新增 emoji 短代码自动补全(如 :heart: → ❤️) |
| v2.1.216 | 07-20 | 新增 sandbox.filesystem.disabled 设置 |
Intelligence (Artificial Analysis):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 60.1 |
| 2 | GPT-5.5 (xhigh) | 54.8 |
| 3 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
LMArena Overall:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.3 |
| 2 | claude-opus-4-6-thinking | 1504.8 |
| 3 | claude-opus-4-7-thinking | 1502.0 |
Agentic (Artificial Analysis):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 54.5 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 3 | GPT-5.6 Luna (max) | 45.6 |
Coding (Artificial Analysis):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
本期变化:
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
点评:Claude Opus 5 在 Artificial Analysis 的 Intelligence、Agentic、Coding 三项评测均居第一,且价格为 Fable 5 的一半,显示出 Anthropic 在性价比上的激进策略;OpenAI 在医疗健康领域的布局值得关注,Health in ChatGPT 直接整合 Apple Health 和医疗记录,比纯聊天场景更深介入用户日常生活。