← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-27

2026-07-27 08:59 CST
快速版 完整版

核心速览

【Anthropic】发布 Claude Opus 5 Claude Opus 5 是一款「深思熟虑且主动」的模型,接近 Fable 5 的前沿智能水平,价格减半。在 OSWorld v2 基准测试中从 55.7% 提升至 70.6%,并在多个编码和知识工作评测中达到 SOTA。该模型的提示注入抗性显著增强,配合多层防御后攻击成功率接近零。原文链接

【OpenAI】推出 ChatGPT Health 功能 美国用户现可安全连接医疗记录和 Apple Health 数据至 ChatGPT,获得个性化健康洞察。该功能旨在帮助用户更好理解自身健康状况。原文链接

【OpenAI】发布企业级 AI 代理平台 Presence OpenAI Presence 帮助企业部署可信的语音和聊天代理,支持问答、系统操作、审批行动及人工升级。该平台已向合格企业客户开放有限 GA 试用。原文链接

【OpenAI】ChatGPT Work 新增登录网站能力 ChatGPT Work 代理现可操作需要登录的网站。用户可在云端浏览器中登录一次,代理后续任务可持续使用该登录状态。原文链接

【Google】启动 Gemini 4 预训练 Google 已启动「迄今最雄心勃勃」的 Gemini 4 预训练运行,并称进展令人振奋。原文链接

重大 Benchmark 变化

无重大变化。本次监控到的排名变动均为 1-2 位的微调,分数无实质性变化,未达到「排名变动≥5 或分数变动≥5%」的报告阈值。

快速预览

  • Anthropic 发布 Claude Opus 5,在多评测集达 SOTA,价格为 Fable 5 的一半
  • OpenAI 推出 Health in ChatGPT,支持美国用户连接医疗记录和 Apple Health
  • OpenAI 发布企业级 AI agent 平台 Presence,支持语音和聊天代理
  • Claude Code 新增 Opus 5 支持,/code-review 改为后台子代理运行
  • Google Gemini 4 预训练已启动,Gemma 4 下载量突破 3 亿次

Anthropic

日期 新闻
07-24 Claude Opus 5 发布:接近 Fable 5 智力水平,价格减半;Claude Code v2.1.219 已支持,现为默认 Opus 模型(1M 上下文)
07-22 Anthropic Economic Index 数据集现可直接向 Claude 查询,支持查询各职业 AI 使用情况
07-20 罕见病研究资助计划:提供最高 $50,000 Claude 使用额度
07-14 Claude for Teachers 上线:美国 K-12 认证教师免费使用高级功能;加拿大 AI 研究基金:承诺 1000 万加元

OpenAI

日期 新闻
07-23 Health in ChatGPT 上线:美国用户可安全连接医疗记录和 Apple Health 获取个性化健康洞察
07-22 OpenAI Presence 发布:企业级 AI agent 平台,支持语音/聊天代理,有限 GA;Project Camellia:乔治亚州 AI 基础设施项目;与美国能源部合作:推进国家科学计划
07-21 小型企业 ChatGPT 计划:帮助创业者构建 AI 技能;与 Hugging Face 联合披露安全事件:模型评测期间发现高级网络能力
07-20 长时程模型安全对齐研究:分享部署长运行模型的安全风险与改进措施

OpenAI 开发者动态

日期 新闻
07-24 ChatGPT Work 代理现可使用需登录网站:接管云浏览器登录后代理继续任务,登录状态跨会话保持
07-23 Sites Analytics 公测:Codex 发布的站点可查看基本性能指标

Google

日期 新闻
07-22 Galaxy Unpacked 2026:Gentle Monster/Warby Parker 眼镜集成 AI 功能;Genesis Mission 扩展:与能源部合作,投入 $40M AI tokens 和云额度加速科学发现
07-21 Gemini 4 预训练启动:Logan Kilpatrick 称为"最雄心勃勃的预训练运行"
07-23 Gemma 4 下载量突破 3 亿
07-16 Google Vids 更新:Gemini Omni 和 Personal Avatars 功能;Search 连接更多应用

Claude Code 更新

版本 日期 变更
v2.1.220 07-25 Bug 修复和可靠性改进
v2.1.219 07-24 新增 Claude Opus 5,现为默认 Opus 模型(1M 上下文,fast mode $10/$50 per Mtok)
v2.1.218 07-22 /code-review 改为后台子代理运行,评测内容不再填满对话
v2.1.217 07-21 新增 emoji 短代码自动补全(如 :heart: → ❤️)
v2.1.216 07-20 新增 sandbox.filesystem.disabled 设置

Benchmark 快照

行业格局

Intelligence (Artificial Analysis)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 60.1
2 GPT-5.5 (xhigh) 54.8
3 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4

LMArena Overall

排名 模型 分数
1 claude-fable-5 1507.3
2 claude-opus-4-6-thinking 1504.8
3 claude-opus-4-7-thinking 1502.0

干活选型

Agentic (Artificial Analysis)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 54.5
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
3 GPT-5.6 Luna (max) 45.6

Coding (Artificial Analysis)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5

本期变化

  • SWE-bench Verified:Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(分数 79.2),Claude 4.5 Opus 降至第 2
  • Terminal-Bench 2.0:Claude Opus 4.7 从第 3 名升至第 2 名,Gemini 3.1 Pro 降至第 3 名

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评:Claude Opus 5 在 Artificial Analysis 的 Intelligence、Agentic、Coding 三项评测均居第一,且价格为 Fable 5 的一半,显示出 Anthropic 在性价比上的激进策略;OpenAI 在医疗健康领域的布局值得关注,Health in ChatGPT 直接整合 Apple Health 和医疗记录,比纯聊天场景更深介入用户日常生活。

来源 · 90 条