【Anthropic】Claude Opus 5 发布,接近前沿智能水平
Anthropic 发布 Claude Opus 5,定位为"深思熟虑且主动"的模型,以 Fable 5 一半的价格接近其前沿智能水平。在 OSWorld v2 等多个代码和知识工作评测中取得新 SOTA,Prompt 注入攻击成功率接近零。Claude Code 已将其设为默认 Opus 模型,支持 1M 上下文,fast 模式定价 $10/$50 每百万 token。
【OpenAI】GPT-Live 语音模型上线,ChatGPT Work 向企业推广
GPT-Live 新一代语音模型在 ChatGPT Voice 中上线,支持 Edu、Business 和 Enterprise 计划。ChatGPT Work 模式向企业客户推广,企业用户在 8 月 21 日前注册,团队成员首次试用可获得最高 $200 额度。Work 模式支持云端 Codex 运行、网站登录持久化、定时任务等功能。
GPT-Live in ChatGPT Voice is now available
【Anthropic】阐述开放权重模型立场
Anthropic 官方首次完整阐述对开放权重模型的立场,回应外界猜测。文档详述了公司在模型安全、开放策略等方面的观点。
Anthropic position on open weights models
【OpenAI】推出 Health in ChatGPT 健康功能
Health in ChatGPT 上线,符合条件的美国用户可安全连接医疗记录和 Apple Health 数据,获取个性化健康洞察。功能旨在帮助用户更好地理解自身健康状况。
【OpenAI】发布 Presence 企业级 AI Agent 平台
OpenAI Presence 是企业级 AI Agent 平台,帮助企业部署可信的语音和聊天 Agent,支持客户服务及内部工作流。Agent 可回答问题、调用公司系统、执行已批准操作,并在需要时转接人工。
SWE-bench Verified 排名变动:Claude 4.5 Opus medium 从第 2 名升至第 1 名(79.2%),Claude 4.5 Opus 从第 1 名降至第 2 名。
Terminal Bench 2.0 排名变动:Claude Opus 4.7 从第 3 名升至第 2 名(80.2%),Gemini 3.1 Pro 从第 2 名降至第 3 名。
7月27日
Anthropic 发布开放权重模型立场声明,回应外界对其在开源模型问题上的猜测。
7月24日
Claude Opus 5 发布:定价为 Fable 5 的一半,接近前沿智能水平。Claude Code v2.1.219 已将其设为默认 Opus 模型,支持 1M 上下文,fast 模式定价 $10/$50 per Mtok。
7月22日
Anthropic Economic Index 数据集现可直接在 Claude 中查询,支持询问各职业 AI 使用情况等。
7月20日
Anthropic 推出罕见病研究资助计划,最高提供 $50,000 Claude 使用额度。
7月14日
7月27日
7月24日
7月23日
7月22日
7月21日
7月20日
7月22日
7月21日
Logan Kilpatrick 透露已启动 Gemini 4 预训练,称其为"最雄心勃勃的一次"。
7月17日
Weather Lab 重大更新:分享 Google AI 天气模型的交互式网站。
7月16日
7月14日
| 版本 | 日期 | 主要更新 |
|---|---|---|
| v2.1.220 | 7/25 | Bug 修复与稳定性改进 |
| v2.1.219 | 7/24 | 新增 Claude Opus 5 为默认 Opus 模型 |
| v2.1.218 | 7/22 | /code-review 改为后台子代理运行 |
| v2.1.217 | 7/21 | 新增 emoji 短代码自动补全 |
| v2.1.216 | 7/20 | 新增 sandbox.filesystem.disabled 设置 |
本期无变动。
Top 3(Intelligence):
Top 3(LMArena Overall):
SWE-bench Verified 变化:
Terminal-Bench 2.0 变化:
Top 3(Agentic):
Top 3(Coding):
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Anthropic 开放权重立场声明:在业界持续猜测 Anthropic 对开源模型态度的背景下,公司首次正式回应,时机恰好处于 Claude Opus 5 发布之后,显示其在保持商业机密与回应公众关切之间的平衡考量。
Claude Opus 5 发布:定价为 Fable 5 的一半却接近其前沿智能水平,结合 Boris Cherny 提及的"最难被 prompt inject 的模型"特性,Anthropic 正在性能与安全双线上同时推进。
ChatGPT Work 企业推广:OpenAI 以每人最高 $200 额度的激励推动企业采用,结合已上线的云端浏览器登录态保持功能,显示出从个人工具向企业生产力平台转型的明确意图。