【Anthropic】Claude Fable 5 恢复全球上线
美国商务部解除出口管制,Claude Fable 5 和 Mythos 5 恢复全球访问。Anthropic 与美国政府达成协议,Fable 5 部署了新的分类器以阻止网络安全任务,部分编程调试任务将回退到 Opus 4.8。Anthropic 正与 Amazon、Microsoft、Google 等合作制定 AI 越狱严重程度评估框架。此次监管协调为行业建立了新的安全协作模式。
【OpenAI】发布 GPT-5.6 Sol 预览版和 GeneBench-Pro 基准
GPT-5.6 Sol 在编码、科学和网络安全能力上更强,配备最先进的安全栈。同期发布的 GeneBench-Pro 是面向基因组学和生物学的基准测试,题目需人类专家 20-40 小时完成,用于测试 AI 在真实科研场景中的判断力。
【Anthropic】Claude Sonnet 5 发布,定位"最具代理能力的 Sonnet"
Claude Sonnet 5 具备规划、浏览器和终端工具使用能力,可自主执行任务,性能接近几个月前需要更大更贵模型才能达到的水平。同期 Claude Code 新增 Artifacts 功能支持 Pro 和 Max 用户,可在对话中生成实时更新的独立应用页面。
Sonnet 5 | Claude Code Artifacts
【Google DeepMind】Gemini Omni Flash 登顶视频生成榜首
Gemini Omni Flash 以 Elo 1404 分位居 Video Arena 第一,领先第二名 Seedance 2.0 Mini 101 分,是视频生成领域最大领先幅度之一。同期发布的 Nano Banana 2 Lite 是 Google 最快最便宜的图像模型。
新模型上榜:
排名变动(分数未变):
Claude Fable 5 重新上线(7月1日) 美国商务部解除出口管制后,Claude Fable 5 恢复全球访问。Anthropic 与美国政府达成协议,重新部署时新增网络安全任务分类器,短期内部分编程和调试任务将回退到 Opus 4.8。公司还宣布与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同起草 AI 越狱严重性评估框架。来源:Anthropic 公告
Claude Sonnet 5 发布(6月30日) Anthropic 发布 Claude Sonnet 5,称为"最具 agentic 能力的 Sonnet"。新版本具备制定计划、使用浏览器和终端工具、自主执行任务的能力,据称达到了几个月前需要更大更昂贵模型才能实现的水平。来源:Anthropic 公告
Claude Code 更新(7月1日-6日)
GeneBench-Pro 发布(6月30日) OpenAI 推出 GeneBench-Pro,针对基因组学和生物学研究的 AI 基准测试。测试题目需人类专家约 20-40 小时完成,评估模型处理复杂生物数据、选择分析路径和做出判断的能力。来源:OpenAI 博客
GPT-5.6 Sol 预览版(6月26日) OpenAI 预览 GPT-5.6 Sol 模型,在编程、科学和网络安全领域有更强能力,配备最先进的安全技术栈。来源:OpenAI 博客
GPT-5.5 Instant 更新(6月24日) 更新后的 GPT-5.5 Instant 更好地理解问题意图并调整响应,改进复杂约束处理和购物推荐能力。来源:OpenAI 公告
Codex Remote 正式发布(6月25日) Codex Remote 达到 GA,用户可通过 ChatGPT 移动应用在连接的 Mac 或 Windows 主机上启动或继续工作。来源:Codex 更新日志
其他更新
Gemini Omni Flash 视频生成登顶(7月2日) Gemini Omni Flash 在 Video Arena 榜单以 Elo 1404 排名第一,领先第二名 Seedance 2.0 Mini 101 分。来源:Design Arena 公告
Gemma 4 下载量突破 2 亿(6月25日) Gemma 4 在 2.5 个月内达到 2 亿次下载,超过 Gemma 全系列发布时的 1 亿次总量。来源:Google DeepMind 公告
Gemini 3.5 Flash 原生计算机使用(6月25日) Gemini 3.5 Flash 支持原生计算机使用功能,开发者可构建跨浏览器、移动和桌面界面的代理。来源:Google DeepMind 公告
其他更新
Etched 走出隐身(6月30日) AI 芯片公司 Etched 宣布完成 8 亿美元融资,获得超 10 亿美元客户合同,首批机架今夏发货。来源:Etched 公告
Artificial Analysis Intelligence 榜单 本期无变动。当前 Top 3:
LMArena Overall 榜单 本期无变动。当前 Top 3:
Artificial Analysis Agentic 榜单
| 变化 | 模型 | 分数 |
|---|---|---|
| 新入榜 | Qwen3.6 27B (Non-reasoning) | 23.3 (#11) |
| ↓14→15 | GPT-5 mini (high) | 19.4 |
| ↓11→12 | GPT-5.1 (high) | 21.0 |
当前 Top 3:1. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7 分;2. GPT-5.5 (xhigh) 44.9 分;3. Gemini 3.5 Flash (high) 37.4 分
Artificial Analysis Coding 榜单
| 变化 | 模型 | 分数 |
|---|---|---|
| 新入榜 | DeepSeek V3.1 Terminus (Reasoning) | 43.3 (#14) |
当前 Top 3:1. GPT-5.5 (xhigh) 74.9 分;2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5 分;3. Gemini 3.5 Flash (high) 70.1 分
SWE-bench Verified 榜单
| 变化 | 模型 | 分数 |
|---|---|---|
| ↑2→1 | Claude 4.5 Opus medium (20251101) | 79.2 |
| ↓1→2 | Claude 4.5 Opus | 79.2 |
当前 Top 3:1. Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2 分;2. Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2 分;3. Doubao-Seed-Code (scaffold: TRAE) 78.8 分
SWE-bench Pro Public 榜单 本期无变动。当前 Top 3:1. GPT-5.4 (xHigh) 59.1 分;2. Muse Spark 55.0 分;3. Claude Opus 4.6 (thinking) 51.9 分
Terminal-Bench 2.0 榜单
| 变化 | 模型 | 分数 |
|---|---|---|
| ↑3→2 | Claude Opus 4.7 | 80.2 |
| ↓2→3 | Gemini 3.1 Pro | 80.2 |
当前 Top 3:1. GPT-5.5 (scaffold: NexAU-AHE) 84.7 分;2. Claude Opus 4.7 (scaffold: WOZCODE) 80.2 分;3. Gemini 3.1 Pro (scaffold: TongAgents) 80.2 分
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
点评