【Anthropic】Claude Fable 5 重新上线 美国商务部解除出口管制后,Claude Fable 5 恢复全球服务。模型新增分类器以阻止网络安全任务,常规编码调试任务将回退至 Opus 4.8。Anthropic 与亚马逊、微软、谷歌等启动 Glasswing 合作框架,制定 AI 越狱严重性评估标准。 原文
【Anthropic】Claude Sonnet 5 发布,Claude Code 默认启用 Sonnet 5 原生支持 100 万 token 上下文,具备更强的代理能力(规划、工具调用、自主执行)。现已作为 Claude Code 默认模型,推广期定价为输入 $2/M token、输出 $10/M token(至 8 月 31 日)。 原文
【OpenAI】GPT-5.6 Sol 预览版发布 新一代前沿模型,在编程、科学和网络安全领域能力增强,配套最新安全栈。同时发布 GPT-5.6 Terra(高效日常模型)和 GPT-5.6 Luna(高吞吐低成本模型)。 原文
【OpenAI】GeneBench-Pro 基准测试发布 专注基因组学和生物学研究的基准测试,评估 AI 在真实科研场景中处理复杂数据、判断分析路径的能力。题目需人类专家约 20-40 小时完成,GPT-5.6 Sol 在此基准上取得显著进展。 原文
【Google DeepMind】Gemini Omni Flash 登顶视频生成榜首 在 Video Arena 排名第一,Elo 分数 1404,领先第二名 Seedance 2.0 Mini 101 分,是视频生成领域迄今最大幅度领先。同时发布 Nano Banana 2 Lite 图像模型。 原文
SWE-bench Verified: Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 排名互换,前者升至第 1,后者降至第 2(分数均为 79.2)。
Terminal Bench 2.0: Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3(分数均为 80.2)。
7 月 1 日
7 月 2 日
6 月 30 日
6 月 29 日
7 月 1 日
6 月 30 日
6 月 29 日
6 月 28 日
6 月 26 日
6 月 25 日
6 月 24 日
7 月 1 日
6 月 30 日
6 月 25 日
6 月 22 日
7 月 2 日
6 月 29 日
6 月 22 日
| 版本 | 日期 | 更新内容 |
|---|---|---|
| v2.1.201 | 7 月 3 日 | Sonnet 5 会话不再在对话中使用系统角色进行 harness 提醒 |
| v2.1.200 | 7 月 3 日 | AskUserQuestion 对话框默认不再自动继续,可通过 /config 启用空闲超时 |
| v2.1.199 | 7 月 2 日 | 支持堆叠 slash-skill 调用(如 /skill-a /skill-b do XYZ),最多加载 5 个技能 |
| v2.1.198 | 7 月 1 日 | 子代理默认后台运行,Claude 在等待时继续工作 |
| v2.1.197 | 6 月 30 日 | 引入 Claude Sonnet 5 为默认模型,原生 1M token 上下文窗口 |
Etched 芯片公司
AI 教育研究
Intelligence(Artificial Analysis)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | Gemini 3.5 Flash (high) | 50.2 |
LMArena Overall
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1508.5 |
| 2 | claude-opus-4-6-thinking | 1503.6 |
| 3 | claude-opus-4-7-thinking | 1502.0 |
本期无变动。
Agentic(Artificial Analysis)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 2 | GPT-5.5 (xhigh) | 44.9 |
| 3 | Gemini 3.5 Flash (high) | 37.4 |
本期无变动。
Coding(Artificial Analysis)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
| 3 | Gemini 3.5 Flash (high) | 70.1 |
本期无变动。
SWE-bench Verified
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
变化:
Terminal-Bench 2.0
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
变化:
Video Arena
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Fable 5 解禁:Fable 5 在被美国商务部实施出口管制约三周后重新上线,新增分类器拦截网络安全任务,部分编程调试回退至 Opus 4.8;Anthropic 同时宣布与政府合作起草越狱严重性评估框架,并与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同制定行业标准,监管协调正在成为前沿模型发布的新常态。
GeneBench-Pro 发布:每道题需人类专家 20-40 小时完成,测试的是 AI 在"混乱数据中选择分析路径并做出判断"的能力,而非标准化的知识问答;GPT-5.6 Sol 在此基准上表现突出,表明 OpenAI 正在将竞争前沿从通用对话推向科研级别的复杂任务。
Gemini Omni Flash 登顶视频生成榜:领先第二名 101 分是 Video Arena 史上最大差距之一,Google 在视频生成领域确立了明显领先地位。