【OpenAI】预览 GPT-5.6 Sol 下一代模型
OpenAI 发布 GPT-5.6 Sol 限量预览版,在编程、科学和网络安全能力上有显著提升,配套发布 Terra(均衡型)和 Luna(高速低成本型)两个变体。Sol 配备了最先进的安全技术栈。原文链接:Previewing GPT-5.6 Sol
【Anthropic】Claude Fable 5 重新上线
美国商务部解除出口管制后,Claude Fable 5 恢复全球服务。新版本增加了分类器以阻止更多网络安全任务,部分常规编程和调试任务将回退到 Opus 4.8。Anthropic 同时宣布与亚马逊、微软、谷歌等建立 AI 越狱评估框架合作。原文链接:Anthropic 公告
【Anthropic】发布 Claude Sonnet 5,成为 Claude Code 默认模型
Claude Sonnet 5 现已上线,原生支持 100 万 token 上下文窗口,具备自主规划、浏览器和终端工具使用能力。至 8 月 31 日提供促销定价 $2/$10 per Mtok,已在 Claude Code 2.1.197 版本中设为默认模型。原文链接:Claude Code v2.1.197
【OpenAI】推出 GeneBench-Pro 基因组学基准测试
GeneBench-Pro 是一个新的研究级基准测试,评估 AI 模型处理真实基因组学和生物数据的能力,每个问题需人类专家约 20-40 小时完成。GPT-5.6 Sol 在此基准上表现突出。原文链接:Introducing GeneBench-Pro
【Google DeepMind】Gemini Omni Flash 夺得视频生成榜首
Gemini Omni Flash 在 Video Arena 以 Elo 1404 排名第一,领先第二名 Seedance 2.0 Mini 101 分,这是 Video Arena 历史上最大领先优势之一。Google 同时发布了 Nano Banana 2 Lite 图像模型。原文链接:Google DeepMind 公告
SWE-bench Verified: Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换排名,前者升至第 1 位(79.2%),后者降至第 2 位。两者分数相同,仅排名调整。
Terminal Bench 2.0: Claude Opus 4.7 从第 3 升至第 2(80.2%),Gemini 3.1 Pro 从第 2 降至第 3,两者分数相同。
Claude Fable 5 恢复上线 (公告)。美国商务部解除出口管制后,Fable 5 于 7 月 1 日重新全球部署,新增网络安全分类器以阻止特定安全任务,部分常规编码调试任务回退至 Opus 4.8 处理。Anthropic 同时宣布与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同起草 AI 越狱评估框架 (详情)。
Claude Sonnet 5 发布 (公告)。原生 1M token 上下文窗口,支持浏览器、终端等工具调用,可自主执行复杂任务。Claude Code 已将其设为默认模型,8 月 31 日前促销定价 $2/$10 per Mtok (changelog)。
Claude Code 近期更新:
| 版本 | 更新内容 |
|---|---|
| v2.1.201 | Sonnet 5 会话不再使用中间系统角色提醒 |
| v2.1.200 | AskUserQuestion 对话框默认不再自动继续 |
| v2.1.199 | 支持堆叠 /skill 调用(最多 5 个) |
| v2.1.198 | 子代理默认后台运行 |
Claude Tag 发布。Claude 可作为团队成员加入 Slack 频道,访问指定频道和工具,支持 @提及 委托任务 (介绍)。
GPT-5.6 系列预览 (公告)。Sol 为前沿模型,编码、科学、网络安全能力更强;Terra 为均衡型;Luna 为快速低成本型。仅限预览。
GeneBench-Pro 基准测试发布 (介绍)。评估 AI 在基因组学、生物学领域的判断能力,问题需人类专家 20-40 小时完成。GPT-5.6 Sol 表现显著提升。
GPT-5.5 Instant 更新。改进意图理解和复杂约束处理,优化购物和本地推荐体验 (公告)。
Codex 更新:
企业合作:HP 扩大 Frontier 合作伙伴关系,部署 AI 至客户体验、软件开发和企业运营 (新闻);三星全球部署 ChatGPT Enterprise 和 Codex (案例)。
Gemini Omni Flash 登顶视频生成榜。Elo 1404,领先第二名 Seedance 2.0 Mini 达 101 分,为 Video Arena 史上最大差距之一 (来源)。
Gemini 3.5 Flash 原生计算机使用。支持浏览器、移动端、桌面界面操作,开发者可构建自定义代理 (公告)。
Nano Banana 2 Lite 发布。最快最便宜的 Gemini 图像模型 (公告)。
Gemma 4 下载量破 2 亿。2.5 个月内达成,Gemma 家族总下载量从 Gemma 3 发布时的 1 亿翻倍 (来源)。
ElevenLabs 合作 SynthID。在 AI 生成音频中嵌入不可听数字水印,提供免费检测工具 (公告)。
Grok Build 集成更新:
/goal 命令支持长时间自主任务执行 (公告)Etched 现身。完成 A0 流片,获 10 亿美元以上客户合同,融资 8 亿美元,首批机架今夏出货,推理吞吐量、延迟、能效达 SOTA (来源)。
Google 与 A24 合作。研究合作确保未来 AI 创作工具由创作者塑造 (公告)。
Project Genie 获戛纳狮子奖。AI Craft 类别大奖 (来源)。
Artificial Analysis 综合能力 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | Gemini 3.5 Flash (high) | 50.2 |
| 4 | Gemini 3.5 Flash (medium) | 45.4 |
| 5 | MiniMax-M3 | 44.4 |
LMArena 总榜 Top 5:
| 排名 | 模型 | Elo |
|---|---|---|
| 1 | claude-fable-5 | 1508.5 |
| 2 | claude-opus-4-6-thinking | 1503.6 |
| 3 | claude-opus-4-7-thinking | 1502.0 |
| 4 | claude-opus-4-6 | 1498.9 |
| 5 | claude-opus-4-7 | 1494.0 |
Artificial Analysis 代理能力 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 2 | GPT-5.5 (xhigh) | 44.9 |
| 3 | Gemini 3.5 Flash (high) | 37.4 |
| 4 | MiniMax-M3 | 35.4 |
| 5 | Nex-N2-Pro | 31.0 |
Artificial Analysis 编码能力 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
| 3 | Gemini 3.5 Flash (high) | 70.1 |
| 4 | MiMo-V2.5-Pro | 60.2 |
| 5 | Nex-N2-Pro | 59.1 |
SWE-bench Pro Public Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh) | 59.1 |
| 2 | Muse Spark | 55.0 |
| 3 | claude-opus-4-6 (thinking) | 51.9 |
| 4 | gemini-3.1-pro (thinking) | 46.1 |
| 5 | claude-opus-4-5-20251101 | 45.9 |
SWE-bench Verified Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) | 79.2 |
| 2 | Claude 4.5 Opus | 79.2 |
| 3 | Doubao-Seed-Code | 78.8 |
| 4 | Gemini 3 Pro Preview | 77.4 |
| 5 | Claude 4 Sonnet | 76.8 |
Terminal-Bench 2.0 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (TongAgents) | 80.2 |
| 4 | GPT-5.3-Codex (SageAgent) | 78.4 |
| 5 | Claude Opus 4.6 (Meta-Harness) | 76.4 |
本期变动:
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Fable 5 在被美国商务部实施出口管制约两周后即获解除并重新上线,新增的网络安全分类器表明 Anthropic 选择通过技术手段而非模型能力降级来回应安全关切,这为其他前沿模型厂商处理类似监管问题提供了可参考的路径。
Gemini Omni Flash 以 101 分的 Elo 差距登顶视频生成榜,这是 Video Arena 有记录以来最大的领先优势之一,说明 Google 在视频生成领域已建立显著技术代差。
GeneBench-Pro 的发布标志着 AI 基准测试从标准化考试向真实科研场景延伸——问题需人类专家 20-40 小时完成且涉及复杂判断,这种"专家级能力"评估可能是下一阶段模型能力竞争的焦点。