← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-07

2026-07-07 08:42 CST
快速版 完整版

核心速览

【Anthropic】Claude Fable 5 恢复全球上线

美国商务部解除出口管制,Claude Fable 5 和 Mythos 5 恢复全球访问。Anthropic 与美国政府达成协议,Fable 5 部署了新的分类器以阻止网络安全任务,部分编程调试任务将回退到 Opus 4.8。Anthropic 正与 Amazon、Microsoft、Google 等合作制定 AI 越狱严重程度评估框架。此次监管协调为行业建立了新的安全协作模式。

原文链接

【OpenAI】发布 GPT-5.6 Sol 预览版和 GeneBench-Pro 基准

GPT-5.6 Sol 在编码、科学和网络安全能力上更强,配备最先进的安全栈。同期发布的 GeneBench-Pro 是面向基因组学和生物学的基准测试,题目需人类专家 20-40 小时完成,用于测试 AI 在真实科研场景中的判断力。

GPT-5.6 Sol | GeneBench-Pro

【Anthropic】Claude Sonnet 5 发布,定位"最具代理能力的 Sonnet"

Claude Sonnet 5 具备规划、浏览器和终端工具使用能力,可自主执行任务,性能接近几个月前需要更大更贵模型才能达到的水平。同期 Claude Code 新增 Artifacts 功能支持 Pro 和 Max 用户,可在对话中生成实时更新的独立应用页面。

Sonnet 5 | Claude Code Artifacts

【Google DeepMind】Gemini Omni Flash 登顶视频生成榜首

Gemini Omni Flash 以 Elo 1404 分位居 Video Arena 第一,领先第二名 Seedance 2.0 Mini 101 分,是视频生成领域最大领先幅度之一。同期发布的 Nano Banana 2 Lite 是 Google 最快最便宜的图像模型。

原文链接


重大 Benchmark 变化

新模型上榜:

  • Qwen3.6 27B (Non-reasoning) 进入 AA Agentic 排行榜第 11 名,得分 23.3
  • DeepSeek V3.1 Terminus (Reasoning) 进入 AA Coding 排行榜第 14 名,得分 43.3

排名变动(分数未变):

  • SWE-Bench Verified: Claude 4.5 Opus medium 跃居第 1(原第 2),Claude 4.5 Opus 降至第 2(原第 1)

快速预览

  • Claude Fable 5 解禁重新上线,新增网络安全分类器,部分编程任务将回退到 Opus 4.8
  • Claude Sonnet 5 发布,主打 agentic 能力,在 Artificial Analysis agentic 榜单排名第一
  • OpenAI 发布 GeneBench-Pro,针对基因组学和生物学研究的高难度 AI 基准测试
  • OpenAI 推出 GPT-5.6 Sol 预览版,强化编程、科学和网络安全能力
  • Claude Code 新增动态工作流规模设置,Artifacts 功能扩展至 Pro 和 Max 订阅

新闻

Anthropic

Claude Fable 5 重新上线(7月1日) 美国商务部解除出口管制后,Claude Fable 5 恢复全球访问。Anthropic 与美国政府达成协议,重新部署时新增网络安全任务分类器,短期内部分编程和调试任务将回退到 Opus 4.8。公司还宣布与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同起草 AI 越狱严重性评估框架。来源:Anthropic 公告

Claude Sonnet 5 发布(6月30日) Anthropic 发布 Claude Sonnet 5,称为"最具 agentic 能力的 Sonnet"。新版本具备制定计划、使用浏览器和终端工具、自主执行任务的能力,据称达到了几个月前需要更大更昂贵模型才能实现的水平。来源:Anthropic 公告

Claude Code 更新(7月1日-6日)

  • v2.1.202:新增"动态工作流规模"设置,可控制动态工作流的代理数量
  • v2.1.198:子代理默认后台运行,主代理继续工作
  • Artifacts 功能扩展至 Pro 和 Max 订阅计划
  • 发布 Claude Code 发展历程专题页面 来源:GitHub Releases

OpenAI

GeneBench-Pro 发布(6月30日) OpenAI 推出 GeneBench-Pro,针对基因组学和生物学研究的 AI 基准测试。测试题目需人类专家约 20-40 小时完成,评估模型处理复杂生物数据、选择分析路径和做出判断的能力。来源:OpenAI 博客

GPT-5.6 Sol 预览版(6月26日) OpenAI 预览 GPT-5.6 Sol 模型,在编程、科学和网络安全领域有更强能力,配备最先进的安全技术栈。来源:OpenAI 博客

GPT-5.5 Instant 更新(6月24日) 更新后的 GPT-5.5 Instant 更好地理解问题意图并调整响应,改进复杂约束处理和购物推荐能力。来源:OpenAI 公告

Codex Remote 正式发布(6月25日) Codex Remote 达到 GA,用户可通过 ChatGPT 移动应用在连接的 Mac 或 Windows 主机上启动或继续工作。来源:Codex 更新日志

其他更新

Google

Gemini Omni Flash 视频生成登顶(7月2日) Gemini Omni Flash 在 Video Arena 榜单以 Elo 1404 排名第一,领先第二名 Seedance 2.0 Mini 101 分。来源:Design Arena 公告

Gemma 4 下载量突破 2 亿(6月25日) Gemma 4 在 2.5 个月内达到 2 亿次下载,超过 Gemma 全系列发布时的 1 亿次总量。来源:Google DeepMind 公告

Gemini 3.5 Flash 原生计算机使用(6月25日) Gemini 3.5 Flash 支持原生计算机使用功能,开发者可构建跨浏览器、移动和桌面界面的代理。来源:Google DeepMind 公告

其他更新

其他

Etched 走出隐身(6月30日) AI 芯片公司 Etched 宣布完成 8 亿美元融资,获得超 10 亿美元客户合同,首批机架今夏发货。来源:Etched 公告


行业格局

Artificial Analysis Intelligence 榜单 本期无变动。当前 Top 3:

  1. GPT-5.5 (xhigh) — 54.8 分
  2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 53.4 分
  3. Gemini 3.5 Flash (high) — 50.2 分

LMArena Overall 榜单 本期无变动。当前 Top 3:

  1. Claude Fable 5 — 1508.5 分
  2. Claude Opus 4.6 (thinking) — 1503.6 分
  3. Claude Opus 4.7 (thinking) — 1502.0 分

干活选型

Artificial Analysis Agentic 榜单

变化 模型 分数
新入榜 Qwen3.6 27B (Non-reasoning) 23.3 (#11)
↓14→15 GPT-5 mini (high) 19.4
↓11→12 GPT-5.1 (high) 21.0

当前 Top 3:1. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7 分;2. GPT-5.5 (xhigh) 44.9 分;3. Gemini 3.5 Flash (high) 37.4 分

Artificial Analysis Coding 榜单

变化 模型 分数
新入榜 DeepSeek V3.1 Terminus (Reasoning) 43.3 (#14)

当前 Top 3:1. GPT-5.5 (xhigh) 74.9 分;2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5 分;3. Gemini 3.5 Flash (high) 70.1 分

SWE-bench Verified 榜单

变化 模型 分数
↑2→1 Claude 4.5 Opus medium (20251101) 79.2
↓1→2 Claude 4.5 Opus 79.2

当前 Top 3:1. Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2 分;2. Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2 分;3. Doubao-Seed-Code (scaffold: TRAE) 78.8 分

SWE-bench Pro Public 榜单 本期无变动。当前 Top 3:1. GPT-5.4 (xHigh) 59.1 分;2. Muse Spark 55.0 分;3. Claude Opus 4.6 (thinking) 51.9 分

Terminal-Bench 2.0 榜单

变化 模型 分数
↑3→2 Claude Opus 4.7 80.2
↓2→3 Gemini 3.1 Pro 80.2

当前 Top 3:1. GPT-5.5 (scaffold: NexAU-AHE) 84.7 分;2. Claude Opus 4.7 (scaffold: WOZCODE) 80.2 分;3. Gemini 3.1 Pro (scaffold: TongAgents) 80.2 分

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

  • Claude Fable 5 的解禁是监管与商业平衡的关键案例:新增的网络安全分类器意味着 Anthropic 在模型部署前就预置了特定领域的拦截机制,而非事后修补
  • Sonnet 5 在 agentic 榜单登顶表明中端模型已具备接近高端模型的自主任务能力,可能加速企业对"够用"模型的采用
  • GeneBench-Pro 将生物学研究纳入 AI 评估体系,题目设计为人类专家 20-40 小时工作量,说明 AI 正在被测试解决真正的研究级问题
来源 · 93 条