← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-05

2026-07-05 08:48 CST
快速版 完整版

核心速览

【OpenAI】预览 GPT-5.6 Sol 下一代模型

OpenAI 发布 GPT-5.6 Sol 限量预览版,在编程、科学和网络安全能力上有显著提升,配套发布 Terra(均衡型)和 Luna(高速低成本型)两个变体。Sol 配备了最先进的安全技术栈。原文链接:Previewing GPT-5.6 Sol

【Anthropic】Claude Fable 5 重新上线

美国商务部解除出口管制后,Claude Fable 5 恢复全球服务。新版本增加了分类器以阻止更多网络安全任务,部分常规编程和调试任务将回退到 Opus 4.8。Anthropic 同时宣布与亚马逊、微软、谷歌等建立 AI 越狱评估框架合作。原文链接:Anthropic 公告

【Anthropic】发布 Claude Sonnet 5,成为 Claude Code 默认模型

Claude Sonnet 5 现已上线,原生支持 100 万 token 上下文窗口,具备自主规划、浏览器和终端工具使用能力。至 8 月 31 日提供促销定价 $2/$10 per Mtok,已在 Claude Code 2.1.197 版本中设为默认模型。原文链接:Claude Code v2.1.197

【OpenAI】推出 GeneBench-Pro 基因组学基准测试

GeneBench-Pro 是一个新的研究级基准测试,评估 AI 模型处理真实基因组学和生物数据的能力,每个问题需人类专家约 20-40 小时完成。GPT-5.6 Sol 在此基准上表现突出。原文链接:Introducing GeneBench-Pro

【Google DeepMind】Gemini Omni Flash 夺得视频生成榜首

Gemini Omni Flash 在 Video Arena 以 Elo 1404 排名第一,领先第二名 Seedance 2.0 Mini 101 分,这是 Video Arena 历史上最大领先优势之一。Google 同时发布了 Nano Banana 2 Lite 图像模型。原文链接:Google DeepMind 公告


重大 Benchmark 变化

SWE-bench Verified: Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换排名,前者升至第 1 位(79.2%),后者降至第 2 位。两者分数相同,仅排名调整。

Terminal Bench 2.0: Claude Opus 4.7 从第 3 升至第 2(80.2%),Gemini 3.1 Pro 从第 2 降至第 3,两者分数相同。

快速预览

  • Claude Fable 5 解除出口管制重新上线,新增网络安全分类器
  • OpenAI 发布 GeneBench-Pro 基准测试,评估 AI 在基因组学领域的能力
  • Claude Sonnet 5 发布,原生支持 1M token 上下文,成为 Claude Code 默认模型
  • OpenAI 预览 GPT-5.6 Sol/Terra/Luna 新一代模型
  • Gemini Omni Flash 登顶视频生成榜单,领先第二名 101 Elo

Anthropic

Claude Fable 5 恢复上线 (公告)。美国商务部解除出口管制后,Fable 5 于 7 月 1 日重新全球部署,新增网络安全分类器以阻止特定安全任务,部分常规编码调试任务回退至 Opus 4.8 处理。Anthropic 同时宣布与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同起草 AI 越狱评估框架 (详情)。

Claude Sonnet 5 发布 (公告)。原生 1M token 上下文窗口,支持浏览器、终端等工具调用,可自主执行复杂任务。Claude Code 已将其设为默认模型,8 月 31 日前促销定价 $2/$10 per Mtok (changelog)。

Claude Code 近期更新

版本 更新内容
v2.1.201 Sonnet 5 会话不再使用中间系统角色提醒
v2.1.200 AskUserQuestion 对话框默认不再自动继续
v2.1.199 支持堆叠 /skill 调用(最多 5 个)
v2.1.198 子代理默认后台运行

Claude Tag 发布。Claude 可作为团队成员加入 Slack 频道,访问指定频道和工具,支持 @提及 委托任务 (介绍)。


OpenAI

GPT-5.6 系列预览 (公告)。Sol 为前沿模型,编码、科学、网络安全能力更强;Terra 为均衡型;Luna 为快速低成本型。仅限预览。

GeneBench-Pro 基准测试发布 (介绍)。评估 AI 在基因组学、生物学领域的判断能力,问题需人类专家 20-40 小时完成。GPT-5.6 Sol 表现显著提升。

GPT-5.5 Instant 更新。改进意图理解和复杂约束处理,优化购物和本地推荐体验 (公告)。

Codex 更新

  • Codex Remote 正式发布,可从 ChatGPT 移动端启动/审批远程主机任务 (changelog)
  • CLI v0.142.5 修复 WebSocket 请求体日志泄露问题 (changelog)
  • 7 月 15 日将升级快捷键系统 (预告)

企业合作:HP 扩大 Frontier 合作伙伴关系,部署 AI 至客户体验、软件开发和企业运营 (新闻);三星全球部署 ChatGPT Enterprise 和 Codex (案例)。


Google DeepMind

Gemini Omni Flash 登顶视频生成榜。Elo 1404,领先第二名 Seedance 2.0 Mini 达 101 分,为 Video Arena 史上最大差距之一 (来源)。

Gemini 3.5 Flash 原生计算机使用。支持浏览器、移动端、桌面界面操作,开发者可构建自定义代理 (公告)。

Nano Banana 2 Lite 发布。最快最便宜的 Gemini 图像模型 (公告)。

Gemma 4 下载量破 2 亿。2.5 个月内达成,Gemma 家族总下载量从 Gemma 3 发布时的 1 亿翻倍 (来源)。

ElevenLabs 合作 SynthID。在 AI 生成音频中嵌入不可听数字水印,提供免费检测工具 (公告)。


xAI

Grok Build 集成更新

  • Railway 沙箱支持 Grok Build (公告)
  • Vercel AI Gateway 集成 Grok 语音 API(实时语音、TTS、STT)(公告)
  • MongoDB 官方插件,支持数据查询和索引优化 (公告)
  • Firecrawl 插件上线,支持网页抓取 (公告)
  • Interactive Brokers 集成,支持投资组合分析 (公告)
  • /goal 命令支持长时间自主任务执行 (公告)

行业动态

Etched 现身。完成 A0 流片,获 10 亿美元以上客户合同,融资 8 亿美元,首批机架今夏出货,推理吞吐量、延迟、能效达 SOTA (来源)。

Google 与 A24 合作。研究合作确保未来 AI 创作工具由创作者塑造 (公告)。

Project Genie 获戛纳狮子奖。AI Craft 类别大奖 (来源)。


Benchmark

行业格局

Artificial Analysis 综合能力 Top 5

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 Gemini 3.5 Flash (high) 50.2
4 Gemini 3.5 Flash (medium) 45.4
5 MiniMax-M3 44.4

LMArena 总榜 Top 5

排名 模型 Elo
1 claude-fable-5 1508.5
2 claude-opus-4-6-thinking 1503.6
3 claude-opus-4-7-thinking 1502.0
4 claude-opus-4-6 1498.9
5 claude-opus-4-7 1494.0

干活选型

Artificial Analysis 代理能力 Top 5

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.5 (xhigh) 44.9
3 Gemini 3.5 Flash (high) 37.4
4 MiniMax-M3 35.4
5 Nex-N2-Pro 31.0

Artificial Analysis 编码能力 Top 5

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 Gemini 3.5 Flash (high) 70.1
4 MiMo-V2.5-Pro 60.2
5 Nex-N2-Pro 59.1

SWE-bench Pro Public Top 5

排名 模型 分数
1 gpt-5.4 (xHigh) 59.1
2 Muse Spark 55.0
3 claude-opus-4-6 (thinking) 51.9
4 gemini-3.1-pro (thinking) 46.1
5 claude-opus-4-5-20251101 45.9

SWE-bench Verified Top 5

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) 79.2
2 Claude 4.5 Opus 79.2
3 Doubao-Seed-Code 78.8
4 Gemini 3 Pro Preview 77.4
5 Claude 4 Sonnet 76.8

Terminal-Bench 2.0 Top 5

排名 模型 分数
1 GPT-5.5 (NexAU-AHE) 84.7
2 Claude Opus 4.7 (WOZCODE) 80.2
3 Gemini 3.1 Pro (TongAgents) 80.2
4 GPT-5.3-Codex (SageAgent) 78.4
5 Claude Opus 4.6 (Meta-Harness) 76.4

本期变动

  • SWE-bench Verified:Claude 4.5 Opus medium 升至第 1,Claude 4.5 Opus 降至第 2
  • Terminal-Bench 2.0:Claude Opus 4.7 升至第 2,Gemini 3.1 Pro 降至第 3

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

Claude Fable 5 在被美国商务部实施出口管制约两周后即获解除并重新上线,新增的网络安全分类器表明 Anthropic 选择通过技术手段而非模型能力降级来回应安全关切,这为其他前沿模型厂商处理类似监管问题提供了可参考的路径。

Gemini Omni Flash 以 101 分的 Elo 差距登顶视频生成榜,这是 Video Arena 有记录以来最大的领先优势之一,说明 Google 在视频生成领域已建立显著技术代差。

GeneBench-Pro 的发布标志着 AI 基准测试从标准化考试向真实科研场景延伸——问题需人类专家 20-40 小时完成且涉及复杂判断,这种"专家级能力"评估可能是下一阶段模型能力竞争的焦点。

来源 · 104 条