← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-06

2026-07-06 08:34 CST
快速版 完整版

核心速览

【Anthropic】Claude Fable 5 重新上线 美国商务部解除出口管制后,Claude Fable 5 恢复全球服务。模型新增分类器以阻止网络安全任务,常规编码调试任务将回退至 Opus 4.8。Anthropic 与亚马逊、微软、谷歌等启动 Glasswing 合作框架,制定 AI 越狱严重性评估标准。 原文

【Anthropic】Claude Sonnet 5 发布,Claude Code 默认启用 Sonnet 5 原生支持 100 万 token 上下文,具备更强的代理能力(规划、工具调用、自主执行)。现已作为 Claude Code 默认模型,推广期定价为输入 $2/M token、输出 $10/M token(至 8 月 31 日)。 原文

【OpenAI】GPT-5.6 Sol 预览版发布 新一代前沿模型,在编程、科学和网络安全领域能力增强,配套最新安全栈。同时发布 GPT-5.6 Terra(高效日常模型)和 GPT-5.6 Luna(高吞吐低成本模型)。 原文

【OpenAI】GeneBench-Pro 基准测试发布 专注基因组学和生物学研究的基准测试,评估 AI 在真实科研场景中处理复杂数据、判断分析路径的能力。题目需人类专家约 20-40 小时完成,GPT-5.6 Sol 在此基准上取得显著进展。 原文

【Google DeepMind】Gemini Omni Flash 登顶视频生成榜首 在 Video Arena 排名第一,Elo 分数 1404,领先第二名 Seedance 2.0 Mini 101 分,是视频生成领域迄今最大幅度领先。同时发布 Nano Banana 2 Lite 图像模型。 原文

重大 Benchmark 变化

SWE-bench Verified: Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 排名互换,前者升至第 1,后者降至第 2(分数均为 79.2)。

Terminal Bench 2.0: Claude Opus 4.7 从第 3 升至第 2,Gemini 3.1 Pro 从第 2 降至第 3(分数均为 80.2)。

快速预览

  • Claude Fable 5 在被美国商务部实施出口管制约三周后解禁重新上线,新增网络安全任务分类器
  • OpenAI 发布 GeneBench-Pro,测试 AI 模型在基因组学和生物学研究中的判断能力
  • Claude Sonnet 5 发布,成为 Claude Code 默认模型,原生支持 1M token 上下文窗口
  • Gemini Omni Flash 登顶 Video Arena 榜首,领先第二名 101 分
  • Claude Code Artifacts 功能扩展至 Pro 和 Max 计划用户

Anthropic

7 月 1 日

  • Claude Fable 5 恢复全球上线。在与美国政府进行一系列沟通后,Fable 5 重新部署,新增分类器以拦截更多网络安全任务,部分常规编程和调试任务将回退至 Opus 4.8。
  • Anthropic 宣布与美国政府扩大合作,包括模型预发布评估、越狱信息共享和联合研究资源投入。
  • Claude Code 用户 5 小时和每周速率限制已重置。

7 月 2 日

6 月 30 日

  • Claude Sonnet 5 发布,具备规划、浏览器和终端工具调用能力,可在数月前需要更大更贵模型才能完成的任务上自主运行。Claude Code v2.1.197 将其设为默认模型,推广期定价为 $2/$10 per Mtok(至 8 月 31 日)。

6 月 29 日


OpenAI

7 月 1 日

  • OpenAI 发布 GeneBench-Pro,一个研究级基准测试,评估 AI 代理处理混乱生物学数据、选择分析路径和做出判断的能力,每题需人类专家约 20-40 小时完成。GPT-5.6 Sol 在此基准上表现显著提升。

6 月 30 日

  • ChatGPT 采用数据发布:OpenAI Signals 数据显示全球用户使用量增长,探索更多功能,推动跨地区和语言增长。
  • Core dump 流行病学分析:OpenAI 工程师通过大规模 core dump 分析调试罕见基础设施崩溃,发现一个硬件故障和一个潜伏 18 年的软件 bug。

6 月 29 日

  • GPT-5.5 Instant 更新,更好地理解问题意图并调整回答,处理复杂约束更可靠,购物和本地推荐更有用。当日向付费用户推送,次日向免费用户推送。

6 月 28 日

6 月 26 日

  • GPT-5.6 Sol 预览版发布,下一代前沿模型,在编程、科学和网络安全能力更强,配备最先进的安全技术栈。同时发布 GPT-5.6 Terra(平衡型)和 GPT-5.6 Luna(快速低成本型)。

6 月 25 日

  • Codex Remote 正式发布,用户可通过 ChatGPT 移动应用在连接的 Mac 或 Windows 主机上启动或继续工作、查看进度并批准操作。

6 月 24 日


Google / DeepMind

7 月 1 日

6 月 30 日

6 月 25 日

6 月 22 日


xAI

7 月 2 日

6 月 29 日

6 月 22 日


Claude Code 更新

版本 日期 更新内容
v2.1.201 7 月 3 日 Sonnet 5 会话不再在对话中使用系统角色进行 harness 提醒
v2.1.200 7 月 3 日 AskUserQuestion 对话框默认不再自动继续,可通过 /config 启用空闲超时
v2.1.199 7 月 2 日 支持堆叠 slash-skill 调用(如 /skill-a /skill-b do XYZ),最多加载 5 个技能
v2.1.198 7 月 1 日 子代理默认后台运行,Claude 在等待时继续工作
v2.1.197 6 月 30 日 引入 Claude Sonnet 5 为默认模型,原生 1M token 上下文窗口

行业动态

Etched 芯片公司

  • Etched 宣布结束隐身模式,完成 A0 流片,获得超过 10 亿美元客户合同和 8 亿美元融资,首批机架今夏发货,推理吞吐量、延迟和能效达到 SOTA 水平。

AI 教育研究


Benchmark

行业格局

Intelligence(Artificial Analysis)

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 Gemini 3.5 Flash (high) 50.2

LMArena Overall

排名 模型 分数
1 claude-fable-5 1508.5
2 claude-opus-4-6-thinking 1503.6
3 claude-opus-4-7-thinking 1502.0

本期无变动。

干活选型

Agentic(Artificial Analysis)

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.5 (xhigh) 44.9
3 Gemini 3.5 Flash (high) 37.4

本期无变动。

Coding(Artificial Analysis)

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 Gemini 3.5 Flash (high) 70.1

本期无变动。

SWE-bench Verified

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

变化:

  • Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名
  • Claude 4.5 Opus 从第 1 名降至第 2 名
  • GPT-5-2 Codex 从第 18 名升至第 16 名

Terminal-Bench 2.0

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

变化:

  • Claude Opus 4.7 从第 3 名升至第 2 名
  • Gemini 3.1 Pro 从第 2 名降至第 3 名

Video Arena

  • Gemini Omni Flash 以 1404 Elo 登顶,领先第二名 Seedance 2.0 Mini 101 分,为 Video Arena 史上最大领先幅度之一。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

Claude Fable 5 解禁:Fable 5 在被美国商务部实施出口管制约三周后重新上线,新增分类器拦截网络安全任务,部分编程调试回退至 Opus 4.8;Anthropic 同时宣布与政府合作起草越狱严重性评估框架,并与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同制定行业标准,监管协调正在成为前沿模型发布的新常态。

GeneBench-Pro 发布:每道题需人类专家 20-40 小时完成,测试的是 AI 在"混乱数据中选择分析路径并做出判断"的能力,而非标准化的知识问答;GPT-5.6 Sol 在此基准上表现突出,表明 OpenAI 正在将竞争前沿从通用对话推向科研级别的复杂任务。

Gemini Omni Flash 登顶视频生成榜:领先第二名 101 分是 Video Arena 史上最大差距之一,Google 在视频生成领域确立了明显领先地位。

来源 · 98 条