← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-08

2026-07-08 08:32 CST
快速版 完整版

核心速览

【Anthropic】Claude Fable 5 恢复全球上线

Fable 5 在被美国商务部实施出口管制约三周后重新上线。Anthropic 与美国政府达成协议,部署新的分类器阻止更多网络安全任务,部分常规编码和调试任务将回退到 Opus 4.8。公司同时宣布与 Amazon、Microsoft、Google 等合作制定 AI 越狱严重程度评估框架。这是首例前沿 AI 模型因国家安全被管制后重新部署的案例,或将影响未来 AI 模型的监管范式。

Anthropic 官方声明

【OpenAI】预览 GPT-5.6 Sol 模型

GPT-5.6 Sol 是下一代模型,在编码、科学和网络安全能力上更强,配备了最先进的安全技术栈。该模型预览版已发布,正式版上线时间未公布。

Previewing GPT-5.6 Sol

【OpenAI】推出 GeneBench-Pro 基准测试

GeneBench-Pro 是面向基因组学、生物学和科学研究的 AI 基准测试,使用真实复杂数据集。测试任务需要人类专家约 20-40 小时完成,GPT-5.6 Sol 在该基准上表现显著提升。

Introducing GeneBench-Pro

【OpenAI & Broadcom】发布 Jalapeño 推理芯片

Jalapeño 是专为 LLM 推理定制的 AI 芯片,旨在提升 AI 系统的性能、效率和规模化能力。这是 OpenAI 首款与 Broadcom 合作的自研推理芯片。

OpenAI-Broadcom Jalapeño

【Google】扩展 Gemini API Managed Agents 功能

Managed Agents 新增后台任务、远程 MCP 支持等功能,开发者可构建能跨浏览器、移动端和桌面界面操作的自主代理。

Expanding Managed Agents


重大 Benchmark 变化

Kimi K2.6 编程能力大幅跃升

  • AA Coding 排名从第 7 升至第 4,分数从 56.0 提升至 61.8(涨幅 10.4%)
  • AA Intelligence 排名从第 7 升至第 6,分数从 42.8 提升至 44.2

SWE-bench Verified 榜首易主

  • Claude 4.5 Opus medium (20251101) 从第 2 升至第 1(分数 79.2)
  • Claude 4.5 Opus 从第 1 降至第 2(分数 79.2)

Terminal Bench 2.0 排名变动

  • Claude Opus 4.7 从第 3 升至第 2(分数 80.2)
  • Gemini 3.1 Pro 从第 2 降至第 3(分数 80.2)

快速预览

  • Claude Fable 5 恢复全球访问,新增网络安全分类器,部分任务回退至 Opus 4.8
  • OpenAI 公布 GPT-5.6 Sol 预览版,强化代码、科学和网络安全能力
  • Google 推出 Gemini API Managed Agents 功能包,支持后台任务和远程 MCP
  • Claude Code 本周发布 5 个版本,新增登录过期提醒和动态工作流大小设置
  • OpenAI DevDay 2026 申请截止日期为 7 月 10 日

OpenAI

日期 新闻
07-07 Australian Payments Plus moves faster with ChatGPT and Codex — 澳大利亚支付公司使用 ChatGPT Enterprise 和 Codex 提升效率,保持人工判断核心地位
07-07 MUFG aims to become AI-native with OpenAI — 三菱 UFJ 金融集团使用 ChatGPT Enterprise 构建 AI 原生组织
07-06 ChatGPT for iOS 1.2026.181 — 支持在对话中直接创建、搜索、打开、fork 和管理 Codex 任务
06-30 How ChatGPT adoption has expanded — OpenAI Signals 数据显示 ChatGPT 全球使用增长
06-30 Core dump epidemiology: fixing an 18-year-old bug — 工程师通过大规模 core dump 分析发现硬件故障和一个存在 18 年的软件 bug
06-30 Introducing GeneBench-Pro — 新基准测试 AI 在基因组学和生物学研究中的表现
06-29 Mapping Europe's AI Workforce Opportunity — 报告分析 AI 对欧盟就业的影响
06-28 HP Inc. launches Frontier strategic partnership with OpenAI — HP 扩大与 OpenAI 的 Frontier 合作伙伴关系
06-26 Previewing GPT-5.6 Sol — 下一代模型,在代码、科学和网络安全方面更强
06-25 Codex Remote reaches general availability — 可从手机端管理远程 Mac/Windows 上的 Codex 任务
06-25 How agents are transforming work — 研究论文探讨 AI Agent 如何改变工作方式
06-24 OpenAI and Broadcom unveil LLM-optimized inference chip — 推出定制 AI 芯片 Jalapeño,专为 LLM 推理优化

Anthropic

日期 新闻
07-08 Claude Code v2.1.204 released — 修复 headless 会话中 SessionStart hooks 事件不流式传输的问题
07-07 Claude Code v2.1.203 released — 新增登录即将过期警告
07-07 Claude Cowork 滚动更新:Chat 和 Cowork 合并为一个主页标签 — 来源:Mike Krieger
07-07 Fable 5 付费用户访问延长至 7 月 12 日 — 来源:Claude
07-06 Claude Code v2.1.202 released — 新增「动态工作流大小」设置,控制 agent 数量(小/中/大)
07-06 Claude Code 发布历程故事 — 来源:Boris Cherny
07-03 Claude Code v2.1.201 released — Claude Sonnet 5 会话不再使用 mid-conversation system role
07-03 Claude Code v2.1.200 released — AskUserQuestion 对话框默认不再自动继续
07-02 Claude Code Artifacts 扩展至 Pro 和 Max 计划 — 来源:ClaudeDevs
07-01 Fable 5 恢复全球访问,新增网络安全分类器,部分编码调试任务回退至 Opus 4.8 — 来源:Anthropic
07-01 所有用户 5 小时和每周速率限制已重置 — 来源:ClaudeDevs
06-30 Claude Sonnet 5 发布,具备规划、工具使用和自主执行能力 — 来源:Anthropic
06-30 美国商务部解除 Claude Fable 5 和 Mythos 5 出口管制 — 来源:Anthropic
06-27 Mythos 5 恢复对部分美国关键基础设施运营组织的访问 — 来源:Anthropic

Google

日期 新闻
07-07 Expanding Managed Agents in Gemini API — 支持 后台任务、远程 MCP 等功能
07-01 The latest AI news we announced in June 2026 — 6 月 AI 更新汇总
07-01 NYC educators and industry leaders gathered at Google's offices — 150 位教育和行业领袖参加 AI 峰会
06-30 Unlocking Britain's next era of productivity — 英国 AI 培训计划
06-30 Gemini Omni Flash 登顶 Video Arena 榜首,领先第二名 101 Elo — 来源:Design Arena
06-30 Nano Banana 2 Lite 和 Gemini Omni Flash 发布 — 来源:Google DeepMind
06-29 Ask an AI expert: What exactly is the full stack? — AI 全栈基础设施解释
06-25 Gemini 3.5 Flash 支持原生 computer use — 来源:Google DeepMind
06-25 Gemma 4 下载量达 2 亿次(2.5 个月内)— 来源:Google Gemma

Benchmark 快照

行业格局

Intelligence(Artificial Analysis) 本期无变动

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 Gemini 3.5 Flash (high) 50.2

LMArena Overall 本期无变动

排名 模型 分数
1 claude-fable-5 1508.5
2 claude-opus-4-6-thinking 1503.6
3 claude-opus-4-7-thinking 1502.0

干活选型

Agentic(Artificial Analysis) 本期无变动

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.5 (xhigh) 44.9
3 Gemini 3.5 Flash (high) 37.4

Coding(Artificial Analysis) 有变动

排名 模型 分数 变化
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 Gemini 3.5 Flash (high) 70.1
4 Kimi K2.6 61.8 ↑ 从第 7 名,分数 +5.8
5 MiMo-V2.5-Pro 60.2 ↓ 从第 4 名

SWE-bench Pro (Public) 本期无变动

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 claude-opus-4-6 (thinking)* 51.9

SWE-bench Verified 有变动

排名 模型 分数 变化
1 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2 ↑ 从第 2 名
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2 ↓ 从第 1 名
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

Terminal-Bench 2.0 有变动

排名 模型 分数 变化
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2 ↑ 从第 3 名
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2 ↓ 从第 2 名

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

Claude Fable 5 恢复访问是今日最重要动态。Anthropic 在与美国政府进行「一系列富有成效的对话」后重新部署该模型,新增网络安全分类器以阻止相关任务,编码调试回退至 Opus 4.8,同时宣布与 Amazon、Microsoft、Google 等共同制定 AI 越狱评估框架——这标志着前沿模型监管协作进入新阶段。

GPT-5.6 Sol 预览版展示 OpenAI 技术路线。新模型在代码、科学和网络安全三个领域强化能力,与 GeneBench-Pro 基准同时发布,显示 OpenAI 正在构建 AI for Science 的完整评估体系。

Kimi K2.6 在 Coding 榜单跃升 3 位。分数从 56.0 提升至 61.8,超越 MiMo-V2.5-Pro 和 MiniMax-M3,成为国产模型中 coding 能力最强者。

来源 · 86 条