【Anthropic】Claude Fable 5 恢复全球上线
Fable 5 在被美国商务部实施出口管制约三周后重新上线。Anthropic 与美国政府达成协议,部署新的分类器阻止更多网络安全任务,部分常规编码和调试任务将回退到 Opus 4.8。公司同时宣布与 Amazon、Microsoft、Google 等合作制定 AI 越狱严重程度评估框架。这是首例前沿 AI 模型因国家安全被管制后重新部署的案例,或将影响未来 AI 模型的监管范式。
【OpenAI】预览 GPT-5.6 Sol 模型
GPT-5.6 Sol 是下一代模型,在编码、科学和网络安全能力上更强,配备了最先进的安全技术栈。该模型预览版已发布,正式版上线时间未公布。
【OpenAI】推出 GeneBench-Pro 基准测试
GeneBench-Pro 是面向基因组学、生物学和科学研究的 AI 基准测试,使用真实复杂数据集。测试任务需要人类专家约 20-40 小时完成,GPT-5.6 Sol 在该基准上表现显著提升。
【OpenAI & Broadcom】发布 Jalapeño 推理芯片
Jalapeño 是专为 LLM 推理定制的 AI 芯片,旨在提升 AI 系统的性能、效率和规模化能力。这是 OpenAI 首款与 Broadcom 合作的自研推理芯片。
【Google】扩展 Gemini API Managed Agents 功能
Managed Agents 新增后台任务、远程 MCP 支持等功能,开发者可构建能跨浏览器、移动端和桌面界面操作的自主代理。
Kimi K2.6 编程能力大幅跃升
SWE-bench Verified 榜首易主
Terminal Bench 2.0 排名变动
| 日期 | 新闻 |
|---|---|
| 07-07 | Australian Payments Plus moves faster with ChatGPT and Codex — 澳大利亚支付公司使用 ChatGPT Enterprise 和 Codex 提升效率,保持人工判断核心地位 |
| 07-07 | MUFG aims to become AI-native with OpenAI — 三菱 UFJ 金融集团使用 ChatGPT Enterprise 构建 AI 原生组织 |
| 07-06 | ChatGPT for iOS 1.2026.181 — 支持在对话中直接创建、搜索、打开、fork 和管理 Codex 任务 |
| 06-30 | How ChatGPT adoption has expanded — OpenAI Signals 数据显示 ChatGPT 全球使用增长 |
| 06-30 | Core dump epidemiology: fixing an 18-year-old bug — 工程师通过大规模 core dump 分析发现硬件故障和一个存在 18 年的软件 bug |
| 06-30 | Introducing GeneBench-Pro — 新基准测试 AI 在基因组学和生物学研究中的表现 |
| 06-29 | Mapping Europe's AI Workforce Opportunity — 报告分析 AI 对欧盟就业的影响 |
| 06-28 | HP Inc. launches Frontier strategic partnership with OpenAI — HP 扩大与 OpenAI 的 Frontier 合作伙伴关系 |
| 06-26 | Previewing GPT-5.6 Sol — 下一代模型,在代码、科学和网络安全方面更强 |
| 06-25 | Codex Remote reaches general availability — 可从手机端管理远程 Mac/Windows 上的 Codex 任务 |
| 06-25 | How agents are transforming work — 研究论文探讨 AI Agent 如何改变工作方式 |
| 06-24 | OpenAI and Broadcom unveil LLM-optimized inference chip — 推出定制 AI 芯片 Jalapeño,专为 LLM 推理优化 |
| 日期 | 新闻 |
|---|---|
| 07-08 | Claude Code v2.1.204 released — 修复 headless 会话中 SessionStart hooks 事件不流式传输的问题 |
| 07-07 | Claude Code v2.1.203 released — 新增登录即将过期警告 |
| 07-07 | Claude Cowork 滚动更新:Chat 和 Cowork 合并为一个主页标签 — 来源:Mike Krieger |
| 07-07 | Fable 5 付费用户访问延长至 7 月 12 日 — 来源:Claude |
| 07-06 | Claude Code v2.1.202 released — 新增「动态工作流大小」设置,控制 agent 数量(小/中/大) |
| 07-06 | Claude Code 发布历程故事 — 来源:Boris Cherny |
| 07-03 | Claude Code v2.1.201 released — Claude Sonnet 5 会话不再使用 mid-conversation system role |
| 07-03 | Claude Code v2.1.200 released — AskUserQuestion 对话框默认不再自动继续 |
| 07-02 | Claude Code Artifacts 扩展至 Pro 和 Max 计划 — 来源:ClaudeDevs |
| 07-01 | Fable 5 恢复全球访问,新增网络安全分类器,部分编码调试任务回退至 Opus 4.8 — 来源:Anthropic |
| 07-01 | 所有用户 5 小时和每周速率限制已重置 — 来源:ClaudeDevs |
| 06-30 | Claude Sonnet 5 发布,具备规划、工具使用和自主执行能力 — 来源:Anthropic |
| 06-30 | 美国商务部解除 Claude Fable 5 和 Mythos 5 出口管制 — 来源:Anthropic |
| 06-27 | Mythos 5 恢复对部分美国关键基础设施运营组织的访问 — 来源:Anthropic |
| 日期 | 新闻 |
|---|---|
| 07-07 | Expanding Managed Agents in Gemini API — 支持 后台任务、远程 MCP 等功能 |
| 07-01 | The latest AI news we announced in June 2026 — 6 月 AI 更新汇总 |
| 07-01 | NYC educators and industry leaders gathered at Google's offices — 150 位教育和行业领袖参加 AI 峰会 |
| 06-30 | Unlocking Britain's next era of productivity — 英国 AI 培训计划 |
| 06-30 | Gemini Omni Flash 登顶 Video Arena 榜首,领先第二名 101 Elo — 来源:Design Arena |
| 06-30 | Nano Banana 2 Lite 和 Gemini Omni Flash 发布 — 来源:Google DeepMind |
| 06-29 | Ask an AI expert: What exactly is the full stack? — AI 全栈基础设施解释 |
| 06-25 | Gemini 3.5 Flash 支持原生 computer use — 来源:Google DeepMind |
| 06-25 | Gemma 4 下载量达 2 亿次(2.5 个月内)— 来源:Google Gemma |
Intelligence(Artificial Analysis) 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | Gemini 3.5 Flash (high) | 50.2 |
LMArena Overall 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1508.5 |
| 2 | claude-opus-4-6-thinking | 1503.6 |
| 3 | claude-opus-4-7-thinking | 1502.0 |
Agentic(Artificial Analysis) 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 2 | GPT-5.5 (xhigh) | 44.9 |
| 3 | Gemini 3.5 Flash (high) | 37.4 |
Coding(Artificial Analysis) 有变动
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 | — |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 | — |
| 3 | Gemini 3.5 Flash (high) | 70.1 | — |
| 4 | Kimi K2.6 | 61.8 | ↑ 从第 7 名,分数 +5.8 |
| 5 | MiMo-V2.5-Pro | 60.2 | ↓ 从第 4 名 |
SWE-bench Pro (Public) 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
SWE-bench Verified 有变动
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 | ↑ 从第 2 名 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 | ↓ 从第 1 名 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 | — |
Terminal-Bench 2.0 有变动
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 | — |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 | ↑ 从第 3 名 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 | ↓ 从第 2 名 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Fable 5 恢复访问是今日最重要动态。Anthropic 在与美国政府进行「一系列富有成效的对话」后重新部署该模型,新增网络安全分类器以阻止相关任务,编码调试回退至 Opus 4.8,同时宣布与 Amazon、Microsoft、Google 等共同制定 AI 越狱评估框架——这标志着前沿模型监管协作进入新阶段。
GPT-5.6 Sol 预览版展示 OpenAI 技术路线。新模型在代码、科学和网络安全三个领域强化能力,与 GeneBench-Pro 基准同时发布,显示 OpenAI 正在构建 AI for Science 的完整评估体系。
Kimi K2.6 在 Coding 榜单跃升 3 位。分数从 56.0 提升至 61.8,超越 MiMo-V2.5-Pro 和 MiniMax-M3,成为国产模型中 coding 能力最强者。