← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-03 00:34

2026-07-03 08:34 CST
快速版 完整版

核心速览

【Anthropic】Claude Fable 5 恢复全球访问

美国商务部解除对 Claude Fable 5 和 Mythos 5 的出口管制,Anthropic 重新部署模型并新增分类器阻止网络安全滥用。部分常规任务将回退至 Opus 4.8,公司正与政府、Amazon、Microsoft、Google 等合作制定 AI 越狱评估框架。这是继 6 月 12 日管制以来的重大进展。 https://x.com/AnthropicAI/status/2072163884430229756

【Anthropic】Claude Sonnet 5 发布,成为 Claude Code 默认模型

Claude Sonnet 5 现为 Claude Code 默认模型,具备原生 100 万 token 上下文窗口,可自主规划、使用浏览器和终端工具。推广期定价为输入 $2/输出 $10 每百万 token(至 8 月 31 日),性能接近数月前更大更昂贵的模型。 https://github.com/anthropics/claude-code/releases/tag/v2.1.197

【OpenAI】GPT-5.6 Sol 预览版发布

OpenAI 发布下一代模型 GPT-5.6 Sol,在编程、科学和网络安全领域能力显著增强,配备最先进的安全技术栈。该模型在 GeneBench-Pro 基准测试中表现突出,标志着 AI 在基因组学和科学研究领域的重要进步。 https://openai.com/index/previewing-gpt-5-6-sol

【OpenAI】GeneBench-Pro 基准测试发布

OpenAI 推出 GeneBench-Pro,专为测试 AI 在基因组学、生物学和科学研究中的表现而设计,使用真实复杂数据集。测试问题需人类专家约 20-40 小时完成,GPT-5.6 Sol 在此基准上取得重大突破。 https://openai.com/index/introducing-genebench-pro

【Google DeepMind】Gemini Omni Flash 登顶视频生成榜首

Gemini Omni Flash 以 Elo 1404 分位居 Video Arena 第一,领先第二名 Seedance 2.0 Mini 101 分,创下视频生成领域最大领先幅度纪录。Google 同时发布 Nano Banana 2 Lite 图像模型。 https://x.com/demishassabis/status/2072833056004522440


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 提升至 60.4(+8.2分,上升27名)
  • Warp:排名从 11 跌至 36,分数从 75.6 降至 71.0(-4.6分,下降25名)
  • devlo:排名从 44 跌至 83,分数从 70.2 降至 58.2(-12.0分,下降39名)
  • Nemotron-CORTEXA:排名从 50 跌至 82,分数从 68.2 降至 58.2(-10.0分,下降32名)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至第 2,分数从 79.9 提升至 84.5(+4.6分,上升6名)
  • Warp / Multiple:排名从 41 跌至 65,分数从 61.2 降至 50.1(-11.1分,下降24名)

快速预览

  • OpenAI 预览 GPT-5.6 Sol:下一代模型,强化编程、科学和网络安全能力,同步发布 GeneBench-Pro 基因组学基准测试 (来源)
  • Claude Fable 5 恢复上线:美国商务部解除出口管制,Anthropic 重新部署并新增网络安全任务分类器 (来源)
  • Claude Sonnet 5 发布:成为 Claude Code 默认模型,原生 1M token 上下文窗口,促销价 $2/$10 per Mtok (来源)
  • SWE-Bench Pro Public 榜单:GPT-5.4 (xHigh) 以 59.1 分居首,Muse Spark 55.0 分第二,Claude Opus 4.6 (thinking) 51.9 分第三
  • Terminal Bench 2 变化:LemonHarness/Multiple 从第 8 名跃升至第 2 名(79.9→84.5 分),Warp/Multiple 排名下滑

新闻

OpenAI

日期 新闻
06-30 How ChatGPT adoption has expanded — 新数据显示 ChatGPT 全球使用增长,用户增加使用频率并探索更多功能
06-30 Introducing GeneBench-Pro — 新基准测试 AI 在基因组学、生物学和科研领域的表现,使用真实复杂数据集
06-30 Core dump epidemiology — 工程师通过大规模 core dump 分析发现硬件故障和 18 年历史的软件 bug
06-29 Mapping Europe's AI Workforce Opportunity — 报告分析 AI 如何重塑欧盟就业,识别面临自动化、增长或工作流变化的职业
06-28 HP Inc. launches Frontier strategic partnership — HP 扩大与 OpenAI 的 Frontier 合作,在客户体验、软件开发和企业运营中部署 AI
06-26 Previewing GPT-5.6 Sol — 预览下一代模型,强化编程、科学和网络安全能力,配备最先进的安全栈
06-25 How agents are transforming work — 研究论文展示 AI Agent 如何处理更长、更复杂的任务
06-24 OpenAI and Broadcom unveil LLM-optimized inference chip — 发布 Jalapeño 定制 AI 芯片,专为 LLM 推理优化
06-23 How GPT-5 helped immunologist solve mystery — GPT-5 Pro 协助解决 3 年免疫学难题,或助力癌症和自身免疫研究
06-22 Daybreak: Tools for securing every organization — 发布 Daybreak 安全工具,包括 Codex Security 和 GPT-5.5-Cyber
06-22 Patch the Planet — Daybreak 计划帮助开源维护者发现、验证和修复漏洞
06-21 Samsung Electronics brings ChatGPT and Codex — 三星向全球员工部署 ChatGPT Enterprise 和 Codex,为最大规模企业 AI 部署之一

Codex 更新

  • 07-01: Codex CLI 0.142.5 — 防止完整 WebSocket 响应写入日志
  • 06-25: Codex Remote GA — 正式发布,支持从 ChatGPT 移动端操作远程 Mac/Windows

Anthropic

日期 新闻
07-02 Claude Code v2.1.199 — 支持堆叠 slash-skill 调用(最多加载 5 个 skill)
07-01 Claude Code v2.1.198 — 子 Agent 默认后台运行
06-30 Claude Sonnet 5 发布 — 成为 Claude Code 默认模型,原生 1M token 上下文
06-29 Claude Code v2.1.196 — 支持组织默认模型设置
07-01 Fable 5 恢复上线 — 商务部解除出口管制,新增网络安全任务分类器,部分编码任务回退至 Opus 4.8
06-30 商务部解除 Mythos 5 和 Fable 5 出口管制
06-27 Mythos 5 向关键基础设施组织恢复访问
06-25 加入 RAISE US 联盟 — 作为创始伙伴,支持美国劳动力 AI 转型
06-23 Claude Tag 发布 — Slack 中 Claude 作为团队成员加入频道

Google

日期 新闻
07-01 June 2026 AI updates — 6 月 Pixel Drop 更新汇总
07-01 NYC AI Education Summit — 与纽约教育界探讨 AI 在课堂的应用
06-30 UK AI Trailblazers — 英国 AI 生产力计划
06-29 Full-stack AI explainer — 解释 AI 全栈基础设施
06-25 Google Finance updates — Google Finance 新功能和新应用
06-30 Gemini Omni Flash + Nano Banana 2 Lite — 发布视频生成模型和最快图像模型
07-02 Gemini Omni Flash 登顶 Video Arena — Elo 1404,领先第二名 101 分
06-25 Gemma 4 下载量破 2 亿 — 2.5 个月内达成

xAI

日期 新闻
07-02 Grok Build 登陆 Railway sandboxes
06-29 Grok 语音 API 登陆 Vercel AI Gateway — 支持 realtime voice、TTS、STT
06-25 SuperGrok 和 X 订阅支持 T3code
06-24 MongoDB 官方插件上线 Grok Build
06-23 Firecrawl 插件上线 Grok Build Plugin Marketplace
06-22 Interactive Brokers 集成 — 支持投资组合分析
06-22 /goal 命令发布 — 支持长时间自主任务执行

Benchmark 快照

SWE-Bench Verified

本期无变动。当前 Top 3:

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

来源:GitHub

SWE-Bench Pro Public

本期无变动。当前 Top 3:

排名 模型 分数
1 GPT-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 Claude Opus 4.6 (thinking)* 51.9

来源:Scale Labs

Terminal Bench 2

有变化

模型 变化
LemonHarness / Multiple 排名 8→2,分数 79.9→84.5 ⬆️
Gemini CLI / Gemini 3.1 Pro 排名 45→40,分数 59.4→61.4 ⬆️
Warp / Multiple 排名 41→65,分数 61.2→50.1 ⬇️
little-coder / Qwen3.6-35B-A3B 排名 121→116,分数 23.0→24.6 ⬆️

当前 Top 3:

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

来源:TBench

LM Arena Overall

本期无变动。当前 Top 3:

排名 模型 Elo
1 Claude Fable 5 1508.16
2 Claude Opus 4.6 (thinking) 1503.09
3 Claude Opus 4.7 (thinking) 1502.31

来源:HuggingFace

SWE-Bench Verified 变化详情

模型 变化
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 排名 103→76,分数 52.2→60.4 ⬆️
Nemotron-CORTEXA 排名 50→82,分数 68.2→58.2 ⬇️
Warp 排名 11→36,分数 75.6→71.0 ⬇️
devlo 排名 44→83/94,分数 70.2→58.2/54.2 ⬇️
EPAM AI/Run Developer Agent + GPT4o 排名 156→162,分数 27.0→24.0 ⬇️
Solver (2024-09-12) 排名 120→126,分数 45.4→43.6 ⬇️
来源 · 65 条