← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-04 00:45

2026-07-04 08:45 CST
快速版 完整版

核心速览

【Anthropic】Claude Fable 5 重新上线 美国商务部解除出口管制后,Claude Fable 5 和 Mythos 5 恢复全球访问。Anthropic 新增分类器阻止网络安全任务滥用,常规编程任务回退至 Opus 4.8。公司与亚马逊、微软、谷歌等共建 AI 越狱评估框架。重要:这标志着监管与合作的新模式。 https://x.com/AnthropicAI/status/2072163884430229756

【Anthropic】Claude Sonnet 5 发布,成为默认模型 Claude Sonnet 5 正式发布,具备 100 万 token 上下文窗口,支持自主规划、工具调用(浏览器、终端),成为 Claude Code 默认模型。至 8 月 31 日享促销定价 $2/$10 per Mtok。重要:中端模型首次达到此前高端模型的智能体能力。 https://github.com/anthropics/claude-code/releases/tag/v2.1.197

【OpenAI】发布 GPT-5.6 Sol 预览版 GPT-5.6 Sol 在编程、科学、网络安全领域能力显著增强,配套最先进的安全技术栈。同步推出 GeneBench-Pro 基准测试,评估 AI 在基因组学和生物学研究中的判断分析能力,问题需人类专家 20-40 小时完成。重要:OpenAI 持续强化科学推理能力。 https://openai.com/index/previewing-gpt-5-6-sol

【OpenAI】HP 扩大 Frontier 战略合作 HP Inc. 将 OpenAI Frontier 合作扩展至客户体验、软件开发和企业运营全场景,成为 OpenAI 重要的企业级部署案例。重要:企业级 AI 采用持续加速。 https://openai.com/index/hp-frontier-partnership

【Google DeepMind】Gemini Omni Flash 登顶 Video Arena Gemini Omni Flash 以 Elo 1404 首登 Video Arena 榜首,领先第二名 Seedance 2.0 Mini 达 101 分,创该榜单史上最大跃升。同步发布 Nano Banana 2 Lite 图像模型。重要:Google 确立视频生成领域领先地位。 https://x.com/demishassabis/status/2072833056004522440


重大 Benchmark 变化

LMArena Overall

  • Gemini 3.5 Flash 排名从第 13 位升至第 11 位,分数从 1476.4 升至 1479.5(+0.2%)
  • Claude Sonnet 5 Thinking 新模型入榜,排名第 32 位,得分 1464.3
  • Claude Opus 4.8 排名从第 11 位降至第 13 位,分数从 1479.1 降至 1476.5(-0.2%)
  • GLM-5.1 排名从第 19 位降至第 22 位,分数下降 0.1%

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B 排名从第 103 位跃升至第 76 位,分数从 52.2% 升至 60.4%(+8.2 个百分点)
  • Warp 排名从第 11 位骤降至第 36 位,分数从 75.6% 降至 71.0%(-4.6 个百分点)
  • devlo 排名从第 44 位跌至第 94 位,分数从 70.2% 降至 54.2%(-16 个百分点)

Terminal Bench 2.0

  • LemonHarness / Multiple 排名从第 8 位飙升至第 2 位,分数从 79.9% 升至 84.5%(+4.6 个百分点)

快速预览

  • Claude Fable 5 恢复上线:美国商务部解除出口管制,Anthropic 重新部署并加强网络安全分类器
  • Claude Sonnet 5 发布:成为 Claude Code 默认模型,原生 1M token 上下文,推广价 $2/$10 per Mtok
  • OpenAI 发布 GPT-5.6 Sol 预览版:编码、科学、网络安全能力增强,推出 GeneBench-Pro 基准测试
  • SWE-Bench Pro 公开榜单:GPT-5.4 (xHigh) 以 59.1% 居首,Claude Opus 4-6 (thinking) 51.9% 第三
  • LM Arena 榜单:Claude Fable 5 以 1508.5 Elo 排名第一,Gemini 3.5 Flash 跃升至第 11 名

新闻

OpenAI

日期 新闻
2026-06-30 ChatGPT 采用扩展数据:全球用户使用增长,探索更多功能
2026-06-30 GeneBench-Pro 发布:基因组学、生物学研究新基准
2026-06-30 Core dump 流行病学调试:发现 18 年历史软件漏洞
2026-06-29 欧洲 AI 劳动力报告:分析欧盟工作岗位自动化影响
2026-06-28 HP Frontier 战略合作:在企业运营部署 AI
2026-06-26 GPT-5.6 Sol 预览版:编码、科学、网络安全能力增强
2026-06-25 AI 代理工作报告:扩展生产力
2026-06-24 与 Broadcom 推出 Jalapeño 推理芯片:LLM 优化推理芯片
2026-06-23 GPT-5 助力免疫学突破:解决 3 年 T 细胞行为谜题
2026-06-22 Daybreak 安全工具:Codex Security 和 GPT-5.5-Cyber 漏洞修复
2026-06-21 三星部署 ChatGPT Enterprise:最大规模企业 AI 部署之一

Codex 更新CLI 0.142.5(日志安全修复)、Remote 正式发布(手机远程控制)。

Anthropic

日期 新闻
2026-07-01 Fable 5 恢复全球上线:新增网络安全分类器,部分编码任务回退至 Opus 4.8
2026-07-01 出口管制解除公告:与美政府合作制定 AI 越狱评估框架
2026-06-30 Claude Sonnet 5 发布:最强代理能力 Sonnet 模型
2026-06-27 Mythos 5 部分恢复:向关键基础设施组织开放
2026-06-25 加入 RAISE US 联盟:推动美国劳动力 AI 转型
2026-06-23 Claude Tag 发布:Slack 团队协作新方式

Claude Code 版本更新v2.1.201(Sonnet 5 系统角色修复)、v2.1.200(AskUserQuestion 不再自动继续)、v2.1.199(技能堆叠支持)、v2.1.198(子代理后台运行)、v2.1.197(Sonnet 5 默认模型)。

Artifacts 功能扩展Pro 和 Max 计划现已支持,代码实时发布至 claude.ai。

Google

日期 新闻
2026-07-01 6 月 AI 更新汇总
2026-07-01 纽约 AI 教育峰会:150 位教育行业领袖参与
2026-06-30 英国生产力计划
2026-06-29 AI 全栈解析
2026-06-25 Google Finance 升级:新应用发布

Gemma 4下载量突破 2 亿(2.5 个月内)。

Gemini Omni FlashVideo Arena 排名第一,Elo 1404,领先第二名 101 分。

xAI

日期 新闻
2026-07-02 Grok Build 登陆 Railway 沙盒
2026-06-29 Grok 语音 API 登陆 Vercel AI Gateway
2026-06-25 SuperGrok/X 订阅支持 T3code
2026-06-24 MongoDB 官方插件:数据库查询优化
2026-06-23 Firecrawl 插件上架:网页抓取
2026-06-22 Interactive Brokers 集成:投资组合分析
2026-06-22 /goal 功能:长时自主任务执行

Benchmark 快照

SWE-Bench Verified (本期无变动)

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

来源:GitHub

SWE-Bench Pro Public

排名 模型 分数
1 GPT-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 Claude Opus 4-6 (thinking)* 51.9

来源:Scale Labs

Terminal Bench 2.0 (本期无变动)

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

来源:TBench

LM Arena Overall

排名 模型 分数
1 Claude Fable 5 1508.5
2 Claude Opus 4-6 Thinking 1503.6
3 Claude Opus 4-7 Thinking 1502.0

来源:HuggingFace


榜单变化

LM Arena Overall

新模型入场

  • Claude Sonnet 5 Thinking:第 32 名,1464.3

显著上升

模型 旧排名 → 新排名 分数变化
Gemini 3.5 Flash 13 → 11 +3.0
Gemini 3 Flash 20 → 19 -
Claude Opus 4-5-20251101 Thinking-32k 21 → 20 -
Qwen 3.7 Max Preview 16 → 15 -

显著下降

模型 旧排名 → 新排名 分数变化
Claude Opus 4-8 11 → 13 -2.5
GLM 5.1 19 → 22 -1.2
GLM 5.2 (max) 25 → 26 -1.2
Grok 4.20 Beta Reasoning 15 → 17 -0.9
Mimo V2 Omni 73 → 76 -1.1
Qwen 3.7 Plus 32 → 33 -1.3

SWE-Bench Verified

显著变化

模型 旧排名 → 新排名 分数变化
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 103 → 76 +8.2
Warp 11 → 36 -4.6
Nemotron-CORTEXA 50 → 82 -10.0
Devlo 44 → 83 -12.0

Terminal Bench 2.0

显著变化

模型 旧排名 → 新排名 分数变化
LemonHarness / Multiple 8 → 2 +4.6
Gemini CLI / Gemini 3.1 Pro 45 → 40 +2.0
Warp / Multiple 41 → 65 -11.1
来源 · 64 条