← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-04

2026-07-04 20:52 CST
快速版 完整版

核心速览

【OpenAI】发布 GPT-5.6 Sol/Terra/Luna 三款新模型

OpenAI 推出 GPT-5.6 Sol(前沿模型)、Terra(均衡模型)和 Luna(高速低成本模型)限量预览版。Sol 定位为下一代旗舰模型,面向高性能需求场景。预览页面

【Anthropic】Claude Sonnet 5 发布,Fable 5 重上线

Claude Sonnet 5 具备自主规划、使用浏览器和终端工具的能力,在数月前还需更大更昂贵的模型才能达到同等水平。Fable 5 重新开放使用,用户限制已重置。Sonnet 5 公告 | Fable 5 恢复

【Google DeepMind】Gemini Omni Flash 获 Video Arena 榜首

Gemini Omni Flash 以 Elo 1404 登顶 Video Arena,领先第二名 Seedance 2.0 Mini 达 101 分,这是 Video Arena 历史上最大的领先优势之一。该成绩标志着 Google 在视频生成领域取得领先地位。详情

【Etched】走出隐身,宣布 8 亿美元融资与 10 亿+美元订单

Etched 公布其首款推理芯片机架已完成 A0 流片测试,客户合同超 10 亿美元,融资 8 亿美元。早期测试显示在推理工作负载上达到 SOTA 吞吐量、延迟和能效,首批机架今夏出货。公告

【Karpathy 点评】Claude Tag 代表 LLM 交互的第三次范式转变

Claude Tag 让 Claude 以 Slack 团队成员身份接入,拥有组织级工具和上下文,可异步处理任务。Karpathy 认为这是继"LLM 是网站"和"LLM 是桌面应用"后的第三个 UI/UX 范式:LLM 成为组织中持久、自主的实体。原文


重大 Benchmark 变化

Terminal Bench 2

  • LemonHarness/Multiple:排名从第 8 升至第 2,分数从 79.9 升至 84.5(+5.8%),涨幅显著
  • Warp/Multiple:排名从第 41 跌至第 47-65(分数 61.2→50.1-59.1),跌幅达 18%

SWE-bench Verified

  • Claude 4.5 Opus medium:升至第 1 名(原第 2),分数 79.2
  • Warp:排名从第 11 跌至第 36(分数 75.6→71.0,-6.1%)
  • devlo:排名从第 44 跌至第 83-94(分数 70.2→54.2-58.2,跌幅最高达 23%)

快速预览

  • OpenAI 发布 GPT-5.6 系列预览版,包含 Sol、Terra、Luna 三款新模型
  • Anthropic 推出 Claude Sonnet 5 和 Fable 5,Fable 5 在上线后重置了用户速率限制
  • Google DeepMind 发布 Gemini 3.5 Flash 原生 Computer Use 功能,Gemma 4 下载量 2.5 个月破 2 亿
  • Claude Code 新增 Artifacts 功能并扩展至 Pro/Max 用户,发布 v2.1.200/201 两个版本
  • Etched 完成 8 亿美元融资并公布首批客户合同超 10 亿美元

新闻

Anthropic

日期 新闻
2026-07-03 Epoch AI 报告显示 Claude Mythos Preview 发布前后出现严重漏洞数量激增,HN 讨论
2026-07-03 Claude Code 发布 v2.1.200 和 v2.1.201,前者修改 AskUserQuestion 对话框默认行为,后者修复 Sonnet 5 会话的 system role 问题
2026-07-02 Claude Code 的 Artifacts 功能扩展至 Pro 和 Max 计划用户,可在 claude.ai 实时发布和更新
2026-07-01 Fable 5 重新上线,Anthropic 重置所有用户的 5 小时和每周速率限制

Claude Sonnet 5 于 6 月 30 日发布,定位为"最具代理能力的 Sonnet",支持自主规划、浏览器/终端工具调用,据称其能力达到数月前需要更大更昂贵模型才能实现的水平。

Karpathy 评价 Claude Tag 是 LLM 交互范式的第三次重大变革:从网站 → 应用 → 现在的"团队级异步代理实体"。

OpenAI

日期 新闻
2026-07-02 Codex 社区活动在伦敦举办,开发者 45 分钟内用 Codex 完成闪电演示项目
2026-07-01 Codex 订阅用户全球获得重置机会,庆祝 AI Engineer World's Fair
2026-06-30 发布 GeneBench-Pro,面向生物数据分析代理的研究级基准测试
2026-06-26 发布 GPT-5.6 系列预览:Sol(前沿模型)、Terra(均衡型)、Luna(高吞吐低成本)
2026-06-26 GPT-5.5 Instant 更新,改进意图理解和复杂约束处理

GPT-5.5 Instant 是 ChatGPT 使用量最大的模型,本次更新已向付费用户推送。

Google DeepMind

日期 新闻
2026-07-02 Gemini Omni Flash 以 1404 Elo 登顶 Video Arena 榜首,领先第二名 Seedance 2.0 Mini 101 分
2026-06-30 与 A24 达成研究合作,探索 AI 创作工具与创作者协同
2026-06-26 与 ElevenLabs 合作,在 AI 生成音频中嵌入 SynthID 不可听水印
2026-06-25 Gemma 4 下载量在 2.5 个月内达到 2 亿次,超越 Gemma 全系列发布时的 1 亿次总量

Gemini 3.5 Flash 现已支持原生 Computer Use,开发者可构建跨浏览器、移动端和桌面界面的自定义代理。

其他厂商

厂商 日期 新闻
Etched 2026-06-30 结束隐身模式,首批服务器机架即将出货;已签约 10 亿美元以上客户合同,融资 8 亿美元
xAI 2026-07-02 Grok Build 已集成至 Railway 沙箱环境,可通过 ssh [email protected] 使用
OpenAI Foundation 2026-06-26 加入 Intercept Health Fund 作为创始合作伙伴,投资呼吸系统大流行防控

Benchmark 快照

行业格局

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 Gemini 3.5 Flash (high) 50.2

本期无变动。

干活选型

Agent 榜单:本期无变动。Top 3:Claude Sonnet 5 (46.7) / GPT-5.5 (44.9) / Gemini 3.5 Flash (37.4)

Coding 榜单:本期无变动。Top 3:GPT-5.5 (74.9) / Claude Sonnet 5 (71.5) / Gemini 3.5 Flash (70.1)

SWE-bench Verified 变化

  • Claude 4.5 Opus medium 升至第 1 名(79.2 分),原榜首 Claude 4.5 Opus 降至第 2
  • GPT-5-2 Codex 从第 18 名升至第 16 名
  • Warp 从第 11 名跌至第 36 名(75.6→71.0 分)
  • devlo 从第 44 名跌至第 83 名(70.2→58.2 分)

Terminal-bench 2.0 变化

  • Claude Opus 4.7 升至第 2 名(80.2 分),Gemini 3.1 Pro 降至第 3
  • LemonHarness/Multiple 从第 8 名跃升至第 2 名(79.9→84.5 分)
  • Warp/Multiple 从第 41 名跌至第 47 名(61.2→59.1 分)

LMArena Overall 变化:Qwen 系列多款模型排名微调,qwen3.7-max-preview 升至第 15 名。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评:Claude Sonnet 5 在 Agent 榜单以 46.7 分居首、GPT-5.5 在 Coding 榜单以 74.9 分领先,两家头部厂商已形成差异化竞争格局——Anthropic 聚焦代理工作流,OpenAI 占据代码生成高地。Etched 以专用芯片架构切入推理市场,8 亿美元融资和 10 亿美元合同说明资本押注于"ASIC 取代 GPU"的可能性。

来源 · 50 条