【OpenAI】发布 GPT-5.6 Sol/Terra/Luna 三款新模型
OpenAI 推出 GPT-5.6 Sol(前沿模型)、Terra(均衡模型)和 Luna(高速低成本模型)限量预览版。Sol 定位为下一代旗舰模型,面向高性能需求场景。预览页面
【Anthropic】Claude Sonnet 5 发布,Fable 5 重上线
Claude Sonnet 5 具备自主规划、使用浏览器和终端工具的能力,在数月前还需更大更昂贵的模型才能达到同等水平。Fable 5 重新开放使用,用户限制已重置。Sonnet 5 公告 | Fable 5 恢复
【Google DeepMind】Gemini Omni Flash 获 Video Arena 榜首
Gemini Omni Flash 以 Elo 1404 登顶 Video Arena,领先第二名 Seedance 2.0 Mini 达 101 分,这是 Video Arena 历史上最大的领先优势之一。该成绩标志着 Google 在视频生成领域取得领先地位。详情
【Etched】走出隐身,宣布 8 亿美元融资与 10 亿+美元订单
Etched 公布其首款推理芯片机架已完成 A0 流片测试,客户合同超 10 亿美元,融资 8 亿美元。早期测试显示在推理工作负载上达到 SOTA 吞吐量、延迟和能效,首批机架今夏出货。公告
【Karpathy 点评】Claude Tag 代表 LLM 交互的第三次范式转变
Claude Tag 让 Claude 以 Slack 团队成员身份接入,拥有组织级工具和上下文,可异步处理任务。Karpathy 认为这是继"LLM 是网站"和"LLM 是桌面应用"后的第三个 UI/UX 范式:LLM 成为组织中持久、自主的实体。原文
Terminal Bench 2
SWE-bench Verified
| 日期 | 新闻 |
|---|---|
| 2026-07-03 | Epoch AI 报告显示 Claude Mythos Preview 发布前后出现严重漏洞数量激增,HN 讨论 |
| 2026-07-03 | Claude Code 发布 v2.1.200 和 v2.1.201,前者修改 AskUserQuestion 对话框默认行为,后者修复 Sonnet 5 会话的 system role 问题 |
| 2026-07-02 | Claude Code 的 Artifacts 功能扩展至 Pro 和 Max 计划用户,可在 claude.ai 实时发布和更新 |
| 2026-07-01 | Fable 5 重新上线,Anthropic 重置所有用户的 5 小时和每周速率限制 |
Claude Sonnet 5 于 6 月 30 日发布,定位为"最具代理能力的 Sonnet",支持自主规划、浏览器/终端工具调用,据称其能力达到数月前需要更大更昂贵模型才能实现的水平。
Karpathy 评价 Claude Tag 是 LLM 交互范式的第三次重大变革:从网站 → 应用 → 现在的"团队级异步代理实体"。
| 日期 | 新闻 |
|---|---|
| 2026-07-02 | Codex 社区活动在伦敦举办,开发者 45 分钟内用 Codex 完成闪电演示项目 |
| 2026-07-01 | Codex 订阅用户全球获得重置机会,庆祝 AI Engineer World's Fair |
| 2026-06-30 | 发布 GeneBench-Pro,面向生物数据分析代理的研究级基准测试 |
| 2026-06-26 | 发布 GPT-5.6 系列预览:Sol(前沿模型)、Terra(均衡型)、Luna(高吞吐低成本) |
| 2026-06-26 | GPT-5.5 Instant 更新,改进意图理解和复杂约束处理 |
GPT-5.5 Instant 是 ChatGPT 使用量最大的模型,本次更新已向付费用户推送。
| 日期 | 新闻 |
|---|---|
| 2026-07-02 | Gemini Omni Flash 以 1404 Elo 登顶 Video Arena 榜首,领先第二名 Seedance 2.0 Mini 101 分 |
| 2026-06-30 | 与 A24 达成研究合作,探索 AI 创作工具与创作者协同 |
| 2026-06-26 | 与 ElevenLabs 合作,在 AI 生成音频中嵌入 SynthID 不可听水印 |
| 2026-06-25 | Gemma 4 下载量在 2.5 个月内达到 2 亿次,超越 Gemma 全系列发布时的 1 亿次总量 |
Gemini 3.5 Flash 现已支持原生 Computer Use,开发者可构建跨浏览器、移动端和桌面界面的自定义代理。
| 厂商 | 日期 | 新闻 |
|---|---|---|
| Etched | 2026-06-30 | 结束隐身模式,首批服务器机架即将出货;已签约 10 亿美元以上客户合同,融资 8 亿美元 |
| xAI | 2026-07-02 | Grok Build 已集成至 Railway 沙箱环境,可通过 ssh [email protected] 使用 |
| OpenAI Foundation | 2026-06-26 | 加入 Intercept Health Fund 作为创始合作伙伴,投资呼吸系统大流行防控 |
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | Gemini 3.5 Flash (high) | 50.2 |
本期无变动。
Agent 榜单:本期无变动。Top 3:Claude Sonnet 5 (46.7) / GPT-5.5 (44.9) / Gemini 3.5 Flash (37.4)
Coding 榜单:本期无变动。Top 3:GPT-5.5 (74.9) / Claude Sonnet 5 (71.5) / Gemini 3.5 Flash (70.1)
SWE-bench Verified 变化:
Terminal-bench 2.0 变化:
LMArena Overall 变化:Qwen 系列多款模型排名微调,qwen3.7-max-preview 升至第 15 名。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
点评:Claude Sonnet 5 在 Agent 榜单以 46.7 分居首、GPT-5.5 在 Coding 榜单以 74.9 分领先,两家头部厂商已形成差异化竞争格局——Anthropic 聚焦代理工作流,OpenAI 占据代码生成高地。Etched 以专用芯片架构切入推理市场,8 亿美元融资和 10 亿美元合同说明资本押注于"ASIC 取代 GPU"的可能性。