SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-07-04

查看完整版 →
2026-07-04 20:52 CST

核心速览

【OpenAI】发布 GPT-5.6 Sol/Terra/Luna 三款新模型

OpenAI 推出 GPT-5.6 Sol(前沿模型)、Terra(均衡模型)和 Luna(高速低成本模型)限量预览版。Sol 定位为下一代旗舰模型,面向高性能需求场景。预览页面

【Anthropic】Claude Sonnet 5 发布,Fable 5 重上线

Claude Sonnet 5 具备自主规划、使用浏览器和终端工具的能力,在数月前还需更大更昂贵的模型才能达到同等水平。Fable 5 重新开放使用,用户限制已重置。Sonnet 5 公告 | Fable 5 恢复

【Google DeepMind】Gemini Omni Flash 获 Video Arena 榜首

Gemini Omni Flash 以 Elo 1404 登顶 Video Arena,领先第二名 Seedance 2.0 Mini 达 101 分,这是 Video Arena 历史上最大的领先优势之一。该成绩标志着 Google 在视频生成领域取得领先地位。详情

【Etched】走出隐身,宣布 8 亿美元融资与 10 亿+美元订单

Etched 公布其首款推理芯片机架已完成 A0 流片测试,客户合同超 10 亿美元,融资 8 亿美元。早期测试显示在推理工作负载上达到 SOTA 吞吐量、延迟和能效,首批机架今夏出货。公告

【Karpathy 点评】Claude Tag 代表 LLM 交互的第三次范式转变

Claude Tag 让 Claude 以 Slack 团队成员身份接入,拥有组织级工具和上下文,可异步处理任务。Karpathy 认为这是继"LLM 是网站"和"LLM 是桌面应用"后的第三个 UI/UX 范式:LLM 成为组织中持久、自主的实体。原文


重大 Benchmark 变化

Terminal Bench 2

  • LemonHarness/Multiple:排名从第 8 升至第 2,分数从 79.9 升至 84.5(+5.8%),涨幅显著
  • Warp/Multiple:排名从第 41 跌至第 47-65(分数 61.2→50.1-59.1),跌幅达 18%

SWE-bench Verified

  • Claude 4.5 Opus medium:升至第 1 名(原第 2),分数 79.2
  • Warp:排名从第 11 跌至第 36(分数 75.6→71.0,-6.1%)
  • devlo:排名从第 44 跌至第 83-94(分数 70.2→54.2-58.2,跌幅最高达 23%)

历史日报

邮件订阅

每天一封邮件,随时可退订