SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-05-25 08:35

查看完整版 →
2026-05-25 08:35 CST

核心速览

1.【Google】I/O 2026 发布 Gemini 3.5,全面进入"Agentic Gemini"时代

Google 在 I/O 2026 发布 Gemini 3.5 模型,强调"前沿智能+行动能力"。同步推出 AI Mode 搜索、Google Workspace AI 更新及订阅体系升级,共公布 100+ 项更新。这是 Google 最大规模 AI 产品集中发布,标志其从"AI 助手"向"自主 Agent"转型。 来源

2.【OpenAI】AI 模型推翻离散几何领域 80 年核心猜想

OpenAI 模型成功解决 80 年未解的"单位距离问题"(unit distance problem),推翻离散几何中的一个重要猜想。这是 AI 驱动数学研究的里程碑事件,表明前沿模型已能在纯数学领域产出原创性突破。 来源

3.【Anthropic】收购 SDK 平台公司 Stainless

Anthropic 宣布收购 Stainless——一个 SDK 和 MCP 服务器平台,自 Anthropic API 早期起即为其所有 SDK 提供支持。此举将强化 Anthropic 的开发者工具链和 API 生态建设,巩固其在开发者基础设施层面的控制力。 来源

4.【xAI】Grok Build Beta 上线,Grok 订阅接入 OpenCode/OpenClaw

xAI 发布 Grok Build 早期 Beta——面向 SuperGrok Heavy 用户的 agentic CLI 编程工具,支持编码、建应用和自动化工作流。同时 Grok 订阅已接入 OpenCode 和 OpenClaw,xAI 正加速构建开发者生态。 来源

5.【DeepSeek】V4-Pro 折扣永久化

DeepSeek 宣布 V4-Pro 的折扣价格转为永久定价。此前该折扣原定 5 月 31 日到期,现决定无限期延续。这一价格策略可能进一步压缩竞争对手的定价空间,加速高性能模型的普及化。 来源


重大 Benchmark 变化

SWE-bench Verified

模型 排名变动 分数变动 说明
devlo #44 → #94 70.2 → 54.2 (-22.8%) 大幅下滑,排名暴跌 50 位
Nemotron-CORTEXA #50 → #82 68.2 → 58.2 (-14.7%) 排名跌出前 50
EntroPO + R2E + Qwen3-Coder-30B #103 → #76 52.2 → 60.4 (+15.7%) 30B 小模型逆势上升 27 位
Warp #11 → #36 75.6 → 71.0 (-6.1%) 头部梯队滑落,排名跌 25 位
EPAM AI/Run + GPT4o #156 → #162 27.0 → 24.0 (-11.1%) 尾部持续下滑

Terminal-bench 2.0

模型 排名变动 分数变动 说明
LemonHarness / Multiple #10 → #4 79.9 → 84.5 (+5.8%) 闯入前 5,表现亮眼
Warp / Multiple #42 → #66 61.2 → 50.1 (-18.1%) 在 Terminal-bench 同步大幅下跌

趋势观察: Warp 在两个主流 Coding Agent 基准上同步大幅下跌,可能与近期评测方法更新或自身版本回退有关;EntroPO+Qwen3-Coder 作为 30B 小模型在 SWE-bench 上大幅跃升值得关注。

历史日报

邮件订阅

每天一封邮件,随时可退订