SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-05-20 08:36

查看完整版 →
2026-05-20 08:36 CST

核心速览

【Google I/O 2026】Gemini 3.5 发布,开启"Agentic Gemini 时代" Google 在 I/O 2026 大会上发布 Gemini 3.5 模型,定位为"前沿智能+行动力",并宣布 AI Mode 正在改变美国用户的搜索方式。同步更新 Google Workspace AI 功能和 AI 订阅计划,价格不变、功能增强。这是 Google 全面押注 Agent 化 AI 的标志性事件。 原文链接

【OpenAI】成立 DeployCo,专攻企业 AI 部署 OpenAI 成立全新企业部署公司 DeployCo,帮助组织将前沿 AI 带入生产环境并转化为可衡量的商业价值。此举标志着 OpenAI 从模型提供方向企业基础设施服务商的战略延伸。 原文链接

【Anthropic】收购 SDK 平台公司 Stainless Anthropic 宣布收购 Stainless——一家 SDK 和 MCP 服务器平台公司,此前 Anthropic 所有 SDK 均基于该平台构建。收购将进一步加强 Anthropic 的开发者工具链和 API 生态建设。 原文链接

【OpenAI】ChatGPT 开始测试广告 OpenAI 宣布在 ChatGPT 中测试广告,以支持免费用户访问。广告将明确标注、不影响回答独立性,并提供强隐私保护和用户控制选项。这是 AI 商业模式的重大转向。 原文链接

【xAI】Grok Build CLI 测试版上线 xAI 发布 Grok Build 早期 Beta——面向 SuperGrok Heavy 用户的 agentic CLI 工具,支持编码、应用构建和工作流自动化。xAI 正式进入 AI 编程代理赛道,与 Codex、Claude Code 展开竞争。 原文链接


重大 Benchmark 变化

SWE-bench Verified (Verified)

模型 排名变化 分数变化 变动幅度
devlo 44 → 83/94 70.2 → 54.2 排名暴跌 39~50 位,分数 -22.8%
Nemotron-CORTEXA 50 → 82 68.2 → 58.2 排名下降 32 位,分数 -14.7%
Warp 11 → 36 75.6 → 71.0 排名下降 25 位,分数 -6.1%
EntroPO + R2E + Qwen3-Coder-30B 103 → 76 52.2 → 60.4 排名上升 27 位,分数 +15.7%
EPAM AI/Run + GPT4o 156 → 162 27.0 → 24.0 分数 -11.1%

Terminal-Bench 2.0

模型 排名变化 分数变化 变动幅度
Warp / Multiple 42 → 66 61.2 → 50.1 排名下降 24 位,分数 -18.1%
LemonHarness / Multiple 10 → 4 79.9 → 84.5 排名上升 6 位,分数 +5.8%,冲入 Top 5
little-coder / Qwen3.6-35B-A3B 122 → 117 23.0 → 24.6 排名上升 5 位,分数 +7.0%

值得关注:Warp 在 SWE-bench 和 Terminal-Bench 两大榜单同时出现显著下滑;devlo 在 SWE-bench 上跌幅最为剧烈。EntroPO + Qwen3-Coder 组合异军突起,排名大幅跃升。

历史日报

邮件订阅

每天一封邮件,随时可退订