SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-05-28 08:38

查看完整版 →
2026-05-28 08:38 CST

核心速览

2026 年 5 月 20 日 — 5 月 27 日


【OpenAI】AI 模型推翻离散几何 80 年猜想 OpenAI 模型解决了持续 80 年的单位距离问题(unit distance problem),推翻了离散几何领域的一个核心猜想,标志着 AI 驱动数学研究的重要里程碑。 原文链接

【Google I/O 2026】发布 Gemini 3.5,进入 Agentic Gemini 时代 Google 在 I/O 2026 发布 Gemini 3.5 模型,定位为"前沿智能与行动力结合";同步推出 AI Mode 搜索、Workspace 更新及 Google AI 订阅升级,全面押注 Agent 化方向。 原文链接

【xAI】Grok Build Beta 向所有 SuperGrok/Premium+ 用户开放 xAI 推出 Grok Build Beta(agentic CLI),支持 Plan Mode、Imagine 图片/视频生成及工作流自动化;随后开放 grok-build-0.1 至 Kilo Code 等第三方 IDE,快速扩展开发者生态。 原文链接

【Anthropic】收购 SDK 平台 Stainless Anthropic 收购 Stainless(@stainlessapi),该平台自 Anthropic API 早期起即为所有 SDK 提供支持,收购将进一步强化其开发者工具链与 MCP 服务器生态。 原文链接

【OpenAI / 社区】GPT-5.5 发现 27 年前 RCE 漏洞 社区用户报告 GPT-5.5 发现了一个 1999 年 4 月引入的远程代码执行漏洞,已多次验证确认,准备负责任披露,展示模型在网络安全领域的深层能力。 原文链接


重大 Benchmark 变化

SWE-bench Verified

模型 排名变动 分数变动 说明
EntroPO + R2E + Qwen3-Coder-30B 103→76 ↑27 52.2→60.4 (+15.7%) 30B 参数模型大幅提升,进入前 80
Nemotron-CORTEXA 50→82 ↓32 68.2→58.2 (-14.7%) 大幅下滑,跌出前 50
Warp 11→36 ↓25 75.6→71.0 (-6.1%) 从头部梯队显著回落
devlo 44→94 ↓50 70.2→54.2 (-22.8%) 分数大幅下降,排名腰斩

Terminal-Bench 2.0

模型 排名变动 分数变动 说明
LemonHarness 10→4 ↑6 79.9→84.5 (+5.8%) 冲入前 5,进步显著
Warp 42→66 ↓24 61.2→50.1 (-18.1%) 分数与排名双降,表现不佳

历史日报

邮件订阅

每天一封邮件,随时可退订