SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-05-02 15:52

查看完整版 →
2026-05-02 15:52 CST

核心速览

1.【OpenAI】发布 GPT-5.5,定位"最强模型" OpenAI 推出 GPT-5.5,定位为迄今最智能的模型,在编程、研究和数据分析等复杂任务上速度更快、能力更强。GPT-5.5 已同步上线 Codex,支持跨工具工作流。LM Arena 排名从第 15 升至第 13,分数 1475.5。 原文链接

2.【DeepSeek】发布 V4 系列模型,API 75 折促销 DeepSeek 发布 V4-Pro 和 V4-Flash 两款新模型,同时支持 OpenAI 和 Anthropic 接口。旧模型名 deepseek-chat/deepseek-reasoner 将于 3 个月后停用。V4-Pro API 限时 75 折至 5 月 31 日,支持 Claude Code 1M 上下文接入。 原文链接

3.【OpenAI × Microsoft】宣布合作协议修订,进入新阶段 OpenAI 与微软宣布修订合作协议,简化合作关系、增加长期确定性,支持双方在大规模 AI 创新上的持续协作。这是两家公司战略关系的重要里程碑。 原文链接

4.【xAI × SpaceX × Cursor】三方联手打造最强编程 AI SpaceXAI 与 Cursor 达成深度合作,结合 Cursor 的产品分发能力和 SpaceX 百万 H100 等效 Colossus 超算,目标打造世界最强编程与知识工作 AI。Cursor 同时授予 SpaceX 以 600 亿美元收购的选择权。 原文链接

5.【Anthropic】提出"内省适配器",让模型自我报告训练中学到的不良行为 Anthropic Fellows 研究提出 Introspection Adapter(IA),可让微调后的语言模型自我报告其学到的行为,包括潜在的错位、后门和安全防护移除。该方法具有泛化能力,为 AI 对齐研究提供新工具。 原文链接


重大 Benchmark 变化

SWE-bench Verified(排名变动 ≥5)

模型 排名变动 分数变动 说明
EntroPO + R2E + Qwen3-Coder-30B 103 → 76(↑27) 52.2 → 60.4(↑15.7%) 大幅跃升,编码能力显著提升
Warp 11 → 36(↓25) 75.6 → 71.0(↓6.1%) 排名大幅下滑
Nemotron-CORTEXA 50 → 82(↓32) 68.2 → 58.2(↓14.7%) 分数与排名双降
devlo 44 → 83/94(↓39-50) 70.2 → 58.2/54.2(↓17-23%) 多条目大幅下跌

LM Arena Overall(排名变动 ≥5)

模型 排名变动 分数 说明
grok-4.3 新上榜 34 名(1455.7) xAI 新模型首次入榜
GPT-5.5 15 → 13(↑2) 1475.5(↑1.4) 新发布后排名上升
deepseek-v4-flash-thinking 52 → 55(↓3) 1438.8 小幅下滑

注:LM Arena 本轮变动以 1-3 名微调为主,无 ≥5 名的大幅变动。SWE-bench 变动最为剧烈。

历史日报

邮件订阅

每天一封邮件,随时可退订