1.【OpenAI】发布 GPT-5.5,定位"最强模型" OpenAI 推出 GPT-5.5,定位为迄今最智能的模型,在编程、研究和数据分析等复杂任务上速度更快、能力更强。GPT-5.5 已同步上线 Codex,支持跨工具工作流。LM Arena 排名从第 15 升至第 13,分数 1475.5。 原文链接
2.【DeepSeek】发布 V4 系列模型,API 75 折促销 DeepSeek 发布 V4-Pro 和 V4-Flash 两款新模型,同时支持 OpenAI 和 Anthropic 接口。旧模型名 deepseek-chat/deepseek-reasoner 将于 3 个月后停用。V4-Pro API 限时 75 折至 5 月 31 日,支持 Claude Code 1M 上下文接入。 原文链接
3.【OpenAI × Microsoft】宣布合作协议修订,进入新阶段 OpenAI 与微软宣布修订合作协议,简化合作关系、增加长期确定性,支持双方在大规模 AI 创新上的持续协作。这是两家公司战略关系的重要里程碑。 原文链接
4.【xAI × SpaceX × Cursor】三方联手打造最强编程 AI SpaceXAI 与 Cursor 达成深度合作,结合 Cursor 的产品分发能力和 SpaceX 百万 H100 等效 Colossus 超算,目标打造世界最强编程与知识工作 AI。Cursor 同时授予 SpaceX 以 600 亿美元收购的选择权。 原文链接
5.【Anthropic】提出"内省适配器",让模型自我报告训练中学到的不良行为 Anthropic Fellows 研究提出 Introspection Adapter(IA),可让微调后的语言模型自我报告其学到的行为,包括潜在的错位、后门和安全防护移除。该方法具有泛化能力,为 AI 对齐研究提供新工具。 原文链接
| 模型 | 排名变动 | 分数变动 | 说明 |
|---|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B | 103 → 76(↑27) | 52.2 → 60.4(↑15.7%) | 大幅跃升,编码能力显著提升 |
| Warp | 11 → 36(↓25) | 75.6 → 71.0(↓6.1%) | 排名大幅下滑 |
| Nemotron-CORTEXA | 50 → 82(↓32) | 68.2 → 58.2(↓14.7%) | 分数与排名双降 |
| devlo | 44 → 83/94(↓39-50) | 70.2 → 58.2/54.2(↓17-23%) | 多条目大幅下跌 |
| 模型 | 排名变动 | 分数 | 说明 |
|---|---|---|---|
| grok-4.3 | 新上榜 | 34 名(1455.7) | xAI 新模型首次入榜 |
| GPT-5.5 | 15 → 13(↑2) | 1475.5(↑1.4) | 新发布后排名上升 |
| deepseek-v4-flash-thinking | 52 → 55(↓3) | 1438.8 | 小幅下滑 |
注:LM Arena 本轮变动以 1-3 名微调为主,无 ≥5 名的大幅变动。SWE-bench 变动最为剧烈。