SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-05-15 11:06

查看完整版 →
2026-05-15 11:06 CST

核心速览

1. 【OpenAI】GPT-5.5 Instant 发布:更快、更准、更个性化 GPT-5.5 Instant 更新为 ChatGPT 默认模型,显著降低幻觉率,提升回答准确性,并增强个性化控制能力。这是 OpenAI 在用户体验层面的重要迭代,直接影响数亿日常用户。原文链接

2. 【xAI】Grok 4.3 上线:登顶多项权威榜单 Grok 4.3 成为 xAI 最快、最强模型,在 ArtificialAnlys 智能体工具调用和指令遵循榜单排名第一,ValsAI 企业法律和金融领域亦居首位。支持 100 万 token 上下文,定价 $1.25/$2.50 per million tokens。原文链接

3. 【Anthropic】与盖茨基金会合作,投入 2 亿美元 Anthropic 承诺 2 亿美元用于全球健康、生命科学、教育、农业和经济流动性领域的拨款、Claude 额度及技术支持。这是 AI 公司迄今最大规模的公益投入之一。原文链接

4. 【xAI】Grok Build CLI 内测上线,对标 Codex/Claude Code xAI 推出 Grok Build 测试版——面向 SuperGrok Heavy 用户的智能体命令行工具,支持编码、应用构建和工作流自动化。AI 编码助手赛道竞争进一步加剧。原文链接

5. 【OpenAI】ChatGPT 开始测试广告 OpenAI 正式在 ChatGPT 中测试广告投放,承诺广告标注清晰、回答独立于广告内容、隐私保护到位。标志 ChatGPT 商业化进入新阶段,免费用户体验将受影响。原文链接


重大 Benchmark 变化

以下为 SWE-bench Verified 及 Terminal-Bench 2.0 中排名变动 ≥5 或分数变动 ≥5% 的条目:

模型 Benchmark 排名变动 分数变动
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct SWE-bench Verified 103 → 76 (+27) 52.2 → 60.4 (+15.7%)
LemonHarness / Multiple Terminal-Bench 2.0 10 → 3 (+7) 79.9 → 84.5 (+5.8%)
Nemotron-CORTEXA SWE-bench Verified 50 → 82 (-32) 68.2 → 58.2 (-14.7%)
devlo SWE-bench Verified 44 → 83/94 (-39/-50) 70.2 → 58.2/54.2 (-17.1%/-22.8%)
Warp SWE-bench Verified 11 → 36 (-25) 75.6 → 71.0 (-6.1%)
Warp / Multiple Terminal-Bench 2.0 44 → 49/68 (-5/-24) 61.2 → 59.1/50.1 (-3.4%/-18.1%)

亮点: Qwen3-Coder-30B 搭配 EntroPO+R2E 后排名飙升 27 位,分数提升 15.7%,小模型编码能力持续突破。Nemotron-CORTEXA、devlo、Warp 多榜大幅下跌,可能与评测方法更新有关。

历史日报

邮件订阅

每天一封邮件,随时可退订