SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-05-09 08:35

查看完整版 →
2026-05-09 08:35 CST

核心速览

1.【OpenAI】GPT-5.5 Instant 发布,成为 ChatGPT 新默认模型 GPT-5.5 Instant 更新为 ChatGPT 默认模型,提供更智能、更准确的回答,显著降低幻觉率,并增强个性化控制能力。这是 OpenAI 持续迭代旗舰模型的重要一步,直接影响数亿用户的日常体验。 原文链接

2.【OpenAI】ChatGPT 开始测试广告功能 OpenAI 在 ChatGPT 中测试广告以支撑免费用户访问,广告将明确标注、与回答独立,配备强隐私保护和用户控制选项。这标志着 ChatGPT 商业模式的重大转变,可能重塑 AI 产品的变现路径。 原文链接

3.【xAI】Grok 4.3 上线 API,登顶多项排行榜 Grok 4.3 在 xAI API 上线,支持 100 万 token 上下文窗口,定价 $1.25/M 输入、$2.50/M 输出。该模型在 ArtificialAnlys 智能体工具调用和指令遵循排行榜登顶,并在 ValsAI 企业法律和金融领域排名第一。 原文链接

4.【OpenAI】GPT-5.5 及 GPT-5.5-Cyber 扩展网络安全可信访问 OpenAI 发布 GPT-5.5 和 GPT-5.5-Cyber,面向经验证的安全防御者开放可信访问,加速漏洞研究和关键基础设施保护。这体现了前沿模型在专业安全领域的深度定制化趋势。 原文链接

5.【Anthropic】将开源对齐工具 Petri 捐赠给 Meridian Labs Anthropic 将开源对齐测试工具 Petri 捐赠给 Meridian Labs 以独立运营,同时发布重大更新提升测试的适应性、真实性和深度。此举推动 AI 安全工具的社区化发展,降低独立研究门槛。 原文链接


重大 Benchmark 变化

SWE-bench Verified:

模型 排名变动 分数变动 说明
devlo #44 → #83/94 70.2 → 54.2~58.2 排名暴跌 39-50 位,分数下降 17%-23%,疑为评测修正或回退
Nemotron-CORTEXA #50 → #82 68.2 → 58.2 排名下降 32 位,分数下降 14.7%,表现显著回落
Warp #11 → #36 75.6 → 71.0 排名下降 25 位,分数下降 6.1%,从头部梯队滑落
EntroPO + R2E + Qwen3-Coder-30B #103 → #76 52.2 → 60.4 排名上升 27 位,分数提升 15.7%,30B 小模型表现亮眼

Terminal Bench 2.0:

模型 排名变动 分数变动 说明
Warp / Multiple #32 → #37~54 61.2 → 50.1~59.1 排名下降 5-22 位,分数最高下降 18.1%,跨基准同步下滑

历史日报

邮件订阅

每天一封邮件,随时可退订