1. 【OpenAI】GPT-5.5 Instant 发布:更快、更准、更个性化 GPT-5.5 Instant 更新为 ChatGPT 默认模型,显著降低幻觉率,提升回答准确性,并增强个性化控制能力。这是 OpenAI 在用户体验层面的重要迭代,直接影响数亿日常用户。原文链接
2. 【xAI】Grok 4.3 上线:登顶多项权威榜单 Grok 4.3 成为 xAI 最快、最强模型,在 ArtificialAnlys 智能体工具调用和指令遵循榜单排名第一,ValsAI 企业法律和金融领域亦居首位。支持 100 万 token 上下文,定价 $1.25/$2.50 per million tokens。原文链接
3. 【Anthropic】与盖茨基金会合作,投入 2 亿美元 Anthropic 承诺 2 亿美元用于全球健康、生命科学、教育、农业和经济流动性领域的拨款、Claude 额度及技术支持。这是 AI 公司迄今最大规模的公益投入之一。原文链接
4. 【xAI】Grok Build CLI 内测上线,对标 Codex/Claude Code xAI 推出 Grok Build 测试版——面向 SuperGrok Heavy 用户的智能体命令行工具,支持编码、应用构建和工作流自动化。AI 编码助手赛道竞争进一步加剧。原文链接
5. 【OpenAI】ChatGPT 开始测试广告 OpenAI 正式在 ChatGPT 中测试广告投放,承诺广告标注清晰、回答独立于广告内容、隐私保护到位。标志 ChatGPT 商业化进入新阶段,免费用户体验将受影响。原文链接
以下为 SWE-bench Verified 及 Terminal-Bench 2.0 中排名变动 ≥5 或分数变动 ≥5% 的条目:
| 模型 | Benchmark | 排名变动 | 分数变动 |
|---|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct | SWE-bench Verified | 103 → 76 (+27) | 52.2 → 60.4 (+15.7%) |
| LemonHarness / Multiple | Terminal-Bench 2.0 | 10 → 3 (+7) | 79.9 → 84.5 (+5.8%) |
| Nemotron-CORTEXA | SWE-bench Verified | 50 → 82 (-32) | 68.2 → 58.2 (-14.7%) |
| devlo | SWE-bench Verified | 44 → 83/94 (-39/-50) | 70.2 → 58.2/54.2 (-17.1%/-22.8%) |
| Warp | SWE-bench Verified | 11 → 36 (-25) | 75.6 → 71.0 (-6.1%) |
| Warp / Multiple | Terminal-Bench 2.0 | 44 → 49/68 (-5/-24) | 61.2 → 59.1/50.1 (-3.4%/-18.1%) |
亮点: Qwen3-Coder-30B 搭配 EntroPO+R2E 后排名飙升 27 位,分数提升 15.7%,小模型编码能力持续突破。Nemotron-CORTEXA、devlo、Warp 多榜大幅下跌,可能与评测方法更新有关。