1.【OpenAI】GPT-5.5 Instant 发布,成为 ChatGPT 新默认模型 GPT-5.5 Instant 更新为 ChatGPT 默认模型,提供更智能、更准确的回答,显著降低幻觉率,并增强个性化控制能力。这是 OpenAI 持续迭代旗舰模型的重要一步,直接影响数亿用户的日常体验。 原文链接
2.【OpenAI】ChatGPT 开始测试广告功能 OpenAI 在 ChatGPT 中测试广告以支撑免费用户访问,广告将明确标注、与回答独立,配备强隐私保护和用户控制选项。这标志着 ChatGPT 商业模式的重大转变,可能重塑 AI 产品的变现路径。 原文链接
3.【xAI】Grok 4.3 上线 API,登顶多项排行榜 Grok 4.3 在 xAI API 上线,支持 100 万 token 上下文窗口,定价 $1.25/M 输入、$2.50/M 输出。该模型在 ArtificialAnlys 智能体工具调用和指令遵循排行榜登顶,并在 ValsAI 企业法律和金融领域排名第一。 原文链接
4.【OpenAI】GPT-5.5 及 GPT-5.5-Cyber 扩展网络安全可信访问 OpenAI 发布 GPT-5.5 和 GPT-5.5-Cyber,面向经验证的安全防御者开放可信访问,加速漏洞研究和关键基础设施保护。这体现了前沿模型在专业安全领域的深度定制化趋势。 原文链接
5.【Anthropic】将开源对齐工具 Petri 捐赠给 Meridian Labs Anthropic 将开源对齐测试工具 Petri 捐赠给 Meridian Labs 以独立运营,同时发布重大更新提升测试的适应性、真实性和深度。此举推动 AI 安全工具的社区化发展,降低独立研究门槛。 原文链接
SWE-bench Verified:
| 模型 | 排名变动 | 分数变动 | 说明 |
|---|---|---|---|
| devlo | #44 → #83/94 | 70.2 → 54.2~58.2 | 排名暴跌 39-50 位,分数下降 17%-23%,疑为评测修正或回退 |
| Nemotron-CORTEXA | #50 → #82 | 68.2 → 58.2 | 排名下降 32 位,分数下降 14.7%,表现显著回落 |
| Warp | #11 → #36 | 75.6 → 71.0 | 排名下降 25 位,分数下降 6.1%,从头部梯队滑落 |
| EntroPO + R2E + Qwen3-Coder-30B | #103 → #76 | 52.2 → 60.4 | 排名上升 27 位,分数提升 15.7%,30B 小模型表现亮眼 |
Terminal Bench 2.0:
| 模型 | 排名变动 | 分数变动 | 说明 |
|---|---|---|---|
| Warp / Multiple | #32 → #37~54 | 61.2 → 50.1~59.1 | 排名下降 5-22 位,分数最高下降 18.1%,跨基准同步下滑 |