SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-07-09

查看完整版 →
2026-07-09 08:43 CST

核心速览

【OpenAI】发布 GPT-Live 语音模型,ChatGPT Voice 升级

OpenAI 推出新一代语音模型 GPT-Live,主打更自然的人机对话体验,现已集成至 ChatGPT Voice。Sam Altman 表示"感觉像真实的对话",认为自己从偏好打字转向语音交互。GPT-Live-1 和 GPT-Live-1 mini 将很快开放 API。这一升级标志着语音交互质量的显著跃升,可能改变用户与 AI 的主要交互方式。

https://openai.com/index/introducing-gpt-live

【OpenAI】GPT-5.6 Sol 本周四公开发布

GPT-5.6 Sol 将于本周四公开发布,同时推出的还有 Terra 和 Luna。Sol 在编程、科学和网络安全方面能力增强,已开放预览访问。开发者反馈其在 Next.js 开发中表现优异,能理解架构权衡并处理复杂问题。

https://x.com/OpenAI/status/2074704958419792299

【Anthropic】推出 GRAM 模块化训练方法,解决 AI 双用途难题

Anthropic 与 AE Studio 合作发布 GRAM 训练方法,可将病毒学等双用途能力(既可用于疫苗研发也可用于制造病原体)放入可移除模块。这种机制允许模型保留有益能力的同时,在必要时移除危险部分。

https://x.com/AnthropicAI/status/2075005777522172146

【OpenAI】披露 SWE-Bench Pro 基准测试问题

OpenAI 发布分析报告,指出流行编程基准 SWE-Bench Pro 存在可靠性和准确性问题,质疑当前 AI 编程能力评估的有效性。

https://openai.com/index/separating-signal-from-noise-coding-evaluations

【Cognition】发布 SWE-1.7 模型,接近前沿模型水平

Cognition 推出 SWE-1.7 模型,在成本远低于前沿模型的情况下性能接近 GPT-5.5 和 Opus,推理速度达 1000 tok/s。该模型通过多语言宣传和审查评估及后训练校正解决合规问题。

https://cognition.com/blog/swe-1-7

重大 Benchmark 变化

SWE-Bench Verified 排名变动

  • Claude 4.5 Opus medium 从第 2 名升至第 1 名(79.2分)
  • Claude 4.5 Opus 从第 1 名降至第 2 名(79.2分)
  • GPT-5-2 Codex 从第 18 名升至第 16 名(72.8分)

Terminal Bench 2.0 排名变动

  • Claude Opus 4.7 从第 3 名升至第 2 名(80.2分)
  • Gemini 3.1 Pro 从第 2 名降至第 3 名(80.2分)

历史日报

邮件订阅

每天一封邮件,随时可退订