【OpenAI】发布 GPT-Live 语音模型,ChatGPT Voice 升级
OpenAI 推出新一代语音模型 GPT-Live,主打更自然的人机对话体验,现已集成至 ChatGPT Voice。Sam Altman 表示"感觉像真实的对话",认为自己从偏好打字转向语音交互。GPT-Live-1 和 GPT-Live-1 mini 将很快开放 API。这一升级标志着语音交互质量的显著跃升,可能改变用户与 AI 的主要交互方式。
https://openai.com/index/introducing-gpt-live
【OpenAI】GPT-5.6 Sol 本周四公开发布
GPT-5.6 Sol 将于本周四公开发布,同时推出的还有 Terra 和 Luna。Sol 在编程、科学和网络安全方面能力增强,已开放预览访问。开发者反馈其在 Next.js 开发中表现优异,能理解架构权衡并处理复杂问题。
https://x.com/OpenAI/status/2074704958419792299
【Anthropic】推出 GRAM 模块化训练方法,解决 AI 双用途难题
Anthropic 与 AE Studio 合作发布 GRAM 训练方法,可将病毒学等双用途能力(既可用于疫苗研发也可用于制造病原体)放入可移除模块。这种机制允许模型保留有益能力的同时,在必要时移除危险部分。
https://x.com/AnthropicAI/status/2075005777522172146
【OpenAI】披露 SWE-Bench Pro 基准测试问题
OpenAI 发布分析报告,指出流行编程基准 SWE-Bench Pro 存在可靠性和准确性问题,质疑当前 AI 编程能力评估的有效性。
https://openai.com/index/separating-signal-from-noise-coding-evaluations
【Cognition】发布 SWE-1.7 模型,接近前沿模型水平
Cognition 推出 SWE-1.7 模型,在成本远低于前沿模型的情况下性能接近 GPT-5.5 和 Opus,推理速度达 1000 tok/s。该模型通过多语言宣传和审查评估及后训练校正解决合规问题。
https://cognition.com/blog/swe-1-7
SWE-Bench Verified 排名变动
Terminal Bench 2.0 排名变动