【OpenAI】发布 GPT-Live 语音模型,ChatGPT Voice 升级
OpenAI 推出新一代语音模型 GPT-Live,主打更自然的人机对话体验,现已集成至 ChatGPT Voice。Sam Altman 表示"感觉像真实的对话",认为自己从偏好打字转向语音交互。GPT-Live-1 和 GPT-Live-1 mini 将很快开放 API。这一升级标志着语音交互质量的显著跃升,可能改变用户与 AI 的主要交互方式。
https://openai.com/index/introducing-gpt-live
【OpenAI】GPT-5.6 Sol 本周四公开发布
GPT-5.6 Sol 将于本周四公开发布,同时推出的还有 Terra 和 Luna。Sol 在编程、科学和网络安全方面能力增强,已开放预览访问。开发者反馈其在 Next.js 开发中表现优异,能理解架构权衡并处理复杂问题。
https://x.com/OpenAI/status/2074704958419792299
【Anthropic】推出 GRAM 模块化训练方法,解决 AI 双用途难题
Anthropic 与 AE Studio 合作发布 GRAM 训练方法,可将病毒学等双用途能力(既可用于疫苗研发也可用于制造病原体)放入可移除模块。这种机制允许模型保留有益能力的同时,在必要时移除危险部分。
https://x.com/AnthropicAI/status/2075005777522172146
【OpenAI】披露 SWE-Bench Pro 基准测试问题
OpenAI 发布分析报告,指出流行编程基准 SWE-Bench Pro 存在可靠性和准确性问题,质疑当前 AI 编程能力评估的有效性。
https://openai.com/index/separating-signal-from-noise-coding-evaluations
【Cognition】发布 SWE-1.7 模型,接近前沿模型水平
Cognition 推出 SWE-1.7 模型,在成本远低于前沿模型的情况下性能接近 GPT-5.5 和 Opus,推理速度达 1000 tok/s。该模型通过多语言宣传和审查评估及后训练校正解决合规问题。
https://cognition.com/blog/swe-1-7
SWE-Bench Verified 排名变动
Terminal Bench 2.0 排名变动
7月8日
OpenAI 发布 GPT-Live,新一代语音模型,主打自然人机交互,已集成到 ChatGPT Voice。Sam Altman 表示"我一直更偏好打字而非与 AI 对话,现在我认为这将会改变"。GPT-Live-1 和 GPT-Live-1 mini 即将开放 API,开发者可登记通知。
GPT-5.6 Sol 将于本周四公开发布,同期推出 Terra 和 Luna。Greg Brockman 称其在 Next.js 开发中"理解架构权衡、能调查复杂的 issue 报告、修复 bug 时会考虑代码库其他部分"。
OpenAI 发布 政府与国家安全合作原则,阐述负责任 AI 使用、民主问责和公共安全准则。
发表 SWE-Bench Pro 评估分析,指出该流行代码基准测试存在可靠性问题。
OpenAI Academy 与 Walton Family Foundation 合作推出 K-12 教育 AI 技能培训。
7月7日
Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex 加速支付业务。
MUFG 采用 ChatGPT Enterprise 构建 AI 原生组织。
7月6日
ChatGPT iOS 1.2026.181 支持在对话中直接创建、搜索、打开、fork 和管理 Codex 任务。
7月8日
Anthropic 与 AE Studio 合作发布 GRAM 研究成果:一种训练方法,可将病毒学等"双重用途"(既可造福也可危害)能力放入可移除模块。
Claude Code 发布 v2.1.205,新增自动模式规则阻止篡改会话记录文件;v2.1.204 修复 headless 会话中 SessionStart hook 事件不流式传输的问题。
7月7日
Claude Code v2.1.203 新增登录即将过期警告。
Claude Cowork 在网页和桌面端开始整合 Chat 和 Cowork 到同一主页签。
7月6日
Boris Cherny 分享 Claude Code 起源故事。
7月1-2日
Claude Fable 5 恢复全球访问,新增网络安全任务分类器,部分常规编程调试任务将回退到 Opus 4.8。Anthropic 同时宣布与 Amazon、Microsoft、Google 等合作制定 AI 越狱严重程度评估框架。Fable 5 付费计划访问延长至 7 月 12 日,所有用户重置了 5 小时/周限额。
7月8日
Google DeepMind 发布关于技术成果归属的伦理研究论文,论证 AI 等技术收益应惠及所有人。
7月7日
Gemini API 扩展 Managed Agents 功能,新增后台任务、远程 MCP 等。
7月6日
Gemini Robotics 与 Apptronik 扩大合作,Apollo 2 人形机器人采集的真实数据将用于训练 Gemini Robotics。
7月2日
Gemini Omni Flash 登顶 Video Arena 榜首,Elo 1404,领先第二名 Seedance 2.0 Mini 达 101 分。
Grok 4.5 — xAI 发布新模型,HN 讨论获 446 分。
Mistral Robostral Navigate — 发布 SOTA 机器人导航模型。
Cognition SWE-1.7 — 声称以低成本接近 GPT 5.5 和 Opus 水平,速度达 1000 tok/s,已构建多语言宣传审查评估并纠正。
Microsoft Flint — 发布 AI Agent 可视化语言。
Artificial Analysis Intelligence
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 53.4 |
| 3 | Gemini 3.5 Flash (high) | 50.2 |
LMArena Overall
| 排名 | 模型 | Elo |
|---|---|---|
| 1 | claude-fable-5 | 1508.5 |
| 2 | claude-opus-4-6-thinking | 1503.6 |
| 3 | claude-opus-4-7-thinking | 1502.0 |
Agentic (AA)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 46.7 |
| 2 | GPT-5.5 (xhigh) | 44.9 |
| 3 | Gemini 3.5 Flash (high) | 37.4 |
Coding (AA)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 71.5 |
| 3 | Gemini 3.5 Flash (high) | 70.1 |
SWE-bench Pro Public
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
SWE-bench Verified
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 | ↑1 |
| 2 | Claude 4.5 Opus (scaffold: Sonar) | 79.2 | ↓1 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 | — |
Terminal-Bench 2.0
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 | — |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 | ↑1 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 | ↓1 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-Live 语音模型的发布标志着 OpenAI 从"打字交互"向"自然对话"的战略转向。Sam Altman 本人表示"一直偏好打字,现在认为这将会改变",说明内部测试体验已接近真人对话质量,这对语音助手赛道是重要信号。
Claude Fable 5 恢复上线展示了前沿模型监管的新模式:Anthropic 与美国政府协商后新增网络安全分类器,部分任务回退 Opus 4.8,同时联合 Amazon/Microsoft/Google 制定越狱评估框架。这是首个"政府-厂商协作"重新部署前沿模型的案例。
SWE-1.7 以低成本逼近前沿说明垂直领域模型正在突破"通用模型天花板"。Cognition 通过构建多语言宣传审查评估、后训练纠正,成功以 1000 tok/s 速度服务政府/国防客户,证明 RL 仍未触及极限。