← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-09

2026-07-09 08:43 CST
快速版 完整版

核心速览

【OpenAI】发布 GPT-Live 语音模型,ChatGPT Voice 升级

OpenAI 推出新一代语音模型 GPT-Live,主打更自然的人机对话体验,现已集成至 ChatGPT Voice。Sam Altman 表示"感觉像真实的对话",认为自己从偏好打字转向语音交互。GPT-Live-1 和 GPT-Live-1 mini 将很快开放 API。这一升级标志着语音交互质量的显著跃升,可能改变用户与 AI 的主要交互方式。

https://openai.com/index/introducing-gpt-live

【OpenAI】GPT-5.6 Sol 本周四公开发布

GPT-5.6 Sol 将于本周四公开发布,同时推出的还有 Terra 和 Luna。Sol 在编程、科学和网络安全方面能力增强,已开放预览访问。开发者反馈其在 Next.js 开发中表现优异,能理解架构权衡并处理复杂问题。

https://x.com/OpenAI/status/2074704958419792299

【Anthropic】推出 GRAM 模块化训练方法,解决 AI 双用途难题

Anthropic 与 AE Studio 合作发布 GRAM 训练方法,可将病毒学等双用途能力(既可用于疫苗研发也可用于制造病原体)放入可移除模块。这种机制允许模型保留有益能力的同时,在必要时移除危险部分。

https://x.com/AnthropicAI/status/2075005777522172146

【OpenAI】披露 SWE-Bench Pro 基准测试问题

OpenAI 发布分析报告,指出流行编程基准 SWE-Bench Pro 存在可靠性和准确性问题,质疑当前 AI 编程能力评估的有效性。

https://openai.com/index/separating-signal-from-noise-coding-evaluations

【Cognition】发布 SWE-1.7 模型,接近前沿模型水平

Cognition 推出 SWE-1.7 模型,在成本远低于前沿模型的情况下性能接近 GPT-5.5 和 Opus,推理速度达 1000 tok/s。该模型通过多语言宣传和审查评估及后训练校正解决合规问题。

https://cognition.com/blog/swe-1-7

重大 Benchmark 变化

SWE-Bench Verified 排名变动

  • Claude 4.5 Opus medium 从第 2 名升至第 1 名(79.2分)
  • Claude 4.5 Opus 从第 1 名降至第 2 名(79.2分)
  • GPT-5-2 Codex 从第 18 名升至第 16 名(72.8分)

Terminal Bench 2.0 排名变动

  • Claude Opus 4.7 从第 3 名升至第 2 名(80.2分)
  • Gemini 3.1 Pro 从第 2 名降至第 3 名(80.2分)

快速预览

  • OpenAI 发布 GPT-Live 语音模型,Sam Altman 称其"感觉真实"并已登陆 ChatGPT
  • GPT-5.6 Sol 将于本周四公开发布,Terra 和 Luna 同期推出
  • Anthropic 发布 GRAM 训练方法,可将"双重用途"能力模块化移除
  • Claude Fable 5 恢复全球访问,新增网络安全任务分类器
  • Cognition 推出 SWE-1.7,声称以低成本接近 GPT 5.5 和 Opus 水平

OpenAI

7月8日

OpenAI 发布 GPT-Live,新一代语音模型,主打自然人机交互,已集成到 ChatGPT Voice。Sam Altman 表示"我一直更偏好打字而非与 AI 对话,现在我认为这将会改变"。GPT-Live-1 和 GPT-Live-1 mini 即将开放 API,开发者可登记通知

GPT-5.6 Sol 将于本周四公开发布,同期推出 Terra 和 Luna。Greg Brockman 称其在 Next.js 开发中"理解架构权衡、能调查复杂的 issue 报告、修复 bug 时会考虑代码库其他部分"。

OpenAI 发布 政府与国家安全合作原则,阐述负责任 AI 使用、民主问责和公共安全准则。

发表 SWE-Bench Pro 评估分析,指出该流行代码基准测试存在可靠性问题。

OpenAI Academy 与 Walton Family Foundation 合作推出 K-12 教育 AI 技能培训

7月7日

Australian Payments Plus 使用 ChatGPT Enterprise 和 Codex 加速支付业务。

MUFG 采用 ChatGPT Enterprise 构建 AI 原生组织。

7月6日

ChatGPT iOS 1.2026.181 支持在对话中直接创建、搜索、打开、fork 和管理 Codex 任务。


Anthropic

7月8日

Anthropic 与 AE Studio 合作发布 GRAM 研究成果:一种训练方法,可将病毒学等"双重用途"(既可造福也可危害)能力放入可移除模块。

Claude Code 发布 v2.1.205,新增自动模式规则阻止篡改会话记录文件;v2.1.204 修复 headless 会话中 SessionStart hook 事件不流式传输的问题。

7月7日

Claude Code v2.1.203 新增登录即将过期警告。

Claude Cowork 在网页和桌面端开始整合 Chat 和 Cowork 到同一主页签。

7月6日

Boris Cherny 分享 Claude Code 起源故事

7月1-2日

Claude Fable 5 恢复全球访问,新增网络安全任务分类器,部分常规编程调试任务将回退到 Opus 4.8。Anthropic 同时宣布与 Amazon、Microsoft、Google 等合作制定 AI 越狱严重程度评估框架。Fable 5 付费计划访问延长至 7 月 12 日,所有用户重置了 5 小时/周限额。


Google

7月8日

Google DeepMind 发布关于技术成果归属的伦理研究论文,论证 AI 等技术收益应惠及所有人。

7月7日

Gemini API 扩展 Managed Agents 功能,新增后台任务、远程 MCP 等

7月6日

Gemini Robotics 与 Apptronik 扩大合作,Apollo 2 人形机器人采集的真实数据将用于训练 Gemini Robotics。

7月2日

Gemini Omni Flash 登顶 Video Arena 榜首,Elo 1404,领先第二名 Seedance 2.0 Mini 达 101 分。


其他厂商

Grok 4.5 — xAI 发布新模型,HN 讨论获 446 分。

Mistral Robostral Navigate — 发布 SOTA 机器人导航模型

Cognition SWE-1.7 — 声称以低成本接近 GPT 5.5 和 Opus 水平,速度达 1000 tok/s,已构建多语言宣传审查评估并纠正。

Microsoft Flint — 发布 AI Agent 可视化语言


Benchmark 快照

行业格局

Artificial Analysis Intelligence

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max) 53.4
3 Gemini 3.5 Flash (high) 50.2

LMArena Overall

排名 模型 Elo
1 claude-fable-5 1508.5
2 claude-opus-4-6-thinking 1503.6
3 claude-opus-4-7-thinking 1502.0

干活选型

Agentic (AA)

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max) 46.7
2 GPT-5.5 (xhigh) 44.9
3 Gemini 3.5 Flash (high) 37.4

Coding (AA)

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max) 71.5
3 Gemini 3.5 Flash (high) 70.1

SWE-bench Pro Public

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 claude-opus-4-6 (thinking)* 51.9

SWE-bench Verified

排名 模型 分数 变化
1 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2 ↑1
2 Claude 4.5 Opus (scaffold: Sonar) 79.2 ↓1
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

Terminal-Bench 2.0

排名 模型 分数 变化
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2 ↑1
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2 ↓1

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

GPT-Live 语音模型的发布标志着 OpenAI 从"打字交互"向"自然对话"的战略转向。Sam Altman 本人表示"一直偏好打字,现在认为这将会改变",说明内部测试体验已接近真人对话质量,这对语音助手赛道是重要信号。

Claude Fable 5 恢复上线展示了前沿模型监管的新模式:Anthropic 与美国政府协商后新增网络安全分类器,部分任务回退 Opus 4.8,同时联合 Amazon/Microsoft/Google 制定越狱评估框架。这是首个"政府-厂商协作"重新部署前沿模型的案例。

SWE-1.7 以低成本逼近前沿说明垂直领域模型正在突破"通用模型天花板"。Cognition 通过构建多语言宣传审查评估、后训练纠正,成功以 1000 tok/s 速度服务政府/国防客户,证明 RL 仍未触及极限。

来源 · 97 条