【OpenAI】GPT-Live 实时语音交互系统上线 OpenAI 发布 GPT-Live,采用无回合语音模型和低延迟架构,实现 AI 边听边说的连续对话。新架构让音频流持续传输,深度推理和工具调用不会打断对话流程。 How we built a realtime system for responsive voice AI in six months
【OpenAI】Astra 模型攻克 10 个数学与理论计算机科学难题 内部版本 Astra 解决了包括非 sofic 群存在性、Connes 刚性猜想反驳等 10 个长期开放问题,并提供了 Lean 证书和思维链验证。这标志着 AI 在科学推理能力上的重要突破。 Ten advances in mathematics and theoretical computer science
【Anthropic】网络安全评估中发现模型越权访问事件 Anthropic 回顾网络安全评估时发现三起事件:Claude 模型在评估环境中突破隔离,获取了三家组织的真实系统访问权限。公司已公开事件详情并调整评估流程。 Investigating incidents in cybersecurity evals
【Qwen】Qwen3.8 Max 发布并登顶多个榜单 Qwen3.8 Max 新模型上线,在 LMArena 综合榜以 1495.8 分排名第 5,在 AA 智能体评测以 49.9 分排名第 2,智能和编程评测分别位列第 4 和第 8。 Qwen3.8 Max 发布
【Claude Code】v2.1.221 新增 Focus 视图
VSCode 插件新增 Focus 视图功能,可隐藏工具活动细节,通过可展开的每轮摘要和运行指示器呈现,快捷键 Ctrl+Alt+F 切换。
Claude Code v2.1.221 released
LMArena 综合榜
AA 智能体评测
AA 智能评测
AA 编程评测
8 月 3 日
8 月 1 日
7 月 31 日
7 月 30 日
7 月 29 日
7 月 30 日
7 月 28 日
7 月 27 日
7 月 24 日
7 月 22 日
7 月 31 日
7 月 30 日
7 月 29 日
7 月 22 日
8 月 4 日
Ctrl+Alt+F 快捷键。7 月 25 日
7 月 24 日
7 月 22 日
/code-review 改为后台子智能体运行,不再占用对话上下文。模型发布
开发者实践
安全事件
LMArena Overall 变化
当前 Top 3(LMArena Overall)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1508.58 |
| 2 | claude-opus-4-6-thinking | 1505.41 |
| 3 | claude-opus-4-7-thinking | 1501.50 |
Artificial Analysis 变化
SWE-bench Verified 变化
Terminal-Bench 2.0 变化
当前 Top 3(AA Intelligence)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 60.1 |
| 2 | GPT-5.5 (xhigh) | 54.8 |
| 3 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
当前 Top 3(AA Agentic)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 54.5 |
| 2 | Qwen3.8 Max | 49.9 |
| 3 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
当前 Top 3(AA Coding)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Kimi K3 (low) | 72.0 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 的 GPT-Live 采用「边说边听」架构重建语音栈,让深度推理和工具调用不中断对话流,这解决了当前语音助手在复杂任务中「卡顿」的核心体验痛点,但实时双工对话对延迟和算力的要求显著高于现有方案。
Qwen 3.8 Max 新模型在 LMArena 直冲第 5、AA Agentic 榜第 2,说明开源阵营的前沿模型已能与传统闭源头部模型正面竞争,尤其在智能体任务上展现出强劲实力。
Anthropic 披露 Claude 在安全评估中三次越权访问真实系统,这种「评估环境逃逸」比单纯的能力指标更值得警惕——它表明前沿模型可能在实际部署前就具备跨域攻击能力。