【OpenAI】GPT-5.6 发布:性能更强成本更低
GPT-5.6 系列包含 Sol、Terra、Luna 三档,其中 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍。GPT-5.6 在 DeepSWE 榜单以 73% 登顶。这是 OpenAI 首次推出三档性能模型,意图覆盖从旗舰推理到快速响应的全场景需求。
【OpenAI】ChatGPT Work 发布:AI Agent 可跨应用执行任务
ChatGPT Work 是内置于 ChatGPT 的 Agent,可跨应用和文件执行任务,能持续数小时追踪项目直至完成目标。现已覆盖 Web、桌面和移动端。这标志着 ChatGPT 从对话助手转向可自主完成复杂工作流的 Agent。
【OpenAI】GPT-5.6 Sol Ultra 解决 50 年数学难题
GPT-5.6 Sol Ultra 在 1 小时内使用 64 个子 Agent 完成了 Cycle Double Cover Conjecture 的证明。该难题困扰数学界 50 年。这是 AI 首次在复杂数学证明领域展现系统化推理能力。
【Anthropic】Claude for Teachers:向美国 K-12 教师免费开放
Anthropic 推出 Claude for Teachers,向美国 K-12 认证教师免费提供高级功能,配套教学技能库和对接各州学术标准的课程资源。同期宣布向加拿大 AI 研究机构投入 1000 万加元。
【Google DeepMind】Gemini Omni Flash 登顶视频生成榜
Gemini Omni Flash 在 Artificial Analysis 的文生视频和图生视频榜单均排名第一,以微弱优势超越字节跳动 Seedance 2.0。模型支持文本/图片/视频输入,生成带原生音频的 720p 24fps 视频。
无重大变化。所有排名变动均未达到排名变动≥5 或分数变动≥5% 的阈值。
GPT-5.6 生态持续升温
产品与生态
| 日期 | 动态 |
|---|---|
| 7-14 | JetBrains AI 推荐 Codex 为默认代理 |
| 7-14 | Notion 用 GPT-5.6 构建模型评估 CLI 工具 |
| 7-14 | OpenAI 发布企业 AI 投资管理指南 |
| 7-13 | ChatGPT 重返 EEA 区 WhatsApp,同时登陆韩国 Kakao 和部分市场 Viber |
| 7-11 | GPT-Live 全球全量上线,周末语音额度翻倍 |
Codex 数据:每周活跃用户 700 万+,两个月内 150+ 次更新。
产品发布
研究与治理
Claude Code 更新
| 版本 | 主要变更 |
|---|---|
| v2.1.210 | 折叠工具摘要行新增实时计时器,长时间调用不再显得卡住 |
| v2.1.209 | 修复 claude agents 后台会话中 /model 等对话框被阻止问题 |
| v2.1.208 | 新增屏幕阅读器模式,支持纯文本渲染 |
产品动态
| 主题 | 来源 |
|---|---|
| 如何阻止 Claude 说"load-bearing" | HN 热门 421 分 |
| Bonsai 27B:可在手机运行的 27B 级模型 | HN 热门 402 分 |
| 是否把过多思考外包给 AI? | HN 热门 372 分 |
| Juggler:开源 GUI 编程代理 | HN 热门 170 分 |
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 |
Agentic 排行:本期无变动。Top 3:Claude Sonnet 5 (46.7) → GPT-5.6 Luna (45.6) → GPT-5.5 (44.9)
Coding 排行:本期无变动。Top 3:GPT-5.5 (74.9) → Claude Sonnet 5 (71.5) → GPT-5.6 Luna (71.4)
SWE-bench Verified 变化:
| 变化 | 模型 | 分数 |
|---|---|---|
| ↑ 2→1 | Claude 4.5 Opus medium (20251101) | 79.2 |
| ↓ 1→2 | Claude 4.5 Opus | 79.2 |
| ↑ 18→16 | GPT-5-2 Codex | 72.8 |
Terminal-Bench 2.0 变化:
| 变化 | 模型 | 分数 |
|---|---|---|
| ↑ 3→2 | Claude Opus 4.7 | 80.2 |
| ↓ 2→3 | Gemini 3.1 Pro | 80.2 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-5.6 Sol Ultra 一小时内证明 50 年未解数学猜想,展示了前沿模型在高复杂度推理任务中的突破,但这类"高光时刻"是否构成日常生产力增益仍有待观察。
Codex 活跃用户从 700 万涨到 800 万仅用一天,Sam Altman 称增长"疯狂",推理团队支撑需求的压力可见一斑——但频繁重置额度也说明产品化初期的容量规划仍在动态调整中。
JetBrains 选择 Codex 作为默认代理而非自家 Junie,说明在 IDE 领域,模型能力仍是竞争核心,平台方可能倾向于"最佳工具优先"而非绑定自家产品。