← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-19

2026-07-19 08:33 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 发布,性能与成本双突破 OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra、Luna 等型号。GPT-5.6 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍;Sol Ultra 使用 64 个子代理在一小时内证明 50 年未解的 Cycle Double Cover Conjecture 数学难题。该模型现已成为 Microsoft 365 Copilot 首选模型。[GPT-5.6: Frontier intelligence that scales with your ambition]

【OpenAI】ChatGPT Work 与 GPT-Live 语音模型上线 ChatGPT Work 作为可跨应用和文件执行任务的智能代理正式推出,可持续数小时跟进项目。GPT-Live 新一代语音模型已向全球用户推送,支持多任务并行对话,Sam Altman 称其已跨越语音交互阈值。[ChatGPT is now a partner for your most ambitious work] [Introducing GPT-Live]

【Anthropic】Claude for Teachers 免费面向美国 K-12 教师 Anthropic 推出 Claude for Teachers,为美国验证身份的 K-12 教师免费提供 Claude 高级功能,配套教学技能库及对接全美 50 州学术标准的课程资源。同时承诺向加拿大 AI 研究机构投入 1000 万加元。[Claude for Teachers]

【Google】NotebookLM 更名为 Gemini Notebook NotebookLM 正式更名为 Gemini Notebook,反映其在 Google AI 产品矩阵中的定位。该产品 3 年内已服务超过 3000 万用户和 60 万组织,未来将整合至 Gemini App 和 Google Search。Google 同步更新 Weather Lab,开放 AI 气象模型交互网站。[NotebookLM becomes Gemini Notebook]

【Anthropic】Claude Code 持续迭代,新增 /fork 会话分支功能 Claude Code v2.1.212 引入 /fork 命令,可将当前对话复制到后台会话继续运行;v2.1.214 修复 dir/** 权限规则的安全漏洞。Claude Code artifacts 现已支持调用 MCP 连接器构建交互式仪表盘。[Claude Code v2.1.212 released]

重大 Benchmark 变化

SWE-Bench Verified 排名变动

  • Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(分数 79.2)
  • Claude 4.5 Opus 从第 1 名降至第 2 名(分数 79.2)

排名变动均为 1 位,未达到 5 位变动阈值,无其他重大变化报告。

快速预览

  • OpenAI CFO 发布 AI 时代 ROI 记分卡,提出有用功、成功任务成本等四项核心指标
  • GPT-5.6 Sol 被证实成功证明 50 年未解的 Cycle Double Cover 猜想,数学能力引发关注
  • Anthropic 推出 Claude for Teachers,为美国 K-12 教师提供免费高级功能
  • Claude Code 连发多版更新,/fork 命令现可复制对话到独立后台会话
  • NotebookLM 正式更名为 Gemini Notebook,用户规模达 3000 万

新闻

OpenAI

日期 新闻
07-17 CFO Sarah Friar 发布 AI 记分卡,提出用有用功、成功任务成本、可靠性、算力回报四项指标衡量 AI 投资回报
07-16 OpenAI 分享青少年安全 AI 措施,包括年龄适当保护、学习工具和家长控制
07-16 Cars24 案例:使用 OpenAI 语音和聊天代理处理月均 100 万+对话分钟,挽回 12% 流失线索
07-15 发布 GPT-Red 自动红队测试系统,通过自我博弈提升 AI 安全性和对抗鲁棒性
07-15 提出AI 治理的「反向联邦主义」路径,主张州法律助力构建国家框架
07-14 发布企业 AI 投资管理指南,强调衡量每美元有用功
07-10 Deutsche Telekom 案例:转型 AI 原生运营商,改造客服、员工工作流和网络运维
07-09 发布 GPT-5.6 系列模型,Luna 在健康智能领域表现突出,成本降至 GPT-5.5 最高推理设置的 1/25
07-09 推出 ChatGPT Work,可跨应用和文件执行任务,持续数小时完成项目
07-09 GPT-5.6 成 为 Microsoft 365 Copilot 首选模型,增强 Word、Excel、PowerPoint 等
07-09 生物安全漏洞赏金计划升级为长期项目,奖励翻倍至 5 万美元
07-08 发布 GPT-Live 语音模型,现已全量推送至全球 ChatGPT 用户
07-08 发布 SWE-Bench Pro 评估分析,指出该编码基准存在可靠性问题

产品动态

  • 07-17:桌面版 ChatGPT 恢复侧边栏显示历史对话和项目,Chat/Work 模式切换更便捷
  • 07-16:Codex 推出 PR Chat 功能,可在 Codex 内审查 PR 并直接编辑代码
  • 07-15:Codex Micro 硬件开售,限量版不足 14 小时售罄
  • 07-14:Codex 周活用户突破 700 万,两个月内更新 150+ 项功能

数学突破

07-10,OpenAI 宣布 GPT-5.6 Sol Ultra 成功证明 50 年未解的 Cycle Double Cover 猜想,使用 64 个子代理在约 1 小时内完成。后续社区反馈显示 GPT-5.6 还用单个 prompt 解决了凸优化领域 30 年的空白问题。

Anthropic

日期 新闻
07-14 推出 Claude for Teachers,为美国 K-12 认证教师免费提供高级功能,包含教学技能库和课程标准对照
07-14 承诺 1000 万加元资助加拿大 AI 研究
07-09 Long-Term Benefit Trust 任命前美联储主席 Ben Bernanke 为新成员
07-08 发布与 AE Studio 合作的 GRAM 研究成果,可将双重用途能力(如病毒学)封装为可移除模块

Claude Code 更新

  • v2.1.214(07-18):修复单段 dir/** 允许规则错误授权写入嵌套目录的安全问题
  • v2.1.212(07-17):/fork 现将对话复制到独立后台会话,原有子代理功能更名为 /subtask
  • v2.1.211(07-15):新增 --forward-subagent-text 标志,可在 stream-json 输出中包含子代理文本
  • v2.1.210(07-14):长时间运行的工具调用现显示实时耗时计数器
  • 07-15:Claude Code artifacts 现可调用 MCP 连接器,支持构建动态仪表盘

Google

日期 新闻
07-16 Search 新增更多第三方应用连接,扩展搜索能力边界
07-16 Google Vids 推出 Gemini Omni 和 Personal Avatars 功能,支持视频创作与数字人出镜
07-14 Google Images 迎来 25 周年,回顾视觉搜索演进历程
07-07 Gemini API 扩展 Managed Agents,支持后台任务、远程 MCP 和定时触发器

NotebookLM 更名

NotebookLM 正式更名为 Gemini Notebook,用户规模达 3000 万+、60 万组织。Demis Hassabis 表示该产品三年前始于帮助用户加速学习的实验,现已集成至 Gemini App 并将登陆 Google Search。

DeepMind 动态

  • 07-17:Weather Lab 网站重大更新,分享 Google AI 天气模型
  • 07-15:发布论文探讨 AI 代理在科学发现中的验证瓶颈及政策建议
  • 07-09:AlphaEvolve 在 Google Cloud 正式上线,为 Gemini 驱动的进化算法代理

行业格局

Artificial Analysis 综合能力榜

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-5.6 Luna (max) 51.2

LMArena 榜

排名 模型 分数
1 claude-fable-5 1507.5
2 claude-opus-4-6-thinking 1503.8
3 claude-opus-4-7-thinking 1502.3

本期无变动。


干活选型

Agentic 能力榜

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.6 Luna (max) 45.6
3 GPT-5.5 (xhigh) 44.9

本期无变动。

编码能力榜

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 GPT-5.6 Luna (max) 71.4

本期无变动。

SWE-bench Verified

排名 模型(脚手架) 分数
1 Claude 4.5 Opus medium (live-SWE-agent) 79.2
2 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

变化:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 交换排名,medium 版本升至第 1。

Terminal-Bench 2.0

排名 模型(脚手架) 分数
1 GPT-5.5 (NexAU-AHE) 84.7
2 Claude Opus 4.7 (WOZCODE) 80.2
3 Gemini 3.1 Pro (TongAgents) 80.2

变化:Claude Opus 4.7 与 Gemini 3.1 Pro 交换排名,Claude 升至第 2。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

GPT-5.6 Sol Ultra 在数学证明上的突破(CDC 猜想、凸优化空白)标志着前沿模型已具备跨领域深度推理能力,这远超传统代码生成的价值。OpenAI CFO 提出的 ROI 记分卡将「有用功」和「成功任务成本」置于核心,直接回应了企业对 AI 投入产出不透明的痛点。Claude 4.5 Opus medium 在 SWE-bench Verified 登顶说明模型效率优化已能匹敌更大参数版本,成本敏感的企业选型时可优先考虑。

来源 · 102 条