← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-20

2026-07-20 08:51 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 正式发布 GPT-5.6 登场,GPT-5.6 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍。Sol Ultra 版本已用 64 个子代理在一小时内证明了 50 年未解的 Cycle Double Cover 猜想。GPT-5.6 成为 Microsoft 365 Copilot 首选模型。

【OpenAI】GPT-Live 语音模型上线 新一代语音模型现已向全球所有 ChatGPT 用户推出,支持多任务并行对话(如实时查询航班、天气、制定行程)。Sam Altman 表示其语音交互频率已超过打字。

【Anthropic】Claude for Teachers 发布 面向美国 K-12 认证教师免费开放 Claude 高级功能,提供教学技能库及对接各州课程标准的教学资源。同时宣布投入 1000 万加元资助加拿大 AI 研究。

【OpenAI】ChatGPT Work 上线 ChatGPT Work 代理可在云端跨应用执行任务,支持移动端后台运行。但桌面端首版因隐藏聊天/项目入口、默认高算力设置导致额度消耗过快等问题引发用户反馈,OpenAI 已在 24 小时内发布修复更新。

【Google】Gemini Notebook 正式命名 NotebookLM 更名为 Gemini Notebook,整合进 Gemini App 和 Google Search,累计用户超 3000 万、60 万组织使用。同时 Weather Lab 更新,开放 Google AI 天气模型。


重大 Benchmark 变化

SWE-Bench Verified:Claude 4.5 Opus medium (79.2分) 与 Claude 4.5 Opus 交换排名,现居第 1。GPT-5 排名下滑至第 14(原第 13)。

Terminal Bench 2.0:Claude Opus 4.7 排名升至第 2(原第 3),Gemini 3.1 Pro 降至第 3。

快速预览

  • OpenAI CFO 发布 AI 时代 ROI 记分卡,提出四项核心指标衡量 AI 投资回报
  • Claude Code 连续更新,v2.1.215 改进 /verify/code-review 调用方式
  • OpenAI 修复桌面端体验问题,侧边栏恢复历史对话与项目显示
  • Qwen 3.8 登上 Hacker News 热榜,国产模型持续引发关注
  • SWE-bench Verified 榜单变动:Claude 4.5 Opus medium 升至第一

OpenAI

7月17日 — CFO Sarah Friar 发布 A scorecard for the AI age,提出衡量 AI 投资回报的四项实用指标:有用工作量、单次成功任务成本、可靠性、计算回报率。

同日,OpenAI 桌面端产品更新:对话历史与项目重新回到侧边栏,Chat/Work 模式切换更一致(来源)。

7月16日 — OpenAI 分享 Cars24 案例:使用语音和聊天代理每月处理超 100 万分钟对话,挽回 12% 流失线索。同日发布 青少年安全 AI,为 K-12 学生提供适龄保护和家长控制。

7月15日 — OpenAI 阐述 AI 安全治理的"反向联邦主义"路径,主张通过州法律构建国家级框架。同日发布 GPT-Red,介绍自动化红队测试系统。

7月14日 — OpenAI 发布企业 AI 投资管理指南(链接),以及销售团队(链接)和数据科学团队(链接)使用 ChatGPT Work 的场景。

7月10日 — GPT-Live 全量上线,周末语音使用限额翻倍(来源)。

7月9日 — GPT-5.6 发布,成为 Microsoft 365 Copilot 首选模型(链接)。Bio Bug Bounty 奖励翻倍至 5 万美元(来源)。


Anthropic / Claude

7月19日 — Claude Code v2.1.215 发布:/verify/code-review 不再自动运行,需显式调用。

7月18日v2.1.214 修复单段 dir/** 允许规则的安全问题,防止对嵌套目录的意外放行。

7月17日v2.1.212 改进 /fork:将对话复制到后台会话,原会话继续工作;原子会话子代理改名为 /subtask

7月15日v2.1.211 添加 --forward-subagent-text 标志,支持子代理文本输出流式传输。

7月14日 — Anthropic 发布 Claude for Teachers,为美国 K-12 教师提供免费高级功能。同日宣布投资 1000 万加元支持加拿大 AI 研究(来源)。


Google / Gemini

7月17日 — Google DeepMind 更新 Weather Lab,交互式展示 AI 气象模型。

7月16日 — NotebookLM 更名为 Gemini Notebook,累计用户超 3000 万。同日 Google Search 新增更多应用连接功能(链接),Google Vids 发布 Gemini Omni 和个人头像功能(链接)。

7月15日 — Google DeepMind 发布论文探讨 AI 科学发现的验证瓶颈(来源)。

7月7日 — Gemini API 扩展 Managed Agents 功能:后台任务、远程 MCP、免费层(链接)。


社区热点

来源 内容
Hacker News Qwen 3.8 发布,引发社区讨论(770 分)
Hacker News Claude Code 使用 Bun(已用 Rust 重写)引发关注
Hacker News OpenAI 将 Codex 上下文从 372k 减至 272k
Hacker News Moonshot AI 因 Kimi K3 需求过载暂停新订阅
Sam Altman 新语音模型让其更多使用语音而非打字与 ChatGPT 交互(来源

Benchmark 快照

行业格局

本期变动:无

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-5.6 Luna (max) 51.2

干活选型

本期变动:

SWE-bench Verified:

  • Claude 4.5 Opus medium (20251101) 升至第 1 名(原第 2)
  • Claude 4.5 Opus 降至第 2 名(原第 1)

Terminal-Bench 2.0:

  • Claude Opus 4.7 升至第 2 名(原第 3)
  • Gemini 3.1 Pro 降至第 3 名(原第 2)

当前 Top 3(各榜单):

Agentic 能力:

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.6 Luna (max) 45.6
3 GPT-5.5 (xhigh) 44.9

Coding 能力:

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 GPT-5.6 Luna (max) 71.4

Terminal-Bench 2.0:

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI CFO 提出的 ROI 四指标记分卡(有用工作量、单次成功任务成本、可靠性、计算回报率)为企业评估 AI 投资提供了可量化的框架,而非模糊的"效率提升"承诺。Claude Code 本周连续四次更新修复安全和体验问题,v2.1.214 修复的目录权限漏洞尤其值得关注——单段 dir/** 规则曾可能导致对任意嵌套目录的意外写权限。Claude 4.5 Opus medium 在 SWE-bench Verified 榜单升至第一,同分情况下超越原版 Opus,显示中等参数模型在实际编程任务中的性价比优势。

来源 · 102 条