← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-21

2026-07-21 08:47 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 发布,成为 Microsoft 365 Copilot 首选模型

GPT-5.6 带来更强的性能和更低的成本,GPT-5.6 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍。该模型现已成为 Microsoft 365 Copilot 的首选模型,支持 Word、Excel、PowerPoint 等应用。这是 OpenAI 在企业级 AI 能力上的重要一步。

原文链接

【Anthropic】推出罕见病研究资助计划,最高 $50,000 Claude 额度

Anthropic 宣布为加速罕见病研究的科学家提供最高 $50,000 的 Claude 使用额度,这是其 AI for Science 项目首次定向资助。该计划旨在帮助科研人员利用 Claude 加速科学发现。

原文链接

【OpenAI】ChatGPT Work 上线,支持跨应用长时间任务

ChatGPT Work 是一个能在应用和文件间执行操作的 Agent,可持续数小时跟踪项目目标并交付完成的工作。该功能已在移动端和网页端上线,桌面端同步支持。

原文链接

【Anthropic】Claude Fable 5 在数学证明上取得突破

Claude Fable 5 生成了 Jacobian Conjecture 的反例,引发数学界关注。这是 AI 模型在开放性数学问题上的重要进展,表明前沿模型已能参与高水平数学研究。

原文链接

【Kimi】推出 Kimi Work 产品

中国 AI 公司月之暗面推出 Kimi Work,定位为工作场景的 AI 助手。这是继 OpenAI、Anthropic 之后又一厂商推出面向工作流的 Agent 产品,市场竞争加剧。

原文链接

重大 Benchmark 变化

无重大变化。本次排名变动均为同分模型间的位次交换,无分数变动≥5%或排名变动≥5的情况。

快速预览

  • OpenAI 发布长时运行模型安全对齐研究,揭示新风险与防护措施
  • Anthropic 推出罕见病研究资助计划,最高 $50,000 Claude 额度
  • Claude Fable 在数学证明上取得突破,产出 Jacobian Conjecture 反例
  • Kimi 发布 Work 产品,国产 Agent 产品线持续扩展
  • Claude Code 连续更新,新增 sandbox 文件系统控制等特性

OpenAI

7 月 20 日

  • 发布 Safety and alignment in an era of long-horizon models,分享长时运行模型部署中的安全风险、观察到的失败案例及迭代改进的防护措施。
  • Greg Brockman 转发推广 ChatGPT Work,用户发推分享使用体验可获 $100 免费额度(前 10,000 名)。

7 月 17 日

  • CFO Sarah Friar 发表 A scorecard for the AI age,提出 ROI 评估框架:有用工作量、单任务成本、可靠性、计算回报率。
  • Tibo 宣布 ChatGPT 桌面端更新:侧边栏恢复对话历史和项目显示、Chat/Work 模式切换、历史记录跨平台同步。

7 月 16 日

  • 发布 Why teens deserve access to safe AI,介绍面向青少年的年龄适配保护、学习工具和家长控制。
  • 案例 Cars24:使用 OpenAI 语音和聊天代理每月处理 100 万+ 分钟对话,挽回 12% 流失线索。

7 月 15 日

7 月 9 日

  • 发布 GPT-5.6:更强性能、更低成本,Luna 版本以 25 倍成本优势超越 GPT-5.5 最高推理设置。
  • 发布 ChatGPT Work:可跨应用和文件执行任务、持续数小时跟进项目的 Agent。
  • GPT-5.6 成为 Microsoft 365 Copilot 首选模型
  • 发布 GPT-Live,新语音模型已全量上线 ChatGPT Voice。

Anthropic

7 月 20 日

7 月 15 日

  • 发布 Claude for Teachers:美国 K-12 认证教师免费使用高级功能,配套教学技能库和各州课标对接。

7 月 14 日

7 月 9 日


Claude Code 更新

版本 日期 主要变更
v2.1.216 7/20 新增 sandbox.filesystem.disabled 设置,跳过文件系统隔离但保留网络出口控制
v2.1.215 7/19 /verify/code-review 不再自动运行,需显式调用
v2.1.214 7/18 修复单段 dir/** 允许规则错误授权嵌套目录写入的问题
v2.1.212 7/17 /fork 将对话复制到后台会话;原会话内子代理改为 /subtask
v2.1.211 7/15 新增 --forward-subagent-text 标志,在 stream-json 输出中包含子代理文本

Google

7 月 16 日

7 月 17 日

7 月 15 日

  • 发表科学发现验证瓶颈 论文,提出四项政策建议。

行业动态

Kimi

  • 发布 Kimi Work,Agent 产品线持续扩展。

社区热点


行业格局

本期无变动

当前 Top 3(Artificial Analysis Intelligence):

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-5.6 Luna (max) 51.2

当前 Top 3(LMArena Overall):

排名 模型 分数
1 claude-fable-5 1507.48
2 claude-opus-4-6-thinking 1503.81
3 claude-opus-4-7-thinking 1502.28

干活选型

SWE-bench Verified 变化

  • Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(79.2 分)
  • Claude 4.5 Opus 从第 1 名降至第 2 名(79.2 分)

Terminal-Bench 2.0 变化

  • Claude Opus 4.7 从第 3 名升至第 2 名(80.2 分)
  • Gemini 3.1 Pro 从第 2 名降至第 3 名(80.2 分)

当前 Top 3(Agentic):

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 46.7
2 GPT-5.6 Luna (max) 45.6
3 GPT-5.5 (xhigh) 44.9

当前 Top 3(Coding):

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 71.5
3 GPT-5.6 Luna (max) 71.4

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

  • OpenAI 长时运行模型安全研究揭示了一个关键矛盾:模型能解决更复杂的开放式问题,但其持久性也带来了短时评估无法覆盖的安全风险——这为 Agent 时代的评估方法敲响警钟。
  • Anthropic 罕见病资助计划以最高 $50,000 额度定向支持特定科学领域,显示出 AI 实验室从通用能力竞赛向垂直领域价值落地的策略分化。
  • Claude Fable 产出 Jacobian Conjecture 反例印证了数学界对模型数学推理能力的关注——GPT-5.6 Sol 同样在 Erdős 问题上有正确证明,前沿模型在开放数学问题上的表现正在成为新的能力风向标。
来源 · 91 条