【OpenAI】GPT-5.6 发布,成为 Microsoft 365 Copilot 首选模型
GPT-5.6 带来更强的性能和更低的成本,GPT-5.6 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍。该模型现已成为 Microsoft 365 Copilot 的首选模型,支持 Word、Excel、PowerPoint 等应用。这是 OpenAI 在企业级 AI 能力上的重要一步。
【Anthropic】推出罕见病研究资助计划,最高 $50,000 Claude 额度
Anthropic 宣布为加速罕见病研究的科学家提供最高 $50,000 的 Claude 使用额度,这是其 AI for Science 项目首次定向资助。该计划旨在帮助科研人员利用 Claude 加速科学发现。
【OpenAI】ChatGPT Work 上线,支持跨应用长时间任务
ChatGPT Work 是一个能在应用和文件间执行操作的 Agent,可持续数小时跟踪项目目标并交付完成的工作。该功能已在移动端和网页端上线,桌面端同步支持。
【Anthropic】Claude Fable 5 在数学证明上取得突破
Claude Fable 5 生成了 Jacobian Conjecture 的反例,引发数学界关注。这是 AI 模型在开放性数学问题上的重要进展,表明前沿模型已能参与高水平数学研究。
【Kimi】推出 Kimi Work 产品
中国 AI 公司月之暗面推出 Kimi Work,定位为工作场景的 AI 助手。这是继 OpenAI、Anthropic 之后又一厂商推出面向工作流的 Agent 产品,市场竞争加剧。
无重大变化。本次排名变动均为同分模型间的位次交换,无分数变动≥5%或排名变动≥5的情况。
7 月 20 日
7 月 17 日
7 月 16 日
7 月 15 日
7 月 9 日
7 月 20 日
7 月 15 日
7 月 14 日
7 月 9 日
| 版本 | 日期 | 主要变更 |
|---|---|---|
| v2.1.216 | 7/20 | 新增 sandbox.filesystem.disabled 设置,跳过文件系统隔离但保留网络出口控制 |
| v2.1.215 | 7/19 | /verify 和 /code-review 不再自动运行,需显式调用 |
| v2.1.214 | 7/18 | 修复单段 dir/** 允许规则错误授权嵌套目录写入的问题 |
| v2.1.212 | 7/17 | /fork 将对话复制到后台会话;原会话内子代理改为 /subtask |
| v2.1.211 | 7/15 | 新增 --forward-subagent-text 标志,在 stream-json 输出中包含子代理文本 |
7 月 16 日
7 月 17 日
7 月 15 日
Kimi
社区热点
本期无变动
当前 Top 3(Artificial Analysis Intelligence):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 |
当前 Top 3(LMArena Overall):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.48 |
| 2 | claude-opus-4-6-thinking | 1503.81 |
| 3 | claude-opus-4-7-thinking | 1502.28 |
SWE-bench Verified 变化
Terminal-Bench 2.0 变化
当前 Top 3(Agentic):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 46.7 |
| 2 | GPT-5.6 Luna (max) | 45.6 |
| 3 | GPT-5.5 (xhigh) | 44.9 |
当前 Top 3(Coding):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 71.5 |
| 3 | GPT-5.6 Luna (max) | 71.4 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
点评