【OpenAI】A scorecard for the AI age:CFO Sarah Friar 发布 AI 投资评估框架,提出用有用工作量、单任务成本、可靠性和算力回报四项指标衡量 ROI。为企业在 Agent 时代量化 AI 价值提供标准化方法。
【OpenAI】GPT-5.6 Sol Ultra 完成数学证明:GPT-5.6 Sol Ultra 用 64 个子 Agent 在约 1 小时内完成 50 年未解的 Cycle Double Cover 猜想证明。展示顶级推理模型在复杂科研任务上的突破能力。
【Anthropic】Claude for Teachers:面向美国 K-12 教师推出免费版 Claude,提供教学技能库及对接全美 50 州课程标准的教学资源。同日宣布向加拿大 AI 研究机构投入 1000 万加元。
【Anthropic】Claude Code v2.1.212 发布:/fork 命令可将对话复制为独立后台会话,原会话继续工作;原子任务功能改名为 /subtask。另有屏幕阅读器模式、实时计时显示等多项无障碍和体验改进。
【Google】Gemini Notebook 品牌升级:NotebookLM 正式更名 Gemini Notebook,三年内用户达 3000 万、60 万组织使用,将接入 Google 搜索。
/fork 命令,可将对话复制到后台会话继续工作OpenAI
| 日期 | 新闻 |
|---|---|
| 07-17 | CFO Sarah Friar 发布 AI 计分卡,提出衡量 AI ROI 的四个核心指标:有用工作量、单次成功任务成本、可靠性、算力回报 |
| 07-16 | 发布青少年安全 AI 使用指南,为 ChatGPT 增加年龄适配保护、学习工具和家长控制功能 链接 |
| 07-16 | Cars24 案例:通过 OpenAI 语音和聊天代理每月处理 100 万+ 分钟对话,挽回 12% 流失线索 链接 |
| 07-15 | 发布 GPT-Red 自动红队测试系统,通过自我博弈提升 AI 安全性和提示注入鲁棒性 链接 |
| 07-15 | 提出「反向联邦制」AI 治理路径,主张州法律先行构建国家级框架 链接 |
Anthropic
| 日期 | 新闻 |
|---|---|
| 07-17 | Claude Code v2.1.212 发布,/fork 命令可将对话复制到后台会话,原 /fork 改名为 /subtask |
| 07-15 | Claude Code artifacts 现可调用 MCP 连接器,支持构建实时获取信息并执行操作的仪表盘和应用 |
| 07-14 | 推出 Claude for Teachers,为美国 K-12 教育工作者提供免费高级功能访问 |
| 07-14 | 承诺投入 1000 万加元,与加拿大领先 AI 机构合作资助新研究 链接 |
| 日期 | 新闻 |
|---|---|
| 07-16 | NotebookLM 正式更名为 Gemini Notebook,统一 Gemini 品牌 |
| 07-16 | Google Vids 推出 Gemini Omni 和 Personal Avatars 功能,支持创建、编辑和出镜视频 链接 |
| 07-16 | Search Connected Apps 支持更多应用连接,扩展搜索数据源 链接 |
| 07-17 | Weather Lab 重大更新,发布 Google DeepMind AI 天气模型交互网站 链接 |
社区热点
| 主题 | 详情 |
|---|---|
| Kimi K3 | 月之暗面新模型 Kimi K3 首登 LMArena 即位列第 10,成为首个进入全球前十的国产模型 HN 讨论 |
| 开源 AI 现状 | stateofopensource.ai 发布开源 AI 状态报告,HN 热议 363 分 |
| GPT-5.6 Sol | GPT-5.6 Sol Ultra 使用 64 个子代理在一小时内证明 50 年数学难题 Cycle Double Cover Conjecture |
LMArena Overall 变化
本期有重要变动:
当前 Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5 | 1507.5 |
| 2 | Claude Opus 4.6 (thinking) | 1503.8 |
| 3 | Claude Opus 4.7 (thinking) | 1502.3 |
| 4 | Claude Opus 4.6 | 1497.8 |
| 5 | Claude Opus 4.7 | 1494.0 |
Artificial Analysis Intelligence
本期无变动。
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 54.8 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 53.4 |
| 3 | GPT-5.6 Luna (max) | 51.2 |
Terminal Bench 2.0 变化
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (TongAgents) | 80.2 |
SWE-Bench Verified 变化
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
Artificial Analysis Agentic / Coding
本期无变动。
Agentic Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 46.7 |
| 2 | GPT-5.6 Luna (max) | 45.6 |
| 3 | GPT-5.5 (xhigh) | 44.9 |
Coding Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (xhigh) | 74.9 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max) | 71.5 |
| 3 | GPT-5.6 Luna (max) | 71.4 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI CFO 发布的 AI 计分卡提出的四维 ROI 指标(有用工作量、单次成功成本、可靠性、算力回报)是对企业 AI 投入评估方法的首次系统化框架,比传统 token 成本或准确率指标更贴近实际业务场景。Kimi K3 首登 LMArena 即位列第 10,成为首个进入全球前十的国产模型,标志着中国大模型在综合能力上已具备与国际顶尖模型正面竞争的实力。GPT-5.6 Sol Ultra 一小时内证明 50 年数学难题 Cycle Double Cover Conjecture,表明顶级推理模型在复杂科研任务上的能力已从「辅助工具」进入「独立贡献者」阶段。