← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-18

2026-07-18 09:01 CST
快速版 完整版

核心速览

  • 【OpenAI】A scorecard for the AI age:CFO Sarah Friar 发布 AI 投资评估框架,提出用有用工作量、单任务成本、可靠性和算力回报四项指标衡量 ROI。为企业在 Agent 时代量化 AI 价值提供标准化方法。

  • 【OpenAI】GPT-5.6 Sol Ultra 完成数学证明:GPT-5.6 Sol Ultra 用 64 个子 Agent 在约 1 小时内完成 50 年未解的 Cycle Double Cover 猜想证明。展示顶级推理模型在复杂科研任务上的突破能力。

  • 【Anthropic】Claude for Teachers:面向美国 K-12 教师推出免费版 Claude,提供教学技能库及对接全美 50 州课程标准的教学资源。同日宣布向加拿大 AI 研究机构投入 1000 万加元。

  • 【Anthropic】Claude Code v2.1.212 发布/fork 命令可将对话复制为独立后台会话,原会话继续工作;原子任务功能改名为 /subtask。另有屏幕阅读器模式、实时计时显示等多项无障碍和体验改进。

  • 【Google】Gemini Notebook 品牌升级:NotebookLM 正式更名 Gemini Notebook,三年内用户达 3000 万、60 万组织使用,将接入 Google 搜索。

重大 Benchmark 变化

  • LMArena Overall:Kimi K3 新入榜即位列第 10 名(1485.65 分);Grok-4.5 从第 29 名跌至第 34 名,降幅达 5 位。

快速预览

  • OpenAI CFO 发布 AI 时代 ROI 计分卡,提出有用工作量、单次成功成本、可靠性、算力回报四维指标
  • Kimi K3 新上榜 LMArena 第 10 名,国产模型首次进入全球前十
  • GPT-5.6 Sol Ultra 一小时内证明 50 年数学难题 Cycle Double Cover Conjecture
  • NotebookLM 更名为 Gemini Notebook,Google 强化 Gemini 品牌统一
  • Claude Code 新增 /fork 命令,可将对话复制到后台会话继续工作

行业新闻

OpenAI

日期 新闻
07-17 CFO Sarah Friar 发布 AI 计分卡,提出衡量 AI ROI 的四个核心指标:有用工作量、单次成功任务成本、可靠性、算力回报
07-16 发布青少年安全 AI 使用指南,为 ChatGPT 增加年龄适配保护、学习工具和家长控制功能 链接
07-16 Cars24 案例:通过 OpenAI 语音和聊天代理每月处理 100 万+ 分钟对话,挽回 12% 流失线索 链接
07-15 发布 GPT-Red 自动红队测试系统,通过自我博弈提升 AI 安全性和提示注入鲁棒性 链接
07-15 提出「反向联邦制」AI 治理路径,主张州法律先行构建国家级框架 链接

Anthropic

日期 新闻
07-17 Claude Code v2.1.212 发布,/fork 命令可将对话复制到后台会话,原 /fork 改名为 /subtask
07-15 Claude Code artifacts 现可调用 MCP 连接器,支持构建实时获取信息并执行操作的仪表盘和应用
07-14 推出 Claude for Teachers,为美国 K-12 教育工作者提供免费高级功能访问
07-14 承诺投入 1000 万加元,与加拿大领先 AI 机构合作资助新研究 链接

Google

日期 新闻
07-16 NotebookLM 正式更名为 Gemini Notebook,统一 Gemini 品牌
07-16 Google Vids 推出 Gemini Omni 和 Personal Avatars 功能,支持创建、编辑和出镜视频 链接
07-16 Search Connected Apps 支持更多应用连接,扩展搜索数据源 链接
07-17 Weather Lab 重大更新,发布 Google DeepMind AI 天气模型交互网站 链接

社区热点

主题 详情
Kimi K3 月之暗面新模型 Kimi K3 首登 LMArena 即位列第 10,成为首个进入全球前十的国产模型 HN 讨论
开源 AI 现状 stateofopensource.ai 发布开源 AI 状态报告,HN 热议 363 分
GPT-5.6 Sol GPT-5.6 Sol Ultra 使用 64 个子代理在一小时内证明 50 年数学难题 Cycle Double Cover Conjecture

行业格局

LMArena Overall 变化

本期有重要变动:

  • 新模型上榜:Kimi K3 直接进入第 10 名(1485.6 分);inkling 新上榜第 59 名(1446.8 分)
  • Muse Spark 1.1 分数从 1489.5 升至 1493.1,稳居第 6
  • Grok 4.5 从第 29 名跌至第 34 名,分数下降约 3.4 分

当前 Top 5:

排名 模型 分数
1 Claude Fable 5 1507.5
2 Claude Opus 4.6 (thinking) 1503.8
3 Claude Opus 4.7 (thinking) 1502.3
4 Claude Opus 4.6 1497.8
5 Claude Opus 4.7 1494.0

Artificial Analysis Intelligence

本期无变动。

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max) 53.4
3 GPT-5.6 Luna (max) 51.2

干活选型

Terminal Bench 2.0 变化

  • Claude Opus 4.7 从第 3 名升至第 2 名
  • Gemini 3.1 Pro 从第 2 名降至第 3 名

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (NexAU-AHE) 84.7
2 Claude Opus 4.7 (WOZCODE) 80.2
3 Gemini 3.1 Pro (TongAgents) 80.2

SWE-Bench Verified 变化

  • Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名
  • Claude 4.5 Opus 从第 1 名降至第 2 名

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus medium (live-SWE-agent) 79.2
2 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

Artificial Analysis Agentic / Coding

本期无变动。

Agentic Top 3:

排名 模型 分数
1 Claude Sonnet 5 (Adaptive Reasoning, Max) 46.7
2 GPT-5.6 Luna (max) 45.6
3 GPT-5.5 (xhigh) 44.9

Coding Top 3:

排名 模型 分数
1 GPT-5.5 (xhigh) 74.9
2 Claude Sonnet 5 (Adaptive Reasoning, Max) 71.5
3 GPT-5.6 Luna (max) 71.4

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI CFO 发布的 AI 计分卡提出的四维 ROI 指标(有用工作量、单次成功成本、可靠性、算力回报)是对企业 AI 投入评估方法的首次系统化框架,比传统 token 成本或准确率指标更贴近实际业务场景。Kimi K3 首登 LMArena 即位列第 10,成为首个进入全球前十的国产模型,标志着中国大模型在综合能力上已具备与国际顶尖模型正面竞争的实力。GPT-5.6 Sol Ultra 一小时内证明 50 年数学难题 Cycle Double Cover Conjecture,表明顶级推理模型在复杂科研任务上的能力已从「辅助工具」进入「独立贡献者」阶段。

来源 · 100 条