← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-16

2026-07-16 08:47 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 发布:三档模型覆盖不同场景 GPT-5.6 分为 Sol(旗舰推理)、Terra(均衡)、Luna(快速推理)三档,GPT-5.6 Luna 在最高推理设置下性能超越 GPT-5.5,成本降低 25 倍。已登陆 Microsoft 365 Copilot 和 Amazon Bedrock。[GPT-5.6: Frontier intelligence]

【OpenAI】Codex 与 ChatGPT Work 用户突破 800 万 Codex 周活用户达 700 万+,150+ 更新发布。OpenAI 多次重置使用限制以应对需求激增,并推出 100 美元 Codex 积分奖励活动吸引用户从 Claude 迁移。[Codex update]

【Anthropic】Claude Fable 5 登顶 LM Arena 排行榜 Claude Fable 5 以 1508.62 分位居 LM Arena 总榜第一,Claude Opus 4-6-thinking 排名第二。同期推出 Claude for Teachers,为美国 K-12 教师提供免费高级功能。[Claude Fable 5]

【Thinking Machines】发布开源模型 Inkling Inkling 在 Artificial Analysis Agentic 排行榜位列第 8 名(32.3 分),Coding 排行榜位列第 13 名(52.1 分),展示了开源模型在智能体领域的竞争力。[Inkling: Our Open-Weights Model]

【xAI】Grok Build 开源 xAI 开源 Grok Build,同时在 HN 获得 221 点讨论热度。此举为 AI 编程智能体领域增添新的开源选择。[Grok Build is open source]

重大 Benchmark 变化

LM Arena 总榜新格局

  • Claude Fable 5 新上榜即夺第一(1508.62 分)
  • Claude Opus 4-6-thinking 新上榜排名第二(1503.68 分)
  • Claude Opus 4-7-thinking 新上榜排名第三(1502.81 分)
  • GPT-5.6-sol-xhigh 新上榜排名第八(1486.31 分)

SWE-Bench Verified 排名变动

  • Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(79.2 分)
  • Claude 4.5 Opus 从第 1 名降至第 2 名(79.2 分)

Artificial Analysis Agentic 新秀

  • Inkling 新上榜排名第八(32.3 分),超越 GPT-5、Kimi K2.6 等模型

快速预览

  • OpenAI 发布 GPT-Red 自动红队系统,用自我博弈提升模型安全性
  • Claude Fable 5 登顶 LMArena 总榜,Inkling 开源模型首秀进入 AA 榜单前十
  • JetBrains AI 推荐 Codex 作为默认代理,OpenAI Codex 周活用户突破 700 万
  • Anthropic 面向美国 K-12 教师推出免费 Claude for Teachers 计划
  • Google DeepMind 呼吁解决 AI 科学发现的验证瓶颈问题

OpenAI

7 月 15 日

7 月 14 日

  • How to manage AI investments in the agentic era — 企业如何用"单位美元有效工作量"衡量 AI 投资
  • Codex 周活用户达 700 万,两个月更新 150+ 项功能;GPT-5.6 Sol Ultra 证明 50 年数学猜想 Cycle Double Cover
  • JetBrains AI 推荐 Codex 为默认代理,称将按月重新评估模型选择

7 月 10 日

  • GPT-5.6 Luna 性价比 GPT-5.5 最高推理设置高 25 倍;Bio Bug Bounty 奖励翻倍至 $50K

7 月 9 日


Anthropic

7 月 15 日

  • Claude Code v2.1.211 发布,新增 --forward-subagent-text 标志支持流式 JSON 输出子代理内容
  • Claude Code artifacts 现支持调用 MCP 连接器,可构建动态数据仪表盘

7 月 14 日

  • Claude for Teachers — 面向美国 K-12 教师免费开放高级功能,提供教学技能库并对接各州课程标准
  • Anthropic 承诺 1000 万加元资助加拿大 AI 研究

7 月 9 日

  • Dr. Ben Bernanke 加入 Anthropic 长期利益信托担任理事

Google

7 月 15 日

  • Google DeepMind 发布文章探讨 AI 代理科学发现的验证瓶颈,提出政策制定者和资助方的四项优先事项

7 月 14 日

  • Google Images 迎来 25 周年,回顾视觉搜索创新历程

其他

来源 新闻
Thinking Machines Inkling 开源权重模型发布,进入 AA Agentic 榜单第 8 名
xAI Grok Build 开源,HN 热度 221 分

行业格局

LMArena 总榜变化

  • claude-fable-5 新上榜即登顶第 1 名(1508.6 分)
  • Top 5 均为 Claude 模型:fable-5、opus-4-6-thinking、opus-4-7-thinking、opus-4-6、opus-4-7
  • 新上榜模型:muse-spark-1.1(第 6)、muse-spark(第 7)、gpt-5.6-sol-xhigh(第 8)、gemini-3-pro(第 9)、gemini-3.1-pro-preview(第 10)

Artificial Analysis 智能榜

本期无变动。Top 3:GPT-5.5 (54.8)、Claude Sonnet 5 (53.4)、GPT-5.6 Luna (51.2)


干活选型

AA Agentic 变化

模型 变化
Inkling 新上榜第 8 名(32.3 分)
Nex-N2-Pro 第 8 → 9
Kimi K2.6 第 9 → 10

本期 Top 3:Claude Sonnet 5 (46.7)、GPT-5.6 Luna (45.6)、GPT-5.5 (44.9)

AA Coding 变化

模型 变化
Inkling 新上榜第 13 名(52.1 分)

本期 Top 3:GPT-5.5 (74.9)、Claude Sonnet 5 (71.5)、GPT-5.6 Luna (71.4)

SWE-bench Verified 变化

  • Claude 4.5 Opus medium (20251101) 第 2 → 1 名
  • Claude 4.5 Opus 第 1 → 2 名

Terminal-Bench 2.0 变化

  • Claude Opus 4.7 第 3 → 2 名
  • Gemini 3.1 Pro 第 2 → 3 名

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

Claude Fable 5 首日登顶 LMArena 总榜:作为新发布的模型直接超越所有现有模型拿到第一名,且 Top 5 被 Claude 系列包揽,显示 Anthropic 在通用对话能力上的领先优势。

GPT-Red 自动红队系统值得关注:通过自我博弈而非人工红队来发现 prompt 注入漏洞,这种规模化自动化安全测试方式可能是未来模型安全评估的方向。

Inkling 开源模型首秀进入 AA Agentic 榜单前十:新发布的开源权重模型在代理能力上超越 Nex-N2-Pro、Kimi K2.6 等闭源模型,显示开源社区在代理领域的追赶速度。

来源 · 94 条