← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-15

2026-07-15 08:55 CST
快速版 完整版

核心速览

【OpenAI】GPT-5.6 发布:性能更强成本更低

GPT-5.6 系列包含 Sol、Terra、Luna 三档,其中 Luna 在最高推理设置下超越 GPT-5.5,成本降低 25 倍。GPT-5.6 在 DeepSWE 榜单以 73% 登顶。这是 OpenAI 首次推出三档性能模型,意图覆盖从旗舰推理到快速响应的全场景需求。

原文链接

【OpenAI】ChatGPT Work 发布:AI Agent 可跨应用执行任务

ChatGPT Work 是内置于 ChatGPT 的 Agent,可跨应用和文件执行任务,能持续数小时追踪项目直至完成目标。现已覆盖 Web、桌面和移动端。这标志着 ChatGPT 从对话助手转向可自主完成复杂工作流的 Agent。

原文链接

【OpenAI】GPT-5.6 Sol Ultra 解决 50 年数学难题

GPT-5.6 Sol Ultra 在 1 小时内使用 64 个子 Agent 完成了 Cycle Double Cover Conjecture 的证明。该难题困扰数学界 50 年。这是 AI 首次在复杂数学证明领域展现系统化推理能力。

原文链接

【Anthropic】Claude for Teachers:向美国 K-12 教师免费开放

Anthropic 推出 Claude for Teachers,向美国 K-12 认证教师免费提供高级功能,配套教学技能库和对接各州学术标准的课程资源。同期宣布向加拿大 AI 研究机构投入 1000 万加元。

原文链接

【Google DeepMind】Gemini Omni Flash 登顶视频生成榜

Gemini Omni Flash 在 Artificial Analysis 的文生视频和图生视频榜单均排名第一,以微弱优势超越字节跳动 Seedance 2.0。模型支持文本/图片/视频输入,生成带原生音频的 720p 24fps 视频。

原文链接

重大 Benchmark 变化

无重大变化。所有排名变动均未达到排名变动≥5 或分数变动≥5% 的阈值。

快速预览

  • OpenAI GPT-5.6 持续火爆:Codex + ChatGPT Work 活跃用户突破 800 万,Sam Altman 称增长"疯狂"
  • JetBrains 推荐 Codex 作为 AI 助手默认代理,GPT-5.6 生态快速扩张
  • Anthropic 推出 Claude for Teachers,为美国 K-12 教师提供免费高级功能
  • Claude Code 连发三版更新,新增屏幕阅读器模式和实时计时器
  • Gemini Omni Flash 登顶 Artificial Analysis 视频生成榜首

OpenAI

GPT-5.6 生态持续升温

产品与生态

日期 动态
7-14 JetBrains AI 推荐 Codex 为默认代理
7-14 Notion 用 GPT-5.6 构建模型评估 CLI 工具
7-14 OpenAI 发布企业 AI 投资管理指南
7-13 ChatGPT 重返 EEA 区 WhatsApp,同时登陆韩国 Kakao 和部分市场 Viber
7-11 GPT-Live 全球全量上线,周末语音额度翻倍

Codex 数据每周活跃用户 700 万+,两个月内 150+ 次更新


Anthropic

产品发布

研究与治理

Claude Code 更新

版本 主要变更
v2.1.210 折叠工具摘要行新增实时计时器,长时间调用不再显得卡住
v2.1.209 修复 claude agents 后台会话中 /model 等对话框被阻止问题
v2.1.208 新增屏幕阅读器模式,支持纯文本渲染

Google

产品动态


行业热点

主题 来源
如何阻止 Claude 说"load-bearing" HN 热门 421 分
Bonsai 27B:可在手机运行的 27B 级模型 HN 热门 402 分
是否把过多思考外包给 AI? HN 热门 372 分
Juggler:开源 GUI 编程代理 HN 热门 170 分

行业格局

本期无变动。当前 Top 3:

排名 模型 分数
1 GPT-5.5 (xhigh) 54.8
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-5.6 Luna (max) 51.2

干活选型

Agentic 排行:本期无变动。Top 3:Claude Sonnet 5 (46.7) → GPT-5.6 Luna (45.6) → GPT-5.5 (44.9)

Coding 排行:本期无变动。Top 3:GPT-5.5 (74.9) → Claude Sonnet 5 (71.5) → GPT-5.6 Luna (71.4)

SWE-bench Verified 变化

变化 模型 分数
↑ 2→1 Claude 4.5 Opus medium (20251101) 79.2
↓ 1→2 Claude 4.5 Opus 79.2
↑ 18→16 GPT-5-2 Codex 72.8

Terminal-Bench 2.0 变化

变化 模型 分数
↑ 3→2 Claude Opus 4.7 80.2
↓ 2→3 Gemini 3.1 Pro 80.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

  1. GPT-5.6 Sol Ultra 一小时内证明 50 年未解数学猜想,展示了前沿模型在高复杂度推理任务中的突破,但这类"高光时刻"是否构成日常生产力增益仍有待观察。

  2. Codex 活跃用户从 700 万涨到 800 万仅用一天,Sam Altman 称增长"疯狂",推理团队支撑需求的压力可见一斑——但频繁重置额度也说明产品化初期的容量规划仍在动态调整中。

  3. JetBrains 选择 Codex 作为默认代理而非自家 Junie,说明在 IDE 领域,模型能力仍是竞争核心,平台方可能倾向于"最佳工具优先"而非绑定自家产品。

来源 · 95 条