← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-17

2026-07-17 08:34 CST
快速版 完整版

核心速览

【Kimi】Kimi K3 开放前沿智能模型发布

Kimi 发布 K3 开放前沿智能模型,定位为开源替代方案。HN 讨论热度达 1084 点。此举为国产大模型开源生态再添重要一员,开发者可基于此构建本地化应用。

原文链接


【Google】NotebookLM 更名为 Gemini Notebook

Google 将 NotebookLM 正式更名为 Gemini Notebook,进一步整合至 Gemini 产品线。此举显示 Google 正统一 AI 产品品牌,简化用户认知路径。

原文链接


【OpenAI】GPT-5.6 Sol Ultra 攻克 50 年数学难题

GPT-5.6 Sol Ultra 成功证明 Cycle Double Cover Conjecture(50 年未解数学难题),使用 64 个子智能体在约 1 小时内完成。这是 AI 首次独立攻克长期悬而未决的数学问题,标志着 AI 在科研领域的能力跨越。

原文链接


【Anthropic】Claude for Teachers 面向美国 K-12 教师免费开放

Anthropic 推出 Claude for Teachers,为美国 K-12 认证教师提供免费高级功能访问,内置教学内容库并对接全美 50 州课程标准。

原文链接


【OpenAI】Codex Micro 键盘 14 小时售罄

OpenAI 推出的限量版 Codex Micro 硬件键盘在不到 14 小时内售罄,开发者可通过该设备直接调用 Codex 进行编程。

原文链接


重大 Benchmark 变化

  • Inkling (xhigh) 首次进入 Agentic 排名第 8 位(32.3 分)、Coding 排名第 13 位(52.1 分)
  • Claude 4.5 Opus medium 在 SWE-Bench Verified 排名升至第 1,Claude 4.5 Opus 降至第 2(均为 79.2 分,排名互换)
  • Claude Opus 4.7 在 Terminal Bench 2.0 排名升至第 2,Gemini 3.1 Pro 降至第 3(均为 80.2 分)

快速预览

  • Kimi K3 开源模型发布,HN 热度 1084 点领跑当日讨论
  • OpenAI 发布青少年安全 AI 方案,强调家长控制与教育场景
  • Claude Code v2.1.212 新增 /fork 分流会话到后台
  • Google NotebookLM 更名为 Gemini Notebook
  • GPT-5.6 Sol Ultra 完成数学猜想证明,调用 64 个子智能体

OpenAI

2026-07-17

2026-07-16

2026-07-15

2026-07-14

  • How to manage AI investments in the agentic era:企业衡量「每美元有效工作量」的框架。
  • ChatGPT Work 销售团队与数据科学团队用例发布。
  • Codex 用户达 700 万周活,两个月更新 150+ 项功能。
  • JetBrains AI 将 Codex 设为推荐智能体。

2026-07-10

  • GPT-Live 全球全量上线,周末语音用量限制翻倍。
  • GPT-5.6 Luna 性能超 GPT-5.5 最高推理档,成本仅 1/25。
  • Bio Bug Bounty 升级为长期私有项目,奖金翻倍至 5 万美元。
  • GPT-5.6 Sol Ultra 证明 50 年未解的 Cycle Double Cover 猜想,耗时约 1 小时、调用 64 个子智能体。
  • OpenAI 回应上线反馈:重置用量限制、调整默认设置、修复插件提交问题、桌面端 sidebar 将恢复 chats/projects 入口。

2026-07-09

2026-07-08

2026-07-07

  • Australian Payments Plus 和 MUFG 企业案例。

其他动态

  • Codex Micro 限量硬件开售,14 小时售罄。
  • Codex 新增 PR Chat:在上下文中讨论 PR、内联编辑审查反馈。
  • GPT-5.6 Sol/Terra/Luna 登陆 AWS Bedrock。
  • Sam Altman:语音模型已跨越关键门槛,其语音使用已超打字。

Anthropic

2026-07-17

  • Claude Code v2.1.212/fork 将会话复制到后台会话(claude agents 独立行),原会话内子智能体改用 /subtask

2026-07-16

  • Claude Code v2.1.211:新增 --forward-subagent-text 标志,stream-json 输出包含子智能体文本和思考。

2026-07-15

  • Claude Code v2.1.210:工具调用折叠行显示实时耗时计数。
  • Claude Code v2.1.209:修复 claude agents 后台会话中 /model 等对话框被阻断问题。
  • Claude Code v2.1.208:新增屏幕阅读器模式(--ax-screen-reader)。
  • Claude Code artifacts 现可调用 MCP 连接器,支持按需获取信息和执行操作。

2026-07-14

  • Claude for Teachers:美国 K-12 教师免费使用高级功能,配套教学技能库和课程标准映射。
  • Anthropic 承诺 1000 万加元资助加拿大 AI 研究。

2026-07-09

  • Long-Term Benefit Trust 任命 Ben Bernanke 为新成员。

2026-07-08

  • 与 AE Studio 合作发布 GRAM 训练方法,将双用途能力(如病毒学)封装为可移除模块。

Google

2026-07-16

2026-07-15

  • DeepMind 发布科学发现验证瓶颈论文,提出四项政策建议。

2026-07-14

2026-07-13

  • Gemini Omni Flash 登顶 Artificial Analysis 视频生成榜单,Text-to-Video 和 Image-to-Video 均第一,略超 ByteDance Seedance 2.0。

2026-07-09

  • AlphaEvolve 在 Google Cloud 正式上线,Gemini 驱动的进化式智能体。

2026-07-07

2026-07-06

  • 与 Apptronik 扩展人形机器人 Apollo 2 数据采集合作。

社区热点

来源 标题 热度
HN Kimi K3: Open Frontier Intelligence 1084 pts
HN NotebookLM is now Gemini Notebook 219 pts
HN The LLM Critics Are Right. I Use LLMs Anyway 182 pts
HN Detecting LLM-Generated Texts with "Classical" Machine Learning 146 pts
HN LM Studio Bionic: the AI agent for open models 132 pts

行业格局

本期无变动

当前 Top 3(Artificial Analysis Intelligence):

  1. GPT-5.5 (xhigh) — 54.8
  2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 53.4
  3. GPT-5.6 Luna (max) — 51.2

当前 Top 3(LMArena Overall):

  1. claude-fable-5 — 1508.6
  2. claude-opus-4-6-thinking — 1503.7
  3. claude-opus-4-7-thinking — 1502.8

干活选型

Agentic 能力

  • 新入榜:Inkling (xhigh) 以 32.3 分排名第 8

当前 Top 3:

  1. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 46.7
  2. GPT-5.6 Luna (max) — 45.6
  3. GPT-5.5 (xhigh) — 44.9

Coding 能力

  • 新入榜:Inkling (xhigh) 以 52.1 分排名第 13

当前 Top 3:

  1. GPT-5.5 (xhigh) — 74.9
  2. Claude Sonnet 5 (Adaptive Reasoning, Max Effort) — 71.5
  3. GPT-5.6 Luna (max) — 71.4

SWE-bench Verified

  • 排名变化:Claude 4.5 Opus medium (20251101) 第 2→1;Claude 4.5 Opus 第 1→2(同分 79.2)
  • 其他:GPT-5-2 Codex 18→16;GPT-5 13→14;Claude 4 Sonnet + o4-mini 14→13

当前 Top 3:

  1. Claude 4.5 Opus medium (20251101) — 79.2
  2. Claude 4.5 Opus — 79.2
  3. Doubao-Seed-Code — 78.8

Terminal-Bench 2.0

  • 排名变化:Claude Opus 4.7 第 3→2;Gemini 3.1 Pro 第 2→3(同分 80.2)

当前 Top 3:

  1. GPT-5.5 — 84.7
  2. Claude Opus 4.7 — 80.2
  3. Gemini 3.1 Pro — 80.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

GPT-5.6 Sol Ultra 用 64 个子智能体在约 1 小时内完成 50 年未解数学猜想证明,展示了多智能体协作在科研场景的实际突破,而非单纯跑分提升。Kimi K3 以「Open Frontier Intelligence」定位发布,HN 热度 1084 点,反映出开源阵营对封闭模型领先优势的持续挑战。OpenAI 青少年安全方案首次系统披露家长控制与教育场景细节,在 K-12 市场争夺中补齐了合规短板。

来源 · 103 条