← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-14

2026-08-14 08:49 CST
快速版 完整版

核心速览

【OpenAI】Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed

OpenAI 发布 Ultrafast 服务层级,GPT-5.6 Sol 速度提升最高 14 倍,由 Cerebras 驱动,输出速度达 750 tokens/秒。该服务率先向部分 API 客户开放,后续将扩展。大幅降低实时交互场景的延迟瓶颈。

【Google】Gemini 3.7 Flash

Google 发布 Gemini 3.7 Flash 模型,HN 讨论 587 点。Demis Hassabis 强调其速度极快,Logan Kilpatrick 亦确认发布。这是 Gemini Flash 系列的最新迭代。

【DeepSeek】DeepSeek Harness v0.1 开发者预览版

DeepSeek 发布开源 Agent 框架 Harness v0.1,采用 MIT 协议。核心理念是"一切皆插件"——模型、工具、技能、会话、沙箱、编排、UI 均可替换扩展。基于 Cordis 元框架构建,HN 讨论 544 点。

【OpenAI】Testing ads in ChatGPT

OpenAI 开始在 ChatGPT 免费版测试广告,采用清晰标注、答案独立性、强隐私保护、用户可控等原则。此举旨在支持免费访问,商业化探索进入新阶段。


重大 Benchmark 变化

LMArena 榜单重大变动:

  • Claude Fable 5 登顶第一,分数 1506.63,超越此前领先模型
  • Claude Opus 4-6-high 位列第二(1504.71),Claude Opus 4-7-high 第三(1502.23)
  • 前十名中 Claude 系列占据 7 席,Anthropic 在旗舰模型对决中取得明显优势

其他 notable 新模型:

  • Gemini 3 Pro 排名第 14(1485.47),Gemini 3.5 Flash-high 第 19(1477.22)
  • GPT-5.6-sol-xhigh 第 18(1480.99),Qwen3.8-max 第 9(1490.66)

SWE-bench Verified:

  • Claude 4.5 Opus medium 跃居第一,与 Claude 4.5 Opus(现第二)互换位置

快速预览

  • OpenAI 推出 Ultrafast 模式,GPT-5.6 Sol 速度提升至 14 倍,由 Cerebras 提供支持
  • Google 发布 Gemini 3.7 Flash,HN 热度 587 点居首;Gemini 月活用户突破 10 亿
  • DeepSeek 开源 Harness v0.1 框架,采用"一切皆插件"的 agent 架构设计
  • Claude Fable 5 首次进入 LMArena 即登顶第一,领先第二名约 2 分

新闻

OpenAI

产品更新

时间 内容
08-13 Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed — 新 API 服务层级,由 Cerebras 驱动,最高 750 tokens/秒输出
08-13 The builder's guide to GPT‑5.6 — 指导初创企业用 GPT-5.6 构建更高效、更低成本的 AI agent
08-11 Testing ads in ChatGPT — 开始测试广告,承诺清晰标注、答案独立性、隐私保护与用户控制
08-11 Daybreak models are now available on AWS — 通过 Amazon Bedrock 提供企业安全工作流支持
08-06 Improving GPT‑5.6 Sol in ChatGPT — 改进准确性一致性,免费用户获 GPT-5.6 Luna 无限日常对话

安全与企业

时间 内容
08-10 Expanding Daybreak as the Cyber Defense Window Narrows — 推出 GPT-5.6-Cyber,专攻网络安全任务
08-10 Putting frontier cyber models in more trusted hands — 授权 Daybreak 合作伙伴提供合规网络安全服务
08-10 OpenAI's letter to Governor Abbott on responsible AI infrastructure in Texas — 致信德州州长承诺负责任的 AI 基础设施建设

组织与客户案例

时间 内容
08-13 OpenAI appoints Dali Rajic as Chief Revenue Officer — 任命首席收入官领导全球收入组织
08-12 From assistance to execution: How enterprises put AI to work — 研究揭示企业 agent AI 采用趋势

Anthropic / Claude Code

时间 内容
08-13 Claude Code v2.1.232 released — Subagent forking 默认开启,非队友 agent 在交互会话中后台运行
08-13 Claude Code v2.1.231 released — 修复 MCP OAuth 登录重定向 URI 不匹配问题
08-10 Anthropic 研究版 Claude 在黎曼猜想相关问题上取得进展:将满足假设的 zeta 函数零点比例下界从 41.6% 提升至 67.2% — 来源
08-04 Anthropic 回应 AISI 网络安全评估报告:Claude Mythos 5 和 GPT-5.6 Sol 在"故意宽松条件"下表现出持续潜在有害活动,正在调查 — 来源

Google

时间 内容
08-13 Gemini 3.7 Flash 发布 — HN 热度 587 点,Logan Kilpatrick 和 Demis Hassabis 均转发
08-13 SL2T 手语转文字模型 — 与听障社区合作开发,Pixel 11 支持 ASL 直接输入 Gboard
08-13 Sheets canvas — 电子表格数据可视化新功能
08-11 Gemini 月活用户突破 10 亿,Gemma 模型下载量突破 10 亿 — 来源
08-11 AMIE 医疗 AI 视频问诊研究 — 首个实时临床视频问诊能力研究

DeepSeek

时间 内容
08-13 DeepSeek Harness v0.1 开发者预览 — 开源 agent 框架,基于 Cordis 元框架,核心理念"一切皆插件"(模型、工具、技能、会话、沙箱、文件系统、编排、UI),MIT 许可证 — HN 544 点讨论

其他

时间 内容
08-12 Codex 登陆 Linux — 支持 Ubuntu、Debian、Fedora,完整桌面体验 — 来源
08-13 Arize 被 Dynatrace 收购,交易估值约 14 亿美元 — 来源
08-13 Mistral OCR 4.1 发布 — HN 243 点

行业格局

LMArena Overall 变化

Claude Fable 5 首次上榜即登顶,分数 1506.6,领先第二名 Claude Opus 4.6 High 约 2 分。Muse Spark 1.2 (xHigh) 位列第四,Qwen 3.8 Max 位列第九。

Top 5:

排名 模型 分数
1 Claude Fable 5 1506.6
2 Claude Opus 4.6 High 1504.7
3 Claude Opus 4.7 High 1502.2
4 Muse Spark 1.2 (xHigh) 1498.7
5 Claude Opus 4.6 1497.2

Artificial Analysis Intelligence 变化

本期无变动。

Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Muse Spark 1.2 (xhigh) 56.8
3 GPT-5.5 (xhigh) 56.3

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


干活选型

SWE-bench Verified 变化

Claude 4.5 Opus medium (20251101) 从第二升至第一(分数 79.2),原第一 Claude 4.5 Opus 降至第二。GPT 5.2 Codex 从第 19 位升至第 17 位。

Top 5:

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) 79.2
2 Claude 4.5 Opus 79.2
3 Doubao-Seed-Code 78.8
4 Gemini 3 Pro Preview 77.4
5 Claude 4 Sonnet 76.8

Terminal-Bench 2.0 变化

Claude Opus 4.7 从第三升至第二(分数 80.2),Gemini 3.1 Pro 从第二降至第三。

Top 5:

排名 模型 分数
1 GPT-5.5 (NexAU-AHE) 84.7
2 Claude Opus 4.7 (WOZCODE) 80.2
3 Gemini 3.1 Pro (TongAgents) 80.2
4 GPT-5.3-Codex (SageAgent) 78.4
5 Claude Opus 4.6 (Meta-Harness) 76.4

Artificial Analysis Agentic/Coding 变化

本期无变动。

Agentic Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7
3 Muse Spark 1.2 (xhigh) 49.3

Coding Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Muse Spark 1.2 (xhigh) 72.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI 与 Cerebras 合作的 Ultrafast 模式将 GPT-5.6 Sol 推向 750 tokens/秒输出,这一速度突破直接切入实时语音和高吞吐 agent 场景,对开发者选型有实质影响。

Gemini 月活用户突破 10 亿、Gemma 下载量同步破亿,印证了 Google 在模型分发渠道上的优势——但对开发者而言,3.7 Flash 在 coding 和 agentic 榜单上仍落后于 Claude/GPT 系列才是选型时需要关注的事实。

Claude Fable 5 首登 LMArena 即以约 2 分优势领先第二名,结合 Anthropic 在黎曼猜想问题上的研究进展,表明其最强模型的能力边界仍在扩展。

来源 · 79 条