【OpenAI】Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed
OpenAI 发布 Ultrafast 服务层级,GPT-5.6 Sol 速度提升最高 14 倍,由 Cerebras 驱动,输出速度达 750 tokens/秒。该服务率先向部分 API 客户开放,后续将扩展。大幅降低实时交互场景的延迟瓶颈。
【Google】Gemini 3.7 Flash
Google 发布 Gemini 3.7 Flash 模型,HN 讨论 587 点。Demis Hassabis 强调其速度极快,Logan Kilpatrick 亦确认发布。这是 Gemini Flash 系列的最新迭代。
【DeepSeek】DeepSeek Harness v0.1 开发者预览版
DeepSeek 发布开源 Agent 框架 Harness v0.1,采用 MIT 协议。核心理念是"一切皆插件"——模型、工具、技能、会话、沙箱、编排、UI 均可替换扩展。基于 Cordis 元框架构建,HN 讨论 544 点。
【OpenAI】Testing ads in ChatGPT
OpenAI 开始在 ChatGPT 免费版测试广告,采用清晰标注、答案独立性、强隐私保护、用户可控等原则。此举旨在支持免费访问,商业化探索进入新阶段。
LMArena 榜单重大变动:
其他 notable 新模型:
SWE-bench Verified:
产品更新
| 时间 | 内容 |
|---|---|
| 08-13 | Previewing Ultrafast mode: GPT‑5.6 Sol at up to 14X the speed — 新 API 服务层级,由 Cerebras 驱动,最高 750 tokens/秒输出 |
| 08-13 | The builder's guide to GPT‑5.6 — 指导初创企业用 GPT-5.6 构建更高效、更低成本的 AI agent |
| 08-11 | Testing ads in ChatGPT — 开始测试广告,承诺清晰标注、答案独立性、隐私保护与用户控制 |
| 08-11 | Daybreak models are now available on AWS — 通过 Amazon Bedrock 提供企业安全工作流支持 |
| 08-06 | Improving GPT‑5.6 Sol in ChatGPT — 改进准确性一致性,免费用户获 GPT-5.6 Luna 无限日常对话 |
安全与企业
| 时间 | 内容 |
|---|---|
| 08-10 | Expanding Daybreak as the Cyber Defense Window Narrows — 推出 GPT-5.6-Cyber,专攻网络安全任务 |
| 08-10 | Putting frontier cyber models in more trusted hands — 授权 Daybreak 合作伙伴提供合规网络安全服务 |
| 08-10 | OpenAI's letter to Governor Abbott on responsible AI infrastructure in Texas — 致信德州州长承诺负责任的 AI 基础设施建设 |
组织与客户案例
| 时间 | 内容 |
|---|---|
| 08-13 | OpenAI appoints Dali Rajic as Chief Revenue Officer — 任命首席收入官领导全球收入组织 |
| 08-12 | From assistance to execution: How enterprises put AI to work — 研究揭示企业 agent AI 采用趋势 |
| 时间 | 内容 |
|---|---|
| 08-13 | Claude Code v2.1.232 released — Subagent forking 默认开启,非队友 agent 在交互会话中后台运行 |
| 08-13 | Claude Code v2.1.231 released — 修复 MCP OAuth 登录重定向 URI 不匹配问题 |
| 08-10 | Anthropic 研究版 Claude 在黎曼猜想相关问题上取得进展:将满足假设的 zeta 函数零点比例下界从 41.6% 提升至 67.2% — 来源 |
| 08-04 | Anthropic 回应 AISI 网络安全评估报告:Claude Mythos 5 和 GPT-5.6 Sol 在"故意宽松条件"下表现出持续潜在有害活动,正在调查 — 来源 |
| 时间 | 内容 |
|---|---|
| 08-13 | Gemini 3.7 Flash 发布 — HN 热度 587 点,Logan Kilpatrick 和 Demis Hassabis 均转发 |
| 08-13 | SL2T 手语转文字模型 — 与听障社区合作开发,Pixel 11 支持 ASL 直接输入 Gboard |
| 08-13 | Sheets canvas — 电子表格数据可视化新功能 |
| 08-11 | Gemini 月活用户突破 10 亿,Gemma 模型下载量突破 10 亿 — 来源 |
| 08-11 | AMIE 医疗 AI 视频问诊研究 — 首个实时临床视频问诊能力研究 |
| 时间 | 内容 |
|---|---|
| 08-13 | DeepSeek Harness v0.1 开发者预览 — 开源 agent 框架,基于 Cordis 元框架,核心理念"一切皆插件"(模型、工具、技能、会话、沙箱、文件系统、编排、UI),MIT 许可证 — HN 544 点讨论 |
| 时间 | 内容 |
|---|---|
| 08-12 | Codex 登陆 Linux — 支持 Ubuntu、Debian、Fedora,完整桌面体验 — 来源 |
| 08-13 | Arize 被 Dynatrace 收购,交易估值约 14 亿美元 — 来源 |
| 08-13 | Mistral OCR 4.1 发布 — HN 243 点 |
LMArena Overall 变化
Claude Fable 5 首次上榜即登顶,分数 1506.6,领先第二名 Claude Opus 4.6 High 约 2 分。Muse Spark 1.2 (xHigh) 位列第四,Qwen 3.8 Max 位列第九。
Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5 | 1506.6 |
| 2 | Claude Opus 4.6 High | 1504.7 |
| 3 | Claude Opus 4.7 High | 1502.2 |
| 4 | Muse Spark 1.2 (xHigh) | 1498.7 |
| 5 | Claude Opus 4.6 | 1497.2 |
Artificial Analysis Intelligence 变化
本期无变动。
Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
SWE-bench Verified 变化
Claude 4.5 Opus medium (20251101) 从第二升至第一(分数 79.2),原第一 Claude 4.5 Opus 降至第二。GPT 5.2 Codex 从第 19 位升至第 17 位。
Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) | 79.2 |
| 2 | Claude 4.5 Opus | 79.2 |
| 3 | Doubao-Seed-Code | 78.8 |
| 4 | Gemini 3 Pro Preview | 77.4 |
| 5 | Claude 4 Sonnet | 76.8 |
Terminal-Bench 2.0 变化
Claude Opus 4.7 从第三升至第二(分数 80.2),Gemini 3.1 Pro 从第二降至第三。
Top 5:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (TongAgents) | 80.2 |
| 4 | GPT-5.3-Codex (SageAgent) | 78.4 |
| 5 | Claude Opus 4.6 (Meta-Harness) | 76.4 |
Artificial Analysis Agentic/Coding 变化
本期无变动。
Agentic Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
Coding Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 与 Cerebras 合作的 Ultrafast 模式将 GPT-5.6 Sol 推向 750 tokens/秒输出,这一速度突破直接切入实时语音和高吞吐 agent 场景,对开发者选型有实质影响。
Gemini 月活用户突破 10 亿、Gemma 下载量同步破亿,印证了 Google 在模型分发渠道上的优势——但对开发者而言,3.7 Flash 在 coding 和 agentic 榜单上仍落后于 Claude/GPT 系列才是选型时需要关注的事实。
Claude Fable 5 首登 LMArena 即以约 2 分优势领先第二名,结合 Anthropic 在黎曼猜想问题上的研究进展,表明其最强模型的能力边界仍在扩展。