← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-26

2026-08-26 08:54 CST
快速版 完整版

核心速览

【OpenAI】Jalapeño 自研推理芯片首批结果公布,号称超越 Nvidia Blackwell

OpenAI 发布自研推理芯片 Jalapeño 的首批测试结果,在吞吐量和延迟方面均优于 Nvidia Blackwell,实现更高能效的 AI 推理。SemiAnalysis HN 讨论热度达 305 分。这是 OpenAI 全栈战略的关键一环,意味着其在芯片层不再完全依赖第三方供应商,可能重塑推理算力市场格局。

🔗 Jalapeño's first results show industry-leading speed and efficiency in AI inferenceHN 讨论


【OpenAI】ChatGPT Business Premium 席位上线,$100/席无 5 小时限制

OpenAI 推出面向中小企业和初创团队的 $100 Premium 席位,包含 ChatGPT、Codex 全部功能,支持 Google Workspace/Slack/GitHub 集成,SAML SSO+MFA 安全管理,无 5h 使用限制。同日,Plus 账号恢复 5 小时滚动限制以平滑计算负载。

🔗 ChatGPT Business Premium Seats


【OpenAI Developers】WebMCP 标准发布,开启 Agent 原生 Web

OpenAI 在 ChatGPT 桌面端内置浏览器中上线 WebMCP 支持,网站可向 Agent 暴露工具接口,用户与 Codex 可在同一界面协作。同步启动 10 天黑客松,总奖池 $35,000,合作伙伴包括 Chromium、Cloudflare、Shopify、Vercel 等。WebMCP 让 Agent 直接调用网站功能而非模拟人类点击,可能成为 Agent 与 Web 交互的新标准范式。

🔗 The WebMCP Challenge


【OpenAI】GPT-5.6 Sol 降价超 20%,Ultrafast 模式预览达 14 倍速

OpenAI 将 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%(持续 3 个月),同时预览 Ultrafast 服务层级,由 Cerebras 驱动,GPT-5.6 Sol 运行速度最高达 14 倍,输出 750 tokens/秒。

🔗 Previewing Ultrafast mode


重大 Benchmark 变化

SWE-bench Verified:Claude 4.5 Opus 内部排序变动

Claude 4.5 Opus(通用条目)从第 1 降至第 2,Claude 4.5 Opus medium (20251101) 从第 2 升至第 1。两者分数均为 79.2,为同分数下的排名微调,无实质分数变化。其余排名变动均为 ±1 的同分数调整,未达到报告阈值。

快速预览

  • OpenAI 发布自研推理芯片 Jalapeño,首批结果显示吞吐量与功耗均优于 Nvidia Blackwell
  • OpenAI 推出 ChatGPT Business Premium 席位($100/席),无 5 小时限制,面向中小企业
  • OpenAI 上线 WebMCP 标准,ChatGPT 桌面端内置浏览器可自动调用网站工具
  • Claude Code 连发 v2.1.245/246,修复 glibc 2.44 崩溃并增加 Bash 通配符安全警告
  • SWE-bench Verified 榜单微调:Claude 4.5 Opus medium 升至第 1,Terminal-Bench 2 中 Claude Opus 4.7 与 Gemini 3.1 Pro 互换第 2/3

新闻

OpenAI

日期 标题 要点
08-25 The full stack behind abundant intelligence CFO Sarah Friar 阐述芯片、算力、模型、产品四层叠加如何降低智能成本
08-25 Jalapeño's first results show industry-leading speed and efficiency in AI inference 自研推理芯片 Jalapeño 首批结果:更高吞吐、更低延迟与功耗
08-25 Disrupting a new covert influence campaign from Russia 封禁俄罗斯账号利用 AI 推广虚假以色列智库与"主权"指数
08-25 Introducing the Admin plugin for ChatGPT Work and Codex Admin 插件支持工作区用量分析、成员管理、权限与限额调整
08-25 ChatGPT Business Premium Seats $100/席 Premium 席位,无 5h 限制,含 SAML/SSO/MFA、集中计费
08-25 ChatGPT Work 可安全登录网站 ChatGPT Work 可代用户登录网站执行任务,不接触用户名密码
08-25 WebMCP Challenge 启动 联合 Chromium/Cloudflare/Shopify/Vercel 等,10 天黑客松,$35K 现金奖
08-25 WebMCP 支持上线 ChatGPT 桌面端内置浏览器与 Sites 支持 WebMCP,网站可向 agent 暴露工具
08-25 Plus 账号恢复 5h 限制 明日起 ChatGPT Work 和 Codex 的 Plus 账号恢复 5 小时滚动限制;Pro $100/$200 不受影响
08-25 DevDay 2026 预告 Tibo 称 DevDay 2026 将是公司史上最佳
08-24 GPT‑5.6 in Kiro GPT-5.6 进入 Kiro,帮助开发者规划、构建、审查、测试软件
08-24 a16z 数据:Codex 在非科技行业高速增长 Codex 自 2 月以来:法律 108x、销售 41x、招聘 41x、营销 26x、医疗 24x
08-21 GPT-5.6 Sol 降价超 20% API 与 credit 定价下调超 20%,持续 3 个月
08-20 Introducing AI Futures 新博客探讨变革性 AI 对权力、治理、经济与自由的影响
08-20 Stampli 用 ChatGPT Work 缩短 68% 上线时间 Codex + ChatGPT Work 将数周上线工作压缩至数天
08-19 Zero Data Retention for frontier models 重申合格 API 客户零数据保留,预览 Private Safety Processing
08-19 Replit Free Mode with GPT-5.6 Luna Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,免 token 费用
08-18 ChatGPT Ads 扩展至 31 个欧洲市场 广告产品覆盖 31 个欧洲国家
08-18 Strengthening democratic oversight in national security 为政府机构提供工具、培训与专业知识
08-18 Partnering with CodeAI 合作培养学生的 AI 素养与批判性思维
08-18 Pacing model development 加强前沿模型的监控、对齐与安全防护
08-18 ChatGPT for Teens 面向青少年,含强化保护与健康使用功能
08-18 NVIDIA 用 ChatGPT Work 规模化专业知识 NVIDIA 团队用 ChatGPT Work 减少手工任务
08-18 Asana 用 Codex 两周完成五年工程量 替换旧测试系统,约 $12K 成本
08-17 The Defender's Window AI 重塑攻防安全,OpenAI 分享防御实践
08-17 OpenAI joins PORTS-Pike project 扩大社区投资,支持南俄亥俄数千就业
08-17 New policy ideas for the Intelligence Age 资助 14 个独立 AI 政策研究项目
08-13 Builder's guide to GPT‑5.6 初创用 GPT-5.6 构建更高效的 AI agent
08-13 Previewing Ultrafast: GPT-5.6 Sol up to 14× speed Cerebras 驱动,最高 750 output tokens/s
08-13 Dali Rajic 任 CRO 领导全球营收组织
08-12 From assistance to execution 研究揭示企业 agentic AI 采用现状

Anthropic / Claude

日期 标题 要点
08-25 Claude Code v2.1.246 新增 Bash allow 通配符安全警告(如 git * main 会匹配插入的选项)
08-25 Claude Code v2.1.245 修复 glibc 2.44 发行版(Arch/CachyOS/Fedora Rawhide)启动崩溃
08-25 Claude 记忆升级 chat 与 Cowork 共享单一记忆,用户可控制内容
08-23 Claude Code v2.1.241 Bug 修复与稳定性提升
08-22 Claude Code v2.1.240 Bug 修复与稳定性提升
08-21 Claude Code v2.1.239 /cost、状态行、--max-budget-usd 计入 1.1× 美国独占推理溢价
08-21 Claude Security scans on Mythos 5 公开 beta,面向所有 Claude Enterprise 客户,无需单独模型访问
08-20 Computer use / Browser / Skills / Files API GA Claude 平台四项 API 正式可用
08-14 Claude 文本水印 FAQ 为合规 EU AI Act 实施水印;不影响输出质量、无隐藏字符、不加 token 费用、不可追溯个人
08-14 第二期 Risk Report 作为 Responsible Scaling Policy 一部分发布

Google / DeepMind

日期 标题 要点
08-25 5 ways to upgrade home decor with Google Search Google Search 家居装饰功能
08-22 Gemini 3.7 为史上增速最快模型 Logan Kerr 确认 3.7 系列增速破纪录
08-22 Sundar 确认 3.7 Flash 破增长纪录 已上线 Search 和 Gemini App;ARC-AGI-2: 84.6%, $0.25/task
08-21 DeepMind × FenrisCreations 游戏研究 探索持续学习、深度记忆、长期规划、多 agent 动态
08-19 5 ways to level up learning with Search Search 学习工具更新
08-18 矩阵乘法新 ω 纪录 宣布矩阵乘法复杂度常数 ω 新纪录(arXiv
08-17 Gemini × Pixel 足球合作 球迷体验升级
08-14 Gemini 3.7 Flash 上线 Pro/Ultra 改进多步推理与准确性;Spark 也切换到 3.7 Flash

DeepSeek

日期 标题 要点
08-13 DeepSeek Harness v0.1 开发者预览 MIT 许可开源,基于 Cordis 元框架,一切皆插件(模型/工具/技能/会话/沙箱等)

其他

日期 标题 要点
08-25 HN 热帖:OpenAI Jalapeño better than Nvidia Blackwell SemiAnalysis 深度分析,HN 305 分
08-22 swyx: "Simulation is a new scaling law" 转发 Joon Sung Park 关于社会模拟作为新 scaling law 的讨论
08-22 AI Engineer World's Fair: AI Factories Track 模型是工厂里最简单的部分;涵盖 FinOps、路由、临床 AI 笔记等
08-14 Simon Willison 转发 GLM-5.3 发布 Z.ai 发布 GLM-5.3:743B 基座后训练,主打编码与网络安全

Benchmark 快照

行业格局

[Artificial Analysis / Intelligence]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Grok 4.6 (medium) 59.0
3 Muse Spark 1.2 (xhigh) 56.8

[LMArena / Overall]

本期无变动。当前 Top 3:

排名 模型 分数
1 claude-fable-5 1507.77
2 claude-opus-4-6-high 1504.49
3 claude-opus-4-7-high 1502.01

干活选型

[Artificial Analysis / Agentic]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 Grok 4.6 (medium) 56.3
3 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7

[Artificial Analysis / Coding]

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Grok 4.6 (medium) 74.4

[SWE-bench Pro / Public]

本期无变动。当前 Top 3:

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

[SWE-bench Verified / Verified]

有变动。主要变化:

变化 模型 分数 说明
↑ 1→1 Claude 4.5 Opus medium (20251101) (live-SWE-agent) 79.2 与上期第 1 名分数相同,排名上调至第 1
↓ 1→2 Claude 4.5 Opus (Sonar Foundation Agent) 79.2 同分 79.2,排名互换
↑ 14→13 Claude 4 Sonnet + o4-mini 74.4 微调上升一位
↓ 13→14 GPT-5 74.4 微调下降一位
↑ 32→31 GPT 5.1 Codex (medium) 66.0 与 GPT 5.1 (medium) 互换
↓ 31→32 GPT 5.1 (2025-11-13) (medium) 66.0
↑ 19→17 GPT 5.2 Codex 72.8 上升两位
↓ 18→19 GPT 5.2 (high) 72.8
↓ 17→18 GLM 5 (high) 72.8
↑ 51→50 Qwen3-Coder 480B/A35B Instruct 55.4 与 GLM 4.6 互换
↓ 50→51 GLM 4.6 (T=1) 55.4

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

[Terminal-Bench 2 / [email protected]]

有变动。主要变化:

变化 模型 分数 说明
↑ 3→2 Claude Opus 4.7 (WOZCODE) 80.2 与 Gemini 3.1 Pro 互换
↓ 2→3 Gemini 3.1 Pro (TongAgents) 80.2 同分 80.2,排名互换
↑ 39→38 Grok 4 27.2 与 Qwen 3 Coder 480B 互换
↓ 38→39 Qwen 3 Coder 480B 27.2

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

OpenAI Jalapeño 自研推理芯片首批结果公布:SemiAnalysis 分析称其吞吐量与功耗表现优于 Nvidia Blackwell,HN 热度达 305 分。若该数据可复现,意味着 OpenAI 在推理层不再完全依赖第三方 GPU——叠加同日发布的 $100 Business Premium 席位和 GPT-5.6 Sol 上周 20% 降价,OpenAI 正在从芯片到定价全栈压低成本以扩大用户基数。

WebMCP 标准上线 + 黑客松启动:ChatGPT 桌面端内置浏览器现在可自动调用兼容网站的暴露工具,且联合 Chromium/Cloudflare/Shopify/Vercel 等发起 10 天 $35K 黑客松。这实质上是 OpenAI 在定义"agent 与网页交互"的开放协议——如果生态成型,网站将同时服务人类与 agent,改变流量分发逻辑。

Plus 账号恢复 5h 限制:Tibo 明确称此举为"平滑计算负载"并防止新用户"意外耗尽整周用量",同时 Pro $100/$200 不受影响。配合同日上线的 $100 Business Premium(无 5h 限制),OpenAI 正在用容量管理倒逼高活跃用户向付费层迁移。

来源 · 79 条