【OpenAI】Jalapeño 自研推理芯片首批结果公布,号称超越 Nvidia Blackwell
OpenAI 发布自研推理芯片 Jalapeño 的首批测试结果,在吞吐量和延迟方面均优于 Nvidia Blackwell,实现更高能效的 AI 推理。SemiAnalysis HN 讨论热度达 305 分。这是 OpenAI 全栈战略的关键一环,意味着其在芯片层不再完全依赖第三方供应商,可能重塑推理算力市场格局。
🔗 Jalapeño's first results show industry-leading speed and efficiency in AI inference | HN 讨论
【OpenAI】ChatGPT Business Premium 席位上线,$100/席无 5 小时限制
OpenAI 推出面向中小企业和初创团队的 $100 Premium 席位,包含 ChatGPT、Codex 全部功能,支持 Google Workspace/Slack/GitHub 集成,SAML SSO+MFA 安全管理,无 5h 使用限制。同日,Plus 账号恢复 5 小时滚动限制以平滑计算负载。
🔗 ChatGPT Business Premium Seats
【OpenAI Developers】WebMCP 标准发布,开启 Agent 原生 Web
OpenAI 在 ChatGPT 桌面端内置浏览器中上线 WebMCP 支持,网站可向 Agent 暴露工具接口,用户与 Codex 可在同一界面协作。同步启动 10 天黑客松,总奖池 $35,000,合作伙伴包括 Chromium、Cloudflare、Shopify、Vercel 等。WebMCP 让 Agent 直接调用网站功能而非模拟人类点击,可能成为 Agent 与 Web 交互的新标准范式。
【OpenAI】GPT-5.6 Sol 降价超 20%,Ultrafast 模式预览达 14 倍速
OpenAI 将 GPT-5.6 Sol 的 API 和 credit 定价下调超 20%(持续 3 个月),同时预览 Ultrafast 服务层级,由 Cerebras 驱动,GPT-5.6 Sol 运行速度最高达 14 倍,输出 750 tokens/秒。
SWE-bench Verified:Claude 4.5 Opus 内部排序变动
Claude 4.5 Opus(通用条目)从第 1 降至第 2,Claude 4.5 Opus medium (20251101) 从第 2 升至第 1。两者分数均为 79.2,为同分数下的排名微调,无实质分数变化。其余排名变动均为 ±1 的同分数调整,未达到报告阈值。
| 日期 | 标题 | 要点 |
|---|---|---|
| 08-25 | The full stack behind abundant intelligence | CFO Sarah Friar 阐述芯片、算力、模型、产品四层叠加如何降低智能成本 |
| 08-25 | Jalapeño's first results show industry-leading speed and efficiency in AI inference | 自研推理芯片 Jalapeño 首批结果:更高吞吐、更低延迟与功耗 |
| 08-25 | Disrupting a new covert influence campaign from Russia | 封禁俄罗斯账号利用 AI 推广虚假以色列智库与"主权"指数 |
| 08-25 | Introducing the Admin plugin for ChatGPT Work and Codex | Admin 插件支持工作区用量分析、成员管理、权限与限额调整 |
| 08-25 | ChatGPT Business Premium Seats | $100/席 Premium 席位,无 5h 限制,含 SAML/SSO/MFA、集中计费 |
| 08-25 | ChatGPT Work 可安全登录网站 | ChatGPT Work 可代用户登录网站执行任务,不接触用户名密码 |
| 08-25 | WebMCP Challenge 启动 | 联合 Chromium/Cloudflare/Shopify/Vercel 等,10 天黑客松,$35K 现金奖 |
| 08-25 | WebMCP 支持上线 | ChatGPT 桌面端内置浏览器与 Sites 支持 WebMCP,网站可向 agent 暴露工具 |
| 08-25 | Plus 账号恢复 5h 限制 | 明日起 ChatGPT Work 和 Codex 的 Plus 账号恢复 5 小时滚动限制;Pro $100/$200 不受影响 |
| 08-25 | DevDay 2026 预告 | Tibo 称 DevDay 2026 将是公司史上最佳 |
| 08-24 | GPT‑5.6 in Kiro | GPT-5.6 进入 Kiro,帮助开发者规划、构建、审查、测试软件 |
| 08-24 | a16z 数据:Codex 在非科技行业高速增长 | Codex 自 2 月以来:法律 108x、销售 41x、招聘 41x、营销 26x、医疗 24x |
| 08-21 | GPT-5.6 Sol 降价超 20% | API 与 credit 定价下调超 20%,持续 3 个月 |
| 08-20 | Introducing AI Futures | 新博客探讨变革性 AI 对权力、治理、经济与自由的影响 |
| 08-20 | Stampli 用 ChatGPT Work 缩短 68% 上线时间 | Codex + ChatGPT Work 将数周上线工作压缩至数天 |
| 08-19 | Zero Data Retention for frontier models | 重申合格 API 客户零数据保留,预览 Private Safety Processing |
| 08-19 | Replit Free Mode with GPT-5.6 Luna | Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,免 token 费用 |
| 08-18 | ChatGPT Ads 扩展至 31 个欧洲市场 | 广告产品覆盖 31 个欧洲国家 |
| 08-18 | Strengthening democratic oversight in national security | 为政府机构提供工具、培训与专业知识 |
| 08-18 | Partnering with CodeAI | 合作培养学生的 AI 素养与批判性思维 |
| 08-18 | Pacing model development | 加强前沿模型的监控、对齐与安全防护 |
| 08-18 | ChatGPT for Teens | 面向青少年,含强化保护与健康使用功能 |
| 08-18 | NVIDIA 用 ChatGPT Work 规模化专业知识 | NVIDIA 团队用 ChatGPT Work 减少手工任务 |
| 08-18 | Asana 用 Codex 两周完成五年工程量 | 替换旧测试系统,约 $12K 成本 |
| 08-17 | The Defender's Window | AI 重塑攻防安全,OpenAI 分享防御实践 |
| 08-17 | OpenAI joins PORTS-Pike project | 扩大社区投资,支持南俄亥俄数千就业 |
| 08-17 | New policy ideas for the Intelligence Age | 资助 14 个独立 AI 政策研究项目 |
| 08-13 | Builder's guide to GPT‑5.6 | 初创用 GPT-5.6 构建更高效的 AI agent |
| 08-13 | Previewing Ultrafast: GPT-5.6 Sol up to 14× speed | Cerebras 驱动,最高 750 output tokens/s |
| 08-13 | Dali Rajic 任 CRO | 领导全球营收组织 |
| 08-12 | From assistance to execution | 研究揭示企业 agentic AI 采用现状 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 08-25 | Claude Code v2.1.246 | 新增 Bash allow 通配符安全警告(如 git * main 会匹配插入的选项) |
| 08-25 | Claude Code v2.1.245 | 修复 glibc 2.44 发行版(Arch/CachyOS/Fedora Rawhide)启动崩溃 |
| 08-25 | Claude 记忆升级 | chat 与 Cowork 共享单一记忆,用户可控制内容 |
| 08-23 | Claude Code v2.1.241 | Bug 修复与稳定性提升 |
| 08-22 | Claude Code v2.1.240 | Bug 修复与稳定性提升 |
| 08-21 | Claude Code v2.1.239 | /cost、状态行、--max-budget-usd 计入 1.1× 美国独占推理溢价 |
| 08-21 | Claude Security scans on Mythos 5 | 公开 beta,面向所有 Claude Enterprise 客户,无需单独模型访问 |
| 08-20 | Computer use / Browser / Skills / Files API GA | Claude 平台四项 API 正式可用 |
| 08-14 | Claude 文本水印 FAQ | 为合规 EU AI Act 实施水印;不影响输出质量、无隐藏字符、不加 token 费用、不可追溯个人 |
| 08-14 | 第二期 Risk Report | 作为 Responsible Scaling Policy 一部分发布 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 08-25 | 5 ways to upgrade home decor with Google Search | Google Search 家居装饰功能 |
| 08-22 | Gemini 3.7 为史上增速最快模型 | Logan Kerr 确认 3.7 系列增速破纪录 |
| 08-22 | Sundar 确认 3.7 Flash 破增长纪录 | 已上线 Search 和 Gemini App;ARC-AGI-2: 84.6%, $0.25/task |
| 08-21 | DeepMind × FenrisCreations 游戏研究 | 探索持续学习、深度记忆、长期规划、多 agent 动态 |
| 08-19 | 5 ways to level up learning with Search | Search 学习工具更新 |
| 08-18 | 矩阵乘法新 ω 纪录 | 宣布矩阵乘法复杂度常数 ω 新纪录(arXiv) |
| 08-17 | Gemini × Pixel 足球合作 | 球迷体验升级 |
| 08-14 | Gemini 3.7 Flash 上线 Pro/Ultra | 改进多步推理与准确性;Spark 也切换到 3.7 Flash |
| 日期 | 标题 | 要点 |
|---|---|---|
| 08-13 | DeepSeek Harness v0.1 开发者预览 | MIT 许可开源,基于 Cordis 元框架,一切皆插件(模型/工具/技能/会话/沙箱等) |
| 日期 | 标题 | 要点 |
|---|---|---|
| 08-25 | HN 热帖:OpenAI Jalapeño better than Nvidia Blackwell | SemiAnalysis 深度分析,HN 305 分 |
| 08-22 | swyx: "Simulation is a new scaling law" | 转发 Joon Sung Park 关于社会模拟作为新 scaling law 的讨论 |
| 08-22 | AI Engineer World's Fair: AI Factories Track | 模型是工厂里最简单的部分;涵盖 FinOps、路由、临床 AI 笔记等 |
| 08-14 | Simon Willison 转发 GLM-5.3 发布 | Z.ai 发布 GLM-5.3:743B 基座后训练,主打编码与网络安全 |
[Artificial Analysis / Intelligence]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Grok 4.6 (medium) | 59.0 |
| 3 | Muse Spark 1.2 (xhigh) | 56.8 |
[LMArena / Overall]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.77 |
| 2 | claude-opus-4-6-high | 1504.49 |
| 3 | claude-opus-4-7-high | 1502.01 |
[Artificial Analysis / Agentic]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Grok 4.6 (medium) | 56.3 |
| 3 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
[Artificial Analysis / Coding]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Grok 4.6 (medium) | 74.4 |
[SWE-bench Pro / Public]
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
[SWE-bench Verified / Verified]
有变动。主要变化:
| 变化 | 模型 | 分数 | 说明 |
|---|---|---|---|
| ↑ 1→1 | Claude 4.5 Opus medium (20251101) (live-SWE-agent) | 79.2 | 与上期第 1 名分数相同,排名上调至第 1 |
| ↓ 1→2 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 | 同分 79.2,排名互换 |
| ↑ 14→13 | Claude 4 Sonnet + o4-mini | 74.4 | 微调上升一位 |
| ↓ 13→14 | GPT-5 | 74.4 | 微调下降一位 |
| ↑ 32→31 | GPT 5.1 Codex (medium) | 66.0 | 与 GPT 5.1 (medium) 互换 |
| ↓ 31→32 | GPT 5.1 (2025-11-13) (medium) | 66.0 | — |
| ↑ 19→17 | GPT 5.2 Codex | 72.8 | 上升两位 |
| ↓ 18→19 | GPT 5.2 (high) | 72.8 | — |
| ↓ 17→18 | GLM 5 (high) | 72.8 | — |
| ↑ 51→50 | Qwen3-Coder 480B/A35B Instruct | 55.4 | 与 GLM 4.6 互换 |
| ↓ 50→51 | GLM 4.6 (T=1) | 55.4 | — |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
[Terminal-Bench 2 / [email protected]]
有变动。主要变化:
| 变化 | 模型 | 分数 | 说明 |
|---|---|---|---|
| ↑ 3→2 | Claude Opus 4.7 (WOZCODE) | 80.2 | 与 Gemini 3.1 Pro 互换 |
| ↓ 2→3 | Gemini 3.1 Pro (TongAgents) | 80.2 | 同分 80.2,排名互换 |
| ↑ 39→38 | Grok 4 | 27.2 | 与 Qwen 3 Coder 480B 互换 |
| ↓ 38→39 | Qwen 3 Coder 480B | 27.2 | — |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI Jalapeño 自研推理芯片首批结果公布:SemiAnalysis 分析称其吞吐量与功耗表现优于 Nvidia Blackwell,HN 热度达 305 分。若该数据可复现,意味着 OpenAI 在推理层不再完全依赖第三方 GPU——叠加同日发布的 $100 Business Premium 席位和 GPT-5.6 Sol 上周 20% 降价,OpenAI 正在从芯片到定价全栈压低成本以扩大用户基数。
WebMCP 标准上线 + 黑客松启动:ChatGPT 桌面端内置浏览器现在可自动调用兼容网站的暴露工具,且联合 Chromium/Cloudflare/Shopify/Vercel 等发起 10 天 $35K 黑客松。这实质上是 OpenAI 在定义"agent 与网页交互"的开放协议——如果生态成型,网站将同时服务人类与 agent,改变流量分发逻辑。
Plus 账号恢复 5h 限制:Tibo 明确称此举为"平滑计算负载"并防止新用户"意外耗尽整周用量",同时 Pro $100/$200 不受影响。配合同日上线的 $100 Business Premium(无 5h 限制),OpenAI 正在用容量管理倒逼高活跃用户向付费层迁移。