← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-27

2026-08-27 08:35 CST
快速版 完整版

核心速览

【OpenAI】ChatGPT Work 支持网站登录,可代用户完成端到端任务

ChatGPT Work 现可通过其云端浏览器代用户登录网站并执行操作,全程不接触用户密码。支持预约 DMV、订餐、取消订阅、提交报销等场景。凭据通过安全登录表单直接注入目标网站字段,模型本身无法看到。同日还推出 $100/月 Business Premium 席位,面向小团队提供全套 ChatGPT Work + Codex 功能,含 SSO/MFA 及 Slack/GitHub/Workspace 集成。这是 AI 助手从"回答问题"转向"替你操作浏览器完成任务"的关键一步——如果安全和可靠性过关,大量重复性网页操作工作流将被重构。

【OpenAI】Jalapeño 自研推理芯片首批结果公布

Jalapeño 是 OpenAI 自定义推理芯片,首批数据显示其在吞吐量和能效上达到行业领先水平,可降低现代模型推理延迟和功耗。CFO Sarah Friar 同期发文阐述 OpenAI 在芯片、算力、模型、产品全栈的复利策略。Greg Brockman 另称"AI 用于芯片设计被低估",暗示芯片设计本身也在用 AI 优化形成闭环。

【OpenAI】Hugging Face 安全事件调查报告发布

OpenAI 完成对 Hugging Face 安全事件的全面调查,发布技术报告还原攻击者活动路径、解释现有防护为何失效,并公布在训练和评估基础设施(而非仅部署阶段)加强安全、监控和对齐的具体措施。Sam Altman 评价为"关于坏事的好报告"。

【Google DeepMind】Gemini 3.5 Transcribe 发布,支持 85+ 语言实时语音转写

Gemini 3.5 Transcribe 是 Google 新一代语音转文本模型,支持智能转写、函数调用、多说话人识别、自定义词汇和 85+ 种语言,提供实时流式支持。API 已在 Google AI Studio 和 Gemini Enterprise 上线。此前 Gemini 3.7 Flash 已成为 Google 史上增长最快的模型发布,在 ARC-AGI-2 上达 84.6%、$0.25/task。

【OpenAI】WebMCP 标准上线并启动 $35K 黑客松

OpenAI 在 ChatGPT 桌面版内置浏览器中添加 WebMCP 支持,使网站能向 AI agent 暴露工具接口。与 Chromium Dev、Cloudflare、Shopify、Vercel 等联合举办 10 天黑客松,奖金 $35,000。这意味着网站可以直接为 agent 提供结构化交互接口,而非让 agent 模拟人类点击——可能催生新一代 agent-native 网页。


重大 Benchmark 变化

GLM-5.3-Flash 新模型强势入榜,多个 benchmark 排名被挤压

  • AA Agentic 榜:GLM-5.3-Flash 以 58.2 分直接空降第 2 名,将 Grok 4.6(56.3 分)从第 2 挤至第 3,Claude Sonnet 5 从第 3 降至第 4,GPT-5.5、GPT-5.6 Luna、GPT-5.6 Sol、Gemini 3.5 Flash 各降 1 位。
  • AA Intelligence 榜:GLM-5.3-Flash 以 57.5 分空降第 3,Muse Spark 1.2 从第 3 降至第 4,GPT-5.5 从第 4 降至第 5,Claude Sonnet 5 从第 5 降至第 6,Claude Opus 5 从第 6 降至第 7。
  • AA Coding 榜:GLM-5.3-Flash 以 71.5 分空降第 5。

GLM-5.3-Flash 是 Z.ai 发布的 743B 基座模型经后训练得到的模型,主打编程和 agentic 能力,在三个分榜同时高位入局,直接压缩了 GPT-5.x、Claude 5、Grok 4.6 等一线模型的排名空间。

SWE-bench Verified 排名微调

  • Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 互换前两名(均 79.2 分,排名 2→1 / 1→2)。
  • GPT 5.2 Codex 从第 19 升至第 17(72.8 分),GPT-5 从第 13 降至第 14。

Terminal Bench 2:Claude Opus 4.7 与 Gemini 3.1 Pro 互换第 2/3 名(均 80.2 分)。

快速预览

  • OpenAI 发布 Hugging Face 安全事件调查报告,详述漏洞原因与整改措施
  • ChatGPT Work 上线网站登录功能,可在不见密码的前提下代用户操作浏览器完成端到端任务
  • OpenAI 推出 ChatGPT Business Premium 席位,$100/人/月面向小团队
  • Google 发布 Gemini 3.5 Transcribe 语音转写模型,支持 85+ 语言
  • Benchmark:GLM-5.3-Flash 新进入 AA 智能体/编码/智能三榜,均位列前 5

详细正文

OpenAI

日期 标题 摘要
08-26 Bringing ChatGPT for Teachers to more U.S. school districts ChatGPT for Teachers 扩展至 55 个美国学区,覆盖超 10 万名教育工作者
08-26 Learning never stops: How AI makes learning continuous 新报告探讨学生和教育者如何用 ChatGPT 延续课堂之外的学习
08-26 The Hugging Face incident and the road ahead 发布 Hugging Face 安全事件调查报告,披露漏洞利用链与整改方向
08-26 How loveholidays is making everyone a builder with Codex loveholidays 用 Codex 让非技术团队参与软件开发
08-25 The full stack behind abundant intelligence CFO Sarah Friar 阐述芯片→计算→模型→产品全栈协同降本增效
08-25 Jalapeño's first results show industry-leading speed and efficiency in AI inference 自研推理芯片 Jalapeño 首批结果:更高吞吐、更低延迟
08-25 Disrupting a new covert influence campaign from Russia 封禁利用 AI 推广虚假以色列智库和"主权指数"的俄罗斯账号
08-25 Introducing the Admin plugin for ChatGPT Work and Codex Admin 插件支持工作区用量分析、成员权限管理与管理员请求操作
08-24 Advancing price-performance for developers with GPT‑5.6 in Kiro GPT-5.6 进入 Kiro,帮助开发者规划/构建/审查/测试软件
08-20 Introducing Intelligence Age 新博客 Intelligence Age,探讨 AI 对权力、治理、经济的影响
08-20 Stampli cuts launch hours by 68% using ChatGPT Work Stampli 用 Codex 和 ChatGPT Work 将数周上线工作压缩至数天
08-19 Offering Zero Data Retention for frontier models 重申合规 API 客户零数据留存,预告 Private Safety Processing
08-19 Replit expands access to software creation with GPT-5.6 Luna Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,免 token 费用
08-18 ChatGPT Ads expands across Europe ChatGPT 广告扩展至 31 个欧洲市场
08-18 Strengthening democratic oversight in national security 启动计划加强国家安全领域 AI 的民主监督
08-18 Partnering with CodeAI to prepare the first AI generation 与 CodeAI 合作培养学生的 AI 素养与批判性思维
08-18 Pacing model development in an era of cyber-critical capabilities 强化前沿模型监控、对齐与安全防护,指导开发节奏
08-18 Introducing ChatGPT for Teens 面向青少年的 ChatGPT,内置更强保护与家长控制
08-18 How NVIDIA scales expertise with ChatGPT Work NVIDIA 团队用 ChatGPT Work 减少手工任务并扩展工作流
08-18 Asana cleared 5 years of engineering work in 2 weeks with Codex Asana 用 Codex 两周完成预估五年的测试系统替换,花费约 $12K
08-17 The Defender's Window AI 正重塑攻防双方网络安全格局
08-17 OpenAI joins PORTS-Pike project 加入 PORTS-Pike 项目,支持南俄亥俄数千岗位
08-17 New policy ideas for the Intelligence Age 资助 14 个独立 AI 政策研究项目
08-13 The builder's guide to GPT‑5.6 创业公司用 GPT-5.6 构建更高效 AI Agent
08-13 Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed 预览 Ultrafast 服务层,由 Cerebras 驱动,最高 750 tokens/s
08-13 OpenAI appoints Dali Rajic as Chief Revenue Officer 任命 Dali Rajic 为 CRO

OpenAI X / 账号动态(按日期倒序):

日期 账号 摘要
08-26 @sama 暗示下一个模型发布会再办 party
08-26 @sama 称 Hugging Face 事件报告是"关于坏事的报告"
08-26 @gdb 完成 Hugging Face 事件审查,已提升训练/评估安全标准
08-26 @gdb 认为 AI 用于芯片设计被低估
08-26 @gdb ChatGPT Work 触发式任务上线:Slack/Gmail/Github 变化时自动响应
08-26 OpenAI Devs 开发者用 Codex 发布 npm 库
08-26 OpenAI Devs $visualize 命令在 ChatGPT Work/Codex 中可视化信息
08-26 OpenAI Devs WebMCP 支持已加入 ChatGPT 桌面端内置浏览器
08-26 OpenAI Devs ChatGPT Work 云端电脑支持安全登录表单,持久化登录态
08-26 OpenAI Devs 展示 GPT-5.6 Sol 的实验项目
08-26 @thsottiaux 感叹 OpenAI 几周的工作量抵别家公司数年
08-26 @thsottiaux "好产品需要时间,至少 34 天"
08-25 OpenAI ChatGPT Work 可代用户登录网站操作浏览器,不见密码
08-25 OpenAI 推出 $100/月 Business Premium 席位
08-25 OpenAI Devs WebMCP Challenge 黑客松启动,$35K 奖金
08-25 OpenAI Devs WebMCP Challenge 启动直播
08-25 @thsottiaux 介绍 Business Premium 席位功能细节
08-21 OpenAI ChatGPT 周更:iOS 快捷附图、时间理解改善、长对话加载加速
08-19 OpenAI Replit Free Mode 由 GPT-5.6 Luna 驱动
08-17 OpenAI Greg Brockman 转发网络安全博文

Anthropic / Claude

日期 标题 摘要
08-26 Claude Code v2.1.247 新增 SendFeedback 工具,Claude 可起草反馈报告
08-25 Claude Code v2.1.246 Bash 通配规则启动警告
08-25 Claude Code v2.1.245 修复 glibc 2.44 Linux 崩溃
08-25 @bcherny Claude 记忆功能升级:跨 chat 与 Cowork 统一记忆
08-21 @bcherny Claude Security 扫描启用 Claude Mythos 5(企业版公测)
08-20 @bcherny Computer use、Browser tool、Skills API、Files API 正式 GA
08-14 Anthropic Claude 文本水印 FAQ:合规 EU AI Act,不影响输出质量,不可追溯个人
08-14 Anthropic 发布第二期 Risk Report

Google / DeepMind

日期 标题 摘要
08-26 Gemini 3.5 Transcribe 新语音转文字模型,支持 85+ 语言、多说话人识别、实时流式、自定义词汇
08-25 Google Search 家居装饰 搜索功能推荐(与 AI 关联弱)
08-22 @OfficialLoganK Gemini 3.7 为 Google 增速最快模型发布记录
08-21 DeepMind × FenrisCreations 研究持续学习、深度记忆、长程规划与多智能体动态
08-19 Google Search 学习工具 搜索 5 项学习功能更新
08-18 DeepMind 矩阵乘法记录 宣布 omega(ω) 新纪录
08-17 Gemini × Pixel 足球合作 Pixel 与足球俱乐部合作
08-14 Gemini 3.7 Flash 面向 Pro/Ultra 用户上线,Spark 同步切换;ARC-AGI-2 达 84.6%
08-13 Sheets Canvas Google Sheets 可视化画布

其他厂商 / 社区

日期 来源 摘要
08-26 @swyx 警告:Codex "locked use" 功能依赖不稳定 macOS 特性,已两次锁死 Keychain
08-26 HN 热帖 "完成 AI 建议的想法为何如此困难"(163 points)
08-26 Gates Notes "动荡的 AI 时代已经到来"(HN 151 points)
08-14 GLM-5.3 发布 Z.ai 发布 GLM-5.3,743B 基座后训练,主打编码与网络安全
08-13 DeepSeek Harness v0.1 开发者预览版,MIT 许可,基于 Cordis 元框架,一切皆插件

行业格局

AA / Intelligence(综合智能)

排名 模型 分数 变化
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Grok 4.6 (medium) 59.0
3 GLM-5.3-Flash 57.5 🆕 新进入
4 Muse Spark 1.2 (xhigh) 56.8 ↑3→4
5 GPT-5.5 (xhigh) 56.3 ↑4→5

LMArena / Overall(人类偏好对战)

排名 模型 分数 变化
1 claude-fable-5 1507.8
2 claude-opus-4-6-high 1504.5
3 claude-opus-4-7-high 1502.0

本期无变动。

干活选型

AA / Agentic(智能体能力)

排名 模型 分数 变化
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 GLM-5.3-Flash 58.2 🆕 新进入
3 Grok 4.6 (medium) 56.3 ↓2→3
4 Claude Sonnet 5 (Adaptive Reasoning, Max Effort) 49.7 ↓3→4
5 Muse Spark 1.2 (xhigh) 49.3 ↓4→5

GLM-5.3-Flash 以 58.2 分直接空降第 2,将 Grok 4.6 从第 2 挤到第 3,连锁导致 Sonnet 5 和 Muse Spark 1.2 各降一位。

AA / Coding(编码能力)

排名 模型 分数 变化
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Grok 4.6 (medium) 74.4
4 Muse Spark 1.2 (xhigh) 72.2
5 GLM-5.3-Flash 71.5 🆕 新进入

GLM-5.3-Flash 新进入编码榜第 5,与智能体和综合智能三榜同时亮相。

SWE-bench Verified

排名 模型 + Scaffold 分数 变化
1 Claude 4.5 Opus medium (20251101) (live-SWE-agent) 79.2 ↑2→1
2 Claude 4.5 Opus (Sonar Foundation Agent) 79.2 ↓1→2
3 Doubao-Seed-Code (TRAE) 78.8

Top 2 两版 Claude 4.5 Opus 分数相同(79.2),仅 scaffold 不同,排名互换。

Terminal-Bench 2.0

排名 模型 + Scaffold 分数 变化
1 GPT-5.5 (NexAU-AHE) 84.7
2 Claude Opus 4.7 (WOZCODE) 80.2 ↑3→2
3 Gemini 3.1 Pro (TongAgents) 80.2 ↓2→3

Claude Opus 4.7 与 Gemini 3.1 Pro 分数同为 80.2,排名互换第 2/3 位。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI Hugging Face 事件报告:OpenAI 发布了完整调查报告,重建了 agents 的活动路径,解释了既有安全防护为何失效,并公布了针对性整改措施。Greg Brockman 明确表示已将安全标准提升至训练和评估基础设施层面(不仅限于部署阶段)。这是一次罕见的"公开复盘",其价值在于披露了具体失败环节而非泛泛声明——但报告中是否涵盖足够可复现的技术细节,将决定安全社区能否从中真正受益。

  2. ChatGPT Work 网站登录功能:该功能实现了"安全登录表单将凭据传送至目标网站表单且模型不可见密码",同时附带自动审查模型检查表单与目标字段匹配度。这意味着 ChatGPT Work 从信息提供升级为端到端任务执行,且在凭据安全上做了工程化设计。不过 swyx 同日报告 Codex 的 "locked use" 功能因依赖不稳定的 macOS 特性已两次锁死 Keychain,说明本地端 Agent 权限管理的可靠性仍有未解决的工程问题。

  3. GLM-5.3-Flash 三榜同时进入前 5:该模型在 AA Intelligence(57.5,第 3)、Agentic(58.2,第 2)、Coding(71.5,第 5)三个维度同时新进入榜单,且在 Agentic 榜直接以 58.2 分超过 Grok 4.6(56.3)排到第 2。结合 Z.ai 8 月 14 日发布的 GLM-5.3 信息——743B 基座模型经后训练,主打编码与安全——Flash 变体显然在推理效率与能力之间取了高性价比平衡点。这是目前开源阵营在多维度 benchmark 上最接近 Claude Opus 5 的单次表现。

来源 · 90 条