【OpenAI】ChatGPT Work 支持网站登录,可代用户完成端到端任务
ChatGPT Work 现可通过其云端浏览器代用户登录网站并执行操作,全程不接触用户密码。支持预约 DMV、订餐、取消订阅、提交报销等场景。凭据通过安全登录表单直接注入目标网站字段,模型本身无法看到。同日还推出 $100/月 Business Premium 席位,面向小团队提供全套 ChatGPT Work + Codex 功能,含 SSO/MFA 及 Slack/GitHub/Workspace 集成。这是 AI 助手从"回答问题"转向"替你操作浏览器完成任务"的关键一步——如果安全和可靠性过关,大量重复性网页操作工作流将被重构。
【OpenAI】Jalapeño 自研推理芯片首批结果公布
Jalapeño 是 OpenAI 自定义推理芯片,首批数据显示其在吞吐量和能效上达到行业领先水平,可降低现代模型推理延迟和功耗。CFO Sarah Friar 同期发文阐述 OpenAI 在芯片、算力、模型、产品全栈的复利策略。Greg Brockman 另称"AI 用于芯片设计被低估",暗示芯片设计本身也在用 AI 优化形成闭环。
【OpenAI】Hugging Face 安全事件调查报告发布
OpenAI 完成对 Hugging Face 安全事件的全面调查,发布技术报告还原攻击者活动路径、解释现有防护为何失效,并公布在训练和评估基础设施(而非仅部署阶段)加强安全、监控和对齐的具体措施。Sam Altman 评价为"关于坏事的好报告"。
【Google DeepMind】Gemini 3.5 Transcribe 发布,支持 85+ 语言实时语音转写
Gemini 3.5 Transcribe 是 Google 新一代语音转文本模型,支持智能转写、函数调用、多说话人识别、自定义词汇和 85+ 种语言,提供实时流式支持。API 已在 Google AI Studio 和 Gemini Enterprise 上线。此前 Gemini 3.7 Flash 已成为 Google 史上增长最快的模型发布,在 ARC-AGI-2 上达 84.6%、$0.25/task。
【OpenAI】WebMCP 标准上线并启动 $35K 黑客松
OpenAI 在 ChatGPT 桌面版内置浏览器中添加 WebMCP 支持,使网站能向 AI agent 暴露工具接口。与 Chromium Dev、Cloudflare、Shopify、Vercel 等联合举办 10 天黑客松,奖金 $35,000。这意味着网站可以直接为 agent 提供结构化交互接口,而非让 agent 模拟人类点击——可能催生新一代 agent-native 网页。
GLM-5.3-Flash 新模型强势入榜,多个 benchmark 排名被挤压
GLM-5.3-Flash 是 Z.ai 发布的 743B 基座模型经后训练得到的模型,主打编程和 agentic 能力,在三个分榜同时高位入局,直接压缩了 GPT-5.x、Claude 5、Grok 4.6 等一线模型的排名空间。
SWE-bench Verified 排名微调
Terminal Bench 2:Claude Opus 4.7 与 Gemini 3.1 Pro 互换第 2/3 名(均 80.2 分)。
OpenAI X / 账号动态(按日期倒序):
| 日期 | 账号 | 摘要 |
|---|---|---|
| 08-26 | @sama | 暗示下一个模型发布会再办 party |
| 08-26 | @sama | 称 Hugging Face 事件报告是"关于坏事的报告" |
| 08-26 | @gdb | 完成 Hugging Face 事件审查,已提升训练/评估安全标准 |
| 08-26 | @gdb | 认为 AI 用于芯片设计被低估 |
| 08-26 | @gdb | ChatGPT Work 触发式任务上线:Slack/Gmail/Github 变化时自动响应 |
| 08-26 | OpenAI Devs | 开发者用 Codex 发布 npm 库 |
| 08-26 | OpenAI Devs | $visualize 命令在 ChatGPT Work/Codex 中可视化信息 |
| 08-26 | OpenAI Devs | WebMCP 支持已加入 ChatGPT 桌面端内置浏览器 |
| 08-26 | OpenAI Devs | ChatGPT Work 云端电脑支持安全登录表单,持久化登录态 |
| 08-26 | OpenAI Devs | 展示 GPT-5.6 Sol 的实验项目 |
| 08-26 | @thsottiaux | 感叹 OpenAI 几周的工作量抵别家公司数年 |
| 08-26 | @thsottiaux | "好产品需要时间,至少 34 天" |
| 08-25 | OpenAI | ChatGPT Work 可代用户登录网站操作浏览器,不见密码 |
| 08-25 | OpenAI | 推出 $100/月 Business Premium 席位 |
| 08-25 | OpenAI Devs | WebMCP Challenge 黑客松启动,$35K 奖金 |
| 08-25 | OpenAI Devs | WebMCP Challenge 启动直播 |
| 08-25 | @thsottiaux | 介绍 Business Premium 席位功能细节 |
| 08-21 | OpenAI | ChatGPT 周更:iOS 快捷附图、时间理解改善、长对话加载加速 |
| 08-19 | OpenAI | Replit Free Mode 由 GPT-5.6 Luna 驱动 |
| 08-17 | OpenAI | Greg Brockman 转发网络安全博文 |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-26 | Claude Code v2.1.247 | 新增 SendFeedback 工具,Claude 可起草反馈报告 |
| 08-25 | Claude Code v2.1.246 | Bash 通配规则启动警告 |
| 08-25 | Claude Code v2.1.245 | 修复 glibc 2.44 Linux 崩溃 |
| 08-25 | @bcherny | Claude 记忆功能升级:跨 chat 与 Cowork 统一记忆 |
| 08-21 | @bcherny | Claude Security 扫描启用 Claude Mythos 5(企业版公测) |
| 08-20 | @bcherny | Computer use、Browser tool、Skills API、Files API 正式 GA |
| 08-14 | Anthropic | Claude 文本水印 FAQ:合规 EU AI Act,不影响输出质量,不可追溯个人 |
| 08-14 | Anthropic | 发布第二期 Risk Report |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-26 | Gemini 3.5 Transcribe | 新语音转文字模型,支持 85+ 语言、多说话人识别、实时流式、自定义词汇 |
| 08-25 | Google Search 家居装饰 | 搜索功能推荐(与 AI 关联弱) |
| 08-22 | @OfficialLoganK | Gemini 3.7 为 Google 增速最快模型发布记录 |
| 08-21 | DeepMind × FenrisCreations | 研究持续学习、深度记忆、长程规划与多智能体动态 |
| 08-19 | Google Search 学习工具 | 搜索 5 项学习功能更新 |
| 08-18 | DeepMind 矩阵乘法记录 | 宣布 omega(ω) 新纪录 |
| 08-17 | Gemini × Pixel 足球合作 | Pixel 与足球俱乐部合作 |
| 08-14 | Gemini 3.7 Flash | 面向 Pro/Ultra 用户上线,Spark 同步切换;ARC-AGI-2 达 84.6% |
| 08-13 | Sheets Canvas | Google Sheets 可视化画布 |
| 日期 | 来源 | 摘要 |
|---|---|---|
| 08-26 | @swyx | 警告:Codex "locked use" 功能依赖不稳定 macOS 特性,已两次锁死 Keychain |
| 08-26 | HN 热帖 | "完成 AI 建议的想法为何如此困难"(163 points) |
| 08-26 | Gates Notes | "动荡的 AI 时代已经到来"(HN 151 points) |
| 08-14 | GLM-5.3 发布 | Z.ai 发布 GLM-5.3,743B 基座后训练,主打编码与网络安全 |
| 08-13 | DeepSeek Harness v0.1 | 开发者预览版,MIT 许可,基于 Cordis 元框架,一切皆插件 |
AA / Intelligence(综合智能)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 | — |
| 2 | Grok 4.6 (medium) | 59.0 | — |
| 3 | GLM-5.3-Flash | 57.5 | 🆕 新进入 |
| 4 | Muse Spark 1.2 (xhigh) | 56.8 | ↑3→4 |
| 5 | GPT-5.5 (xhigh) | 56.3 | ↑4→5 |
LMArena / Overall(人类偏好对战)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | claude-fable-5 | 1507.8 | — |
| 2 | claude-opus-4-6-high | 1504.5 | — |
| 3 | claude-opus-4-7-high | 1502.0 | — |
本期无变动。
AA / Agentic(智能体能力)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 | — |
| 2 | GLM-5.3-Flash | 58.2 | 🆕 新进入 |
| 3 | Grok 4.6 (medium) | 56.3 | ↓2→3 |
| 4 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 | ↓3→4 |
| 5 | Muse Spark 1.2 (xhigh) | 49.3 | ↓4→5 |
GLM-5.3-Flash 以 58.2 分直接空降第 2,将 Grok 4.6 从第 2 挤到第 3,连锁导致 Sonnet 5 和 Muse Spark 1.2 各降一位。
AA / Coding(编码能力)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 | — |
| 2 | GPT-5.5 (xhigh) | 74.9 | — |
| 3 | Grok 4.6 (medium) | 74.4 | — |
| 4 | Muse Spark 1.2 (xhigh) | 72.2 | — |
| 5 | GLM-5.3-Flash | 71.5 | 🆕 新进入 |
GLM-5.3-Flash 新进入编码榜第 5,与智能体和综合智能三榜同时亮相。
SWE-bench Verified
| 排名 | 模型 + Scaffold | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (live-SWE-agent) | 79.2 | ↑2→1 |
| 2 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 | ↓1→2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 | — |
Top 2 两版 Claude 4.5 Opus 分数相同(79.2),仅 scaffold 不同,排名互换。
Terminal-Bench 2.0
| 排名 | 模型 + Scaffold | 分数 | 变化 |
|---|---|---|---|
| 1 | GPT-5.5 (NexAU-AHE) | 84.7 | — |
| 2 | Claude Opus 4.7 (WOZCODE) | 80.2 | ↑3→2 |
| 3 | Gemini 3.1 Pro (TongAgents) | 80.2 | ↓2→3 |
Claude Opus 4.7 与 Gemini 3.1 Pro 分数同为 80.2,排名互换第 2/3 位。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI Hugging Face 事件报告:OpenAI 发布了完整调查报告,重建了 agents 的活动路径,解释了既有安全防护为何失效,并公布了针对性整改措施。Greg Brockman 明确表示已将安全标准提升至训练和评估基础设施层面(不仅限于部署阶段)。这是一次罕见的"公开复盘",其价值在于披露了具体失败环节而非泛泛声明——但报告中是否涵盖足够可复现的技术细节,将决定安全社区能否从中真正受益。
ChatGPT Work 网站登录功能:该功能实现了"安全登录表单将凭据传送至目标网站表单且模型不可见密码",同时附带自动审查模型检查表单与目标字段匹配度。这意味着 ChatGPT Work 从信息提供升级为端到端任务执行,且在凭据安全上做了工程化设计。不过 swyx 同日报告 Codex 的 "locked use" 功能因依赖不稳定的 macOS 特性已两次锁死 Keychain,说明本地端 Agent 权限管理的可靠性仍有未解决的工程问题。
GLM-5.3-Flash 三榜同时进入前 5:该模型在 AA Intelligence(57.5,第 3)、Agentic(58.2,第 2)、Coding(71.5,第 5)三个维度同时新进入榜单,且在 Agentic 榜直接以 58.2 分超过 Grok 4.6(56.3)排到第 2。结合 Z.ai 8 月 14 日发布的 GLM-5.3 信息——743B 基座模型经后训练,主打编码与安全——Flash 变体显然在推理效率与能力之间取了高性价比平衡点。这是目前开源阵营在多维度 benchmark 上最接近 Claude Opus 5 的单次表现。