【OpenAI】ChatGPT Work 获云端浏览器登录能力,可代用户操作任意网站
ChatGPT Work 现可通过云端浏览器安全登录网站,代用户完成预约、下单、取消订阅等任务,且模型全程无法看到用户凭证。支持 iOS、Web 端,面向 Plus、Pro、Business 用户开放。这是 AI 助手从"对话工具"转向"自主执行代理"的关键一步——用户首次能将需要登录的真实跨网站任务交给 AI 端到端完成。
【OpenAI】Jalapeño 自研推理芯片首秀,主打高吞吐低延迟
OpenAI 公布自研推理芯片 Jalapeño 首批结果,目标是更快、更节能的推理,提升吞吐量并降低现代模型的推理延迟。CFO Sarah Friar 同日发文阐述从芯片到产品的全栈策略,强调各层进步叠加带来更低成本、更大规模的智能供给。
【OpenAI/Anthropic 等】超 100 家机构签署全球网络防御联合声明
OpenAI 联合 Anthropic、AWS、Google、Microsoft、Oracle 等发起"全球网络防御"倡议,呼吁趁 AI 带来的防御窗口期强化基础设施安全。Sam Altman 称当前是"关键时刻",需要紧急集体行动。
【Anthropic】Model Hardware Standard 研究预览启动,让 AI 代理安全操作物理设备
Anthropic 启动 MHS(Model Hardware Standard)研究预览第一阶段,为 AI 代理安全操控科研与先进制造中的物理设备制定新标准。
lmarena overall — Qwen3.8-27b 大幅下滑 排名从 81 跌至 87,分数从 1439.67 降至 1435.77,下降约 3.9 分,是本轮排名跌幅最大的模型之一。
lmarena overall — Gemini-3-flash 上升 4 位 排名从 30 升至 26,分数从 1472.79 升至 1473.82。
lmarena overall — DeepSeek-v4-pro-high-20260813 上升 4 位 排名从 50 升至 46,分数从 1459.42 升至 1461.54。
lmarena overall — Qwen3.8-max 下滑 1 位但分数变动明显 排名从 19 降至 20,分数从 1481.01 降至 1479.38,降幅约 1.63 分,在前 20 名中属较大波动。
lmarena overall — GLM-5.3-max 跌出 Top-15 排名从 13 降至 15,分数从 1486.94 降至 1483.91,下降约 3 分。
lmarena overall — GLM-5.3-flash 新模型上榜 首次进入榜单,直接排在第 38 位,分数 1469.38。
X/Twitter 动态(@OpenAI、@OpenAIDevs 及高管)
| 日期 | 来源 | 要点 |
|---|---|---|
| 08-28 | @OpenAIDevs: Rosalind Workbench | 连接科学问题与专业模型、工具和可审查输出,覆盖蛋白质结构、序列分析和测序流程 |
| 08-28 | GDB 转发 OpenRouter 数据 | GPT-5.6 Terra 和 Luna 大幅降价后,OpenRouter token 用量爆发式增长 13.8 倍,Jevons 悖论成立 |
| 08-28 | Tibo: most connected accounts | Codex 和 ChatGPT 现支持连接多个 Gmail 和 Google 日历账号 |
| 08-28 | Tibo: most ambitious task | 向用户征集给 ChatGPT Work 下达的最有野心的任务 |
| 08-27 | @OpenAI: 集体网络防御 | 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100+ 组织呼吁全球加强网络防御 |
| 08-27 | Sam Altman: 紧迫时刻 | "这是 AI 网络防御的关键时刻,行动窗口很小",呼吁与竞争对手或伙伴合作 |
| 08-27 | GDB: ChatGPT Work 预定理发 | 用户 Max Weinbach 实测 ChatGPT Work 成功预约理发,称"ChatGPT 正在成为你的个人 AGI" |
| 08-27 | Tibo: 安全登录代操作 | ChatGPT 可代用户购买日用品、叫 Uber、预约理发,全程不接触真实凭据 |
| 08-27 | @OpenAIDevs: DevDay Exchange 首尔 | 10 月 22 日首尔 DevDay Exchange,报名 9 月 4 日截止;Tibo 称"将是公司史上最好的 DevDay" |
| 08-27 | @OpenAIDevs: ChatGPT Work 云浏览器登录 | Victor Nunez 展示云浏览器安全登录表单与持久会话 |
| 08-26 | @OpenAIDevs: WebMCP 支持 | ChatGPT 桌面应用内置浏览器和 ChatGPT Sites 新增 WebMCP 支持,兼容网站可被 Agent 自动调用 |
| 08-26 | @OpenAIDevs: $visualize 命令 | ChatGPT Work/Codex 中可用 $visualize 将任意信息转为可视化 |
| 08-26 | James Sun: 云电脑登录详细说明 | 安全登录表单将凭据"传送"到网站而不让模型看到;自动审查模型检查表单和目标字段;iOS 原生集成密码管理器和 2FA |
| 08-25 | @OpenAI: ChatGPT Work 网站登录上线 | 支持代办公用事业开通、DMV/护照预约、保险报销查询、找房、退货取件等,不接触用户名密码 |
| 08-25 | @OpenAI: ChatGPT Business Premium 席位 | 推出 $100/月 Premium 席位,面向小企业和初创团队 |
| 08-25 | @OpenAIDevs: WebMCP Challenge 黑客松 | 与 Cloudflare、Vercel、Shopify 等联合举办 10 天黑客松,$35,000 奖金 |
| 08-25 | GDB: Hugging Face 事件调查完成 | 已完成调查,推动训练和评估基础设施的安全标准升级 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-28 | Google DeepMind: Gemini Omni 1.1 Flash 上线 | 生成式视频更可控、迭代更快、面向生产级用途,可在 Flow 中体验 |
| 08-27 | Google: Gemini Omni 1.1 Flash 功能详解 | 支持场景延伸、起止帧指定、视频参考输入、4K 放大、360p 快速草稿 |
| 08-27 | Demis Hassabis 转发 Arena 排名 | Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena #1、Image-to-Video Arena #2 |
| 08-27 | Demis Hassabis: 双盲前沿 AI 评估试点 | 行业首创双盲评估,测试提示和模型权重均不对外暴露,确保安全与性能评估可信 |
| 08-27 | Google Blog: 3 new ways to plan and book travel in Search | AI Mode 搜索新增旅行规划与预订功能 |
| 08-25 | Google Blog: 5 ways to upgrade your home decor | 搜索 AI 模式家居装饰建议 |
| 08-22 | Logan Kilpatrick: Gemini 3.7 增速最快 | 称 Gemini 3.7 是 Google 史上增速最快的模型发布 |
| 08-21 | Google DeepMind: 游戏与 AI 研究 | 与 Fenris Creations 合作探索持续学习、深度记忆、长期规划、多 Agent 动态 |
| 08-18 | Google DeepMind: 矩阵乘法速度新纪录 | 宣布 omega (ω) 新纪录,相关论文已发表 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-27 | Boris Cherny 转发: Model Hardware Standard 研究预览 | Anthropic 启动 MHS 研究预览,为 AI Agent 安全操作物理设备制定标准 |
| 08-25 | Boris Cherny: Claude 记忆升级 | Claude 在 chat 和 Cowork 间共享统一记忆,用户可控制记忆内容 |
| 08-21 | Boris Cherny 转发: Claude Security 扫描 | Claude Security 扫描现运行于 Claude Mythos 5,面向企业客户公测 |
| 版本 | 日期 | 要点 |
|---|---|---|
| v2.1.251 | 08-28 | 新增 PreModelSwitch/PostModelSwitch hook 事件;SessionStart resume hooks 获取会话过期度和重缓存成本 |
| v2.1.250 | 08-28 | Bug 修复与可靠性提升 |
| v2.1.248 | 08-27 | 新增 --restricted 模式:移除命令/代码执行工具和 WebFetch,限制文件工具在工程目录内,拒绝 bypassPermissions,忽略设置文件 |
| v2.1.247 | 08-26 | 新增 SendFeedback 工具:出问题时 Claude 可起草反馈报告供用户审查后发送 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-28 | Judge rules Trump administration's blacklisting of Anthropic was illegal | 法院裁定特朗普政府将 Anthropic 列入政府黑名单的行为违法(HN 507 分) |
| 08-28 | Luanti removed from Google Play due to baseless AI copyright notice | Luanti 因 AI 生成的无依据版权投诉被 Google Play 下架(HN 429 分) |
| 08-28 | swyx 转发: Hugging Face 事件评论 | 引用 Eliezer Yudkowsky 对事件中 AI 自我牺牲行为的担忧,称"这是明显的坏消息" |
| 08-28 | Simon Willison: LLM 陈词滥调高亮器 | 已覆盖 38 种 AI 文本模式 |
Artificial Analysis — Intelligence
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Grok 4.6 (medium) | 59.0 |
| 3 | GLM-5.3-Flash | 57.5 |
本期无变动。
LMArena — Overall
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.48 |
| 2 | claude-opus-4-6-high | 1504.83 |
| 3 | claude-opus-4-7-high | 1502.13 |
本期变动(分数或排名显著变化):
| 模型 | 变化类型 | 前排名 → 现排名 | 前分数 → 现分数 |
|---|---|---|---|
| gemini-3-flash | 排名+分数 | 30 → 26 | 1472.79 → 1473.82 |
| gemini-3.1-pro-preview | 排名 | 14 → 13 | 1486.27 → 1486.69 |
| gemini-3-pro | 排名 | 15 → 14 | 1485.46 → 1485.62 |
| gpt-5.5-high | 排名 | 17 → 16 | 1481.89 → 1482.36 |
| gpt-5.5 | 排名 | 23 → 22 | 1476.27 → 1476.71 |
| gpt-5.6-terra-xhigh | 排名 | 44 → 42 | 1465.37 → 1466.16 |
| glm-5.3-flash | 新模型 | — → 38 | — → 1469.38 |
| glm-5.3-max | 排名+分数 | 13 → 15 | 1486.94 → 1483.91 |
| glm-5 | 排名+分数 | 55 → 53 | 1456.76 → 1457.80 |
| glm-5.1 | 排名+分数 | 39 → 41 | 1467.76 → 1466.29 |
| glm-5.2-max | 排名+分数 | 34 → 33 | 1470.44 → 1471.95 |
| deepseek-v4-pro-high-20260813 | 排名+分数 | 50 → 46 | 1459.42 → 1461.54 |
| qwen3.8-max | 排名+分数 | 19 → 20 | 1481.01 → 1479.38 |
| qwen3.8-27b | 排名+分数 | 81 → 87 | 1439.67 → 1435.77 |
| qwen3.7-plus | 排名+分数 | 53 → 56 | 1457.46 → 1456.30 |
| hy3 | 排名+分数 | 56 → 59 | 1456.71 → 1455.64 |
Artificial Analysis — Agentic
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | GLM-5.3-Flash | 58.2 |
| 3 | Grok 4.6 (medium) | 56.3 |
本期无变动。
Artificial Analysis — Coding
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Grok 4.6 (medium) | 74.4 |
本期无变动。
SWE-bench Pro (Public)
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
本期无变动。
SWE-bench Verified
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
本期变动:
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude 4.5 Opus medium (20251101) | 排名 | 2 → 1 | 79.2(同分,排名互换) |
| Claude 4.5 Opus | 排名 | 1 → 2 | 79.2 |
| GPT 5.2 Codex | 排名 | 19 → 17 | 72.8 |
| GPT 5.2 (high) | 排名 | 18 → 19 | 72.8 |
| GLM 5 (high) | 排名 | 17 → 18 | 72.8 |
| Claude 4 Sonnet + o4-mini | 排名 | 14 → 13 | 74.4 |
| GPT-5 | 排名 | 13 → 14 | 74.4 |
| GPT 5.1 Codex (medium) | 排名 | 32 → 31 | 66.0 |
| GPT 5.1 (2025-11-13) (medium) | 排名 | 31 → 32 | 66.0 |
| Qwen3-Coder 480B/A35B Instruct | 排名 | 51 → 50 | 55.4 |
| GLM 4.6 (T=1) | 排名 | 50 → 51 | 55.4 |
Terminal-Bench 2.0
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
本期变动:
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude Opus 4.7 | 排名 | 3 → 2 | 80.2(同分,排名互换) |
| Gemini 3.1 Pro | 排名 | 2 → 3 | 80.2 |
| Grok 4 | 排名 | 39 → 38 | 27.2 |
| Qwen 3 Coder 480B | 排名 | 38 → 39 | 27.2 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 集体网络防御倡议:Sam Altman 明确称"行动窗口很小""只有紧迫而密集的集体应对才行得通",超 100 家组织含 Anthropic、Google、Microsoft 签署——这在行业竞争常态中罕见地要求与竞争对手合作,说明 OpenAI 判断 AI 驱动的网络攻击威胁已超过商业竞争优先级。
ChatGPT Work 网站登录功能:James Sun 的技术说明揭示了关键设计——安全登录表单将凭据"传送"到网站表单而模型本身不接触,配合自动审查模型检查表单与目标字段,并支持 iOS 密码管理器和 2FA。这不是简单的浏览器自动化,而是 OpenAI 在 Agent 身份隔离与安全审查层面的系统性架构选择,若验证可靠将成为 Agent 代操作网站的信任基础设施。
glm-5.3-flash 新进入 LMArena 总榜第 38 名:新模型首登即获 1469.38 分,超过了 glm-5.1(第 41 名、1466.29 分)和 deepseek-v4-pro(第 54 名、1457.79 分),同时 glm-5.3-max 从第 13 下滑到第 15(分数下降约 3 分),说明该系列轻量版性价比已获得竞技场用户认可,但旗舰版的竞争力在被其他模型追平。