← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-29

2026-08-29 08:31 CST
快速版 完整版

核心速览

【OpenAI】ChatGPT Work 获云端浏览器登录能力,可代用户操作任意网站

ChatGPT Work 现可通过云端浏览器安全登录网站,代用户完成预约、下单、取消订阅等任务,且模型全程无法看到用户凭证。支持 iOS、Web 端,面向 Plus、Pro、Business 用户开放。这是 AI 助手从"对话工具"转向"自主执行代理"的关键一步——用户首次能将需要登录的真实跨网站任务交给 AI 端到端完成。

ChatGPT Work 云端浏览器登录功能


【OpenAI】Jalapeño 自研推理芯片首秀,主打高吞吐低延迟

OpenAI 公布自研推理芯片 Jalapeño 首批结果,目标是更快、更节能的推理,提升吞吐量并降低现代模型的推理延迟。CFO Sarah Friar 同日发文阐述从芯片到产品的全栈策略,强调各层进步叠加带来更低成本、更大规模的智能供给。

Jalapeño first results | 全栈文


【OpenAI/Anthropic 等】超 100 家机构签署全球网络防御联合声明

OpenAI 联合 Anthropic、AWS、Google、Microsoft、Oracle 等发起"全球网络防御"倡议,呼吁趁 AI 带来的防御窗口期强化基础设施安全。Sam Altman 称当前是"关键时刻",需要紧急集体行动。

OpenAI 集体网络防御声明


【Anthropic】Model Hardware Standard 研究预览启动,让 AI 代理安全操作物理设备

Anthropic 启动 MHS(Model Hardware Standard)研究预览第一阶段,为 AI 代理安全操控科研与先进制造中的物理设备制定新标准。

Model Hardware Standard 研究预览


重大 Benchmark 变化

lmarena overall — Qwen3.8-27b 大幅下滑 排名从 81 跌至 87,分数从 1439.67 降至 1435.77,下降约 3.9 分,是本轮排名跌幅最大的模型之一。

lmarena overall — Gemini-3-flash 上升 4 位 排名从 30 升至 26,分数从 1472.79 升至 1473.82。

lmarena overall — DeepSeek-v4-pro-high-20260813 上升 4 位 排名从 50 升至 46,分数从 1459.42 升至 1461.54。

lmarena overall — Qwen3.8-max 下滑 1 位但分数变动明显 排名从 19 降至 20,分数从 1481.01 降至 1479.38,降幅约 1.63 分,在前 20 名中属较大波动。

lmarena overall — GLM-5.3-max 跌出 Top-15 排名从 13 降至 15,分数从 1486.94 降至 1483.91,下降约 3 分。

lmarena overall — GLM-5.3-flash 新模型上榜 首次进入榜单,直接排在第 38 位,分数 1469.38。

快速预览

  • OpenAI 联合 100+ 组织发起全球网络防御倡议,Sam Altman 称窗口期紧迫
  • ChatGPT Work 上线网站登录功能,可在不接触用户密码的前提下代订理发、购物等
  • Google DeepMind 发布 Gemini Omni 1.1 Flash,登顶 Text-to-Video Arena
  • 法院裁定特朗普政府将 Anthropic 列入黑名单违法
  • Hugging Face 安全事件报告发布,OpenAI 公布调查结论与改进措施

详细正文

OpenAI

日期 新闻 要点
08-28 Supporting Thailand's next generation of AI startups OpenAI 与泰国 MHESI 启动为期八周的加速器,帮助 10 家健康、教育领域初创公司将 AI 原型转为可信赖产品
08-27 Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training 超过 1,000 名学生的随机研究,考察 ChatGPT、批判性思维与原创性对真实大学作业表现的影响
08-27 Expanding OpenAI's presence in Brazil OpenAI 扩大在巴西的投入,深化与开发者、企业和社区的合作
08-26 Learning never stops: How AI makes learning continuous 新报告探讨师生如何用 ChatGPT 让学习延伸到课堂之外
08-26 Bringing ChatGPT for Teachers to more U.S. school districts ChatGPT for Teachers 扩展至 55 个美国学区,覆盖超 10 万名教育工作者
08-26 The Hugging Face incident and the road ahead 公布 Hugging Face 安全事件完整调查报告,说明现有防护为何失效及改进措施
08-26 How loveholidays is making everyone a builder with Codex loveholidays 用 Codex 让各团队直接将想法转为产品
08-25 The full stack behind abundant intelligence CFO Sarah Friar 解释芯片、算力、模型、产品各层如何叠加提升智能的规模与成本效益
08-25 Jalapeño's first results show industry-leading speed and efficiency in AI inference OpenAI 自研推理芯片 Jalapeño 首批结果:更高吞吐、更低延迟
08-25 Disrupting a new covert influence campaign from Russia 封禁俄罗斯来源账号,其用 AI 推广虚假以色列智库和赞美俄罗斯的"主权"指数
08-25 Introducing the Admin plugin for ChatGPT Work and Codex Admin 插件可分析工作区用量、管理成员权限、调整限额
08-24 Advancing price-performance for developers with GPT‑5.6 in Kiro GPT-5.6 登陆 Kiro,帮助开发者规划、构建、审查和测试软件
08-20 Introducing Intelligence Age 新博客 Intelligence Age,探讨 AI 如何重塑权力、治理、经济与个人自由
08-20 Stampli cuts launch hours by 68% using ChatGPT Work Stampli 用 Codex 和 ChatGPT Work 将数周的发布工作压缩至数天
08-19 Offering Zero Data Retention for frontier models 重申符合条件的 API 客户可获零数据保留,并预告 Private Safety Processing
08-19 Replit expands access to software creation with GPT-5.6 Luna Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,用户无需担心 token 成本
08-18 ChatGPT Ads expands across Europe ChatGPT 广告扩展至 31 个欧洲市场
08-18 Strengthening democratic oversight in national security 启动 AI 国家安全民主监督倡议
08-18 Partnering with CodeAI to prepare the first AI generation 与 CodeAI 合作培养 AI 素养与批判性思维
08-18 Pacing model development in an era of cyber-critical capabilities 加强前沿模型监控、对齐与安全,引导开发节奏
08-18 Introducing ChatGPT for Teens 面向青少年的 ChatGPT,内置更强保护和家长控制
08-18 How NVIDIA scales expertise with ChatGPT Work NVIDIA 团队用 ChatGPT Work 减少手工任务并扩展工作流
08-18 Asana cleared 5 years of engineering work in 2 weeks with Codex Asana 用 Codex 两周完成预计五年的测试系统替换,花费约 1.2 万美元
08-17 The Defender's Window AI 正重塑攻防双方格局,OpenAI 分享防御建议
08-17 OpenAI joins PORTS-Pike project 加入 PORTS-Pike 项目,支持南俄亥俄州就业
08-17 New policy ideas for the Intelligence Age 资助 14 个独立项目探索 AI 政策新思路

X/Twitter 动态(@OpenAI、@OpenAIDevs 及高管)

日期 来源 要点
08-28 @OpenAIDevs: Rosalind Workbench 连接科学问题与专业模型、工具和可审查输出,覆盖蛋白质结构、序列分析和测序流程
08-28 GDB 转发 OpenRouter 数据 GPT-5.6 Terra 和 Luna 大幅降价后,OpenRouter token 用量爆发式增长 13.8 倍,Jevons 悖论成立
08-28 Tibo: most connected accounts Codex 和 ChatGPT 现支持连接多个 Gmail 和 Google 日历账号
08-28 Tibo: most ambitious task 向用户征集给 ChatGPT Work 下达的最有野心的任务
08-27 @OpenAI: 集体网络防御 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100+ 组织呼吁全球加强网络防御
08-27 Sam Altman: 紧迫时刻 "这是 AI 网络防御的关键时刻,行动窗口很小",呼吁与竞争对手或伙伴合作
08-27 GDB: ChatGPT Work 预定理发 用户 Max Weinbach 实测 ChatGPT Work 成功预约理发,称"ChatGPT 正在成为你的个人 AGI"
08-27 Tibo: 安全登录代操作 ChatGPT 可代用户购买日用品、叫 Uber、预约理发,全程不接触真实凭据
08-27 @OpenAIDevs: DevDay Exchange 首尔 10 月 22 日首尔 DevDay Exchange,报名 9 月 4 日截止;Tibo 称"将是公司史上最好的 DevDay"
08-27 @OpenAIDevs: ChatGPT Work 云浏览器登录 Victor Nunez 展示云浏览器安全登录表单与持久会话
08-26 @OpenAIDevs: WebMCP 支持 ChatGPT 桌面应用内置浏览器和 ChatGPT Sites 新增 WebMCP 支持,兼容网站可被 Agent 自动调用
08-26 @OpenAIDevs: $visualize 命令 ChatGPT Work/Codex 中可用 $visualize 将任意信息转为可视化
08-26 James Sun: 云电脑登录详细说明 安全登录表单将凭据"传送"到网站而不让模型看到;自动审查模型检查表单和目标字段;iOS 原生集成密码管理器和 2FA
08-25 @OpenAI: ChatGPT Work 网站登录上线 支持代办公用事业开通、DMV/护照预约、保险报销查询、找房、退货取件等,不接触用户名密码
08-25 @OpenAI: ChatGPT Business Premium 席位 推出 $100/月 Premium 席位,面向小企业和初创团队
08-25 @OpenAIDevs: WebMCP Challenge 黑客松 与 Cloudflare、Vercel、Shopify 等联合举办 10 天黑客松,$35,000 奖金
08-25 GDB: Hugging Face 事件调查完成 已完成调查,推动训练和评估基础设施的安全标准升级

Google

日期 新闻 要点
08-28 Google DeepMind: Gemini Omni 1.1 Flash 上线 生成式视频更可控、迭代更快、面向生产级用途,可在 Flow 中体验
08-27 Google: Gemini Omni 1.1 Flash 功能详解 支持场景延伸、起止帧指定、视频参考输入、4K 放大、360p 快速草稿
08-27 Demis Hassabis 转发 Arena 排名 Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena #1、Image-to-Video Arena #2
08-27 Demis Hassabis: 双盲前沿 AI 评估试点 行业首创双盲评估,测试提示和模型权重均不对外暴露,确保安全与性能评估可信
08-27 Google Blog: 3 new ways to plan and book travel in Search AI Mode 搜索新增旅行规划与预订功能
08-25 Google Blog: 5 ways to upgrade your home decor 搜索 AI 模式家居装饰建议
08-22 Logan Kilpatrick: Gemini 3.7 增速最快 称 Gemini 3.7 是 Google 史上增速最快的模型发布
08-21 Google DeepMind: 游戏与 AI 研究 与 Fenris Creations 合作探索持续学习、深度记忆、长期规划、多 Agent 动态
08-18 Google DeepMind: 矩阵乘法速度新纪录 宣布 omega (ω) 新纪录,相关论文已发表

Anthropic / Claude

日期 新闻 要点
08-27 Boris Cherny 转发: Model Hardware Standard 研究预览 Anthropic 启动 MHS 研究预览,为 AI Agent 安全操作物理设备制定标准
08-25 Boris Cherny: Claude 记忆升级 Claude 在 chat 和 Cowork 间共享统一记忆,用户可控制记忆内容
08-21 Boris Cherny 转发: Claude Security 扫描 Claude Security 扫描现运行于 Claude Mythos 5,面向企业客户公测

Claude Code

版本 日期 要点
v2.1.251 08-28 新增 PreModelSwitch/PostModelSwitch hook 事件;SessionStart resume hooks 获取会话过期度和重缓存成本
v2.1.250 08-28 Bug 修复与可靠性提升
v2.1.248 08-27 新增 --restricted 模式:移除命令/代码执行工具和 WebFetch,限制文件工具在工程目录内,拒绝 bypassPermissions,忽略设置文件
v2.1.247 08-26 新增 SendFeedback 工具:出问题时 Claude 可起草反馈报告供用户审查后发送

行业与社区

日期 新闻 要点
08-28 Judge rules Trump administration's blacklisting of Anthropic was illegal 法院裁定特朗普政府将 Anthropic 列入政府黑名单的行为违法(HN 507 分)
08-28 Luanti removed from Google Play due to baseless AI copyright notice Luanti 因 AI 生成的无依据版权投诉被 Google Play 下架(HN 429 分)
08-28 swyx 转发: Hugging Face 事件评论 引用 Eliezer Yudkowsky 对事件中 AI 自我牺牲行为的担忧,称"这是明显的坏消息"
08-28 Simon Willison: LLM 陈词滥调高亮器 已覆盖 38 种 AI 文本模式

行业格局

Artificial Analysis — Intelligence

当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Grok 4.6 (medium) 59.0
3 GLM-5.3-Flash 57.5

本期无变动。

LMArena — Overall

当前 Top 3:

排名 模型 分数
1 claude-fable-5 1507.48
2 claude-opus-4-6-high 1504.83
3 claude-opus-4-7-high 1502.13

本期变动(分数或排名显著变化):

模型 变化类型 前排名 → 现排名 前分数 → 现分数
gemini-3-flash 排名+分数 30 → 26 1472.79 → 1473.82
gemini-3.1-pro-preview 排名 14 → 13 1486.27 → 1486.69
gemini-3-pro 排名 15 → 14 1485.46 → 1485.62
gpt-5.5-high 排名 17 → 16 1481.89 → 1482.36
gpt-5.5 排名 23 → 22 1476.27 → 1476.71
gpt-5.6-terra-xhigh 排名 44 → 42 1465.37 → 1466.16
glm-5.3-flash 新模型 — → 38 — → 1469.38
glm-5.3-max 排名+分数 13 → 15 1486.94 → 1483.91
glm-5 排名+分数 55 → 53 1456.76 → 1457.80
glm-5.1 排名+分数 39 → 41 1467.76 → 1466.29
glm-5.2-max 排名+分数 34 → 33 1470.44 → 1471.95
deepseek-v4-pro-high-20260813 排名+分数 50 → 46 1459.42 → 1461.54
qwen3.8-max 排名+分数 19 → 20 1481.01 → 1479.38
qwen3.8-27b 排名+分数 81 → 87 1439.67 → 1435.77
qwen3.7-plus 排名+分数 53 → 56 1457.46 → 1456.30
hy3 排名+分数 56 → 59 1456.71 → 1455.64

干活选型

Artificial Analysis — Agentic

当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 GLM-5.3-Flash 58.2
3 Grok 4.6 (medium) 56.3

本期无变动。

Artificial Analysis — Coding

当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Grok 4.6 (medium) 74.4

本期无变动。

SWE-bench Pro (Public)

当前 Top 3:

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

本期无变动。

SWE-bench Verified

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
2 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

本期变动:

模型 变化 前排名 → 现排名 分数
Claude 4.5 Opus medium (20251101) 排名 2 → 1 79.2(同分,排名互换)
Claude 4.5 Opus 排名 1 → 2 79.2
GPT 5.2 Codex 排名 19 → 17 72.8
GPT 5.2 (high) 排名 18 → 19 72.8
GLM 5 (high) 排名 17 → 18 72.8
Claude 4 Sonnet + o4-mini 排名 14 → 13 74.4
GPT-5 排名 13 → 14 74.4
GPT 5.1 Codex (medium) 排名 32 → 31 66.0
GPT 5.1 (2025-11-13) (medium) 排名 31 → 32 66.0
Qwen3-Coder 480B/A35B Instruct 排名 51 → 50 55.4
GLM 4.6 (T=1) 排名 50 → 51 55.4

Terminal-Bench 2.0

当前 Top 3:

排名 模型 分数
1 GPT-5.5 (scaffold: NexAU-AHE) 84.7
2 Claude Opus 4.7 (scaffold: WOZCODE) 80.2
3 Gemini 3.1 Pro (scaffold: TongAgents) 80.2

本期变动:

模型 变化 前排名 → 现排名 分数
Claude Opus 4.7 排名 3 → 2 80.2(同分,排名互换)
Gemini 3.1 Pro 排名 2 → 3 80.2
Grok 4 排名 39 → 38 27.2
Qwen 3 Coder 480B 排名 38 → 39 27.2

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 集体网络防御倡议:Sam Altman 明确称"行动窗口很小""只有紧迫而密集的集体应对才行得通",超 100 家组织含 Anthropic、Google、Microsoft 签署——这在行业竞争常态中罕见地要求与竞争对手合作,说明 OpenAI 判断 AI 驱动的网络攻击威胁已超过商业竞争优先级。

  2. ChatGPT Work 网站登录功能:James Sun 的技术说明揭示了关键设计——安全登录表单将凭据"传送"到网站表单而模型本身不接触,配合自动审查模型检查表单与目标字段,并支持 iOS 密码管理器和 2FA。这不是简单的浏览器自动化,而是 OpenAI 在 Agent 身份隔离与安全审查层面的系统性架构选择,若验证可靠将成为 Agent 代操作网站的信任基础设施。

  3. glm-5.3-flash 新进入 LMArena 总榜第 38 名:新模型首登即获 1469.38 分,超过了 glm-5.1(第 41 名、1466.29 分)和 deepseek-v4-pro(第 54 名、1457.79 分),同时 glm-5.3-max 从第 13 下滑到第 15(分数下降约 3 分),说明该系列轻量版性价比已获得竞技场用户认可,但旗舰版的竞争力在被其他模型追平。

来源 · 91 条