← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-28

2026-08-28 08:37 CST
快速版 完整版

核心速览

【OpenAI】ChatGPT Work 支持网站登录,可代用户完成端到端任务

ChatGPT Work 的云端浏览器新增安全登录功能,用户通过密码管理器授权后,ChatGPT 可代为登录网站完成预约、下单、取消订阅等操作,模型全程不接触用户凭据。该功能已面向 Plus、Pro、Business 用户在 web 和移动端上线。

ChatGPT Work 网站登录功能


【Google DeepMind】Gemini Omni 1.1 Flash 发布,登顶 Text-to-Video Arena

Gemini Omni 1.1 Flash 是 Google 最新多模态视频生成与编辑模型,支持场景延展、起止帧指定、视频参考输入及 4K 放大。该模型在 Text-to-Video Arena 排名第一(1495 分,领先第三名 FLUX 3 Video 20 分),在 Image-to-Video Arena 排名第二。

Gemini Omni 1.1 Flash


【OpenAI】Jalapeño 自研推理芯片公布首批结果

OpenAI 公布自研推理芯片 Jalapeño 的首批测试数据,声称在吞吐量和延迟方面达到行业领先水平,能效优于现有方案。CFO Sarah Friar 同步发文阐述从芯片到产品的全栈策略如何压低成本和扩大规模。Greg Brockman 透露 OpenAI 保持芯片团队精简,用 AI 驱动芯片设计改进循环。

Jalapeño 首批结果


【OpenAI / Anthropic 等】超 100 家组织联署全球网络防御倡议

OpenAI 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100 余家组织发表公开信,呼吁利用 AI 进展的窗口期加强全球网络防御能力建设。Sam Altman 称这是"关键 moment",要求各方严肃对待。

全球网络防御公开信


【Anthropic】Claude Code v2.1.248 新增 --restricted 模式

Claude Code v2.1.248 引入 --restricted 标志,移除命令执行和 WebFetch 工具,限制文件操作于工作目录内,拒绝 bypassPermissions,适用于安全敏感场景。此外 v2.1.247 新增 SendFeedback 工具,会话出错时 Claude 可草拟反馈报告供用户审阅发送。

Claude Code v2.1.248


重大 Benchmark 变化

Terminal Bench 2:Claude Opus 4.7 与 Gemini 3.1 Pro 互换

Claude Opus 4.7 在 Terminal Bench 2 中排名从第 3 升至第 2(80.2 分),Gemini 3.1 Pro 从第 2 降至第 3(80.2 分)。两者分数相同,排名变动因并列重排所致。变动幅度仅 1 位,未达到≥5 的重大变动阈值,仅供参考。

SWE-Bench Verified:Claude 4.5 Opus 与 4.5 Opus medium 互换第 1-2 位

Claude 4.5 Opus medium (20251101) 从第 2 升至第 1,Claude 4.5 Opus 从第 1 降至第 2,两者均为 79.2 分。其余 SWE-Bench 排名变动均 ≤2 位,不构成重大变化。

本期无排名变动≥5 或分数变动≥5% 的重大 Benchmark 变化。

快速预览

  • OpenAI 联合 100+ 组织发起全球网络防御倡议,Sam Altman 称"时间窗口紧迫"
  • Google 发布 Gemini Omni 1.1 Flash,登顶 Text-to-Video Arena 第一
  • ChatGPT Work 上线网站登录功能,可在不接触用户密码的情况下代为操作各类网站
  • Claude Code v2.1.248 新增 --restricted 模式,移除命令执行与 WebFetch 工具
  • Hugging Face 安全事件调查报告发布,OpenAI 公布改进措施

详细正文

新闻

OpenAI

日期 新闻
08-27 Better answers, broader thinking: What students gain from ChatGPT and critical-thinking training — 超过 1,000 名学生的随机研究,考察 ChatGPT、批判性思维与学术表现
08-27 Expanding OpenAI's presence in Brazil — 深化在巴西的开发者、企业与社区合作
08-27 全球网络防御联合倡议 — 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100+ 组织发起公开信,呼吁全球加强网络防御 (Greg Brockman 原文)
08-27 Sam Altman:网络防御的关键时刻 — 强调"时间窗口紧迫",呼吁各方立即行动
08-27 DevDay Exchange Seoul 报名开放 — 10 月 22 日首尔举办,9 月 4 日截止报名
08-26 The Hugging Face incident and the road ahead — 发布安全事件技术报告,公布训练与评估基础设施的改进措施 (Greg Brockman 评述)
08-26 Bringing ChatGPT for Teachers to more U.S. school districts — 扩展至 55 个学区,覆盖超 10 万教育工作者
08-26 Learning never stops: How AI makes learning continuous — 新报告探讨学生和教师如何用 ChatGPT 延展课堂外学习
08-26 How loveholidays is making everyone a builder with Codex — loveholidays 用 Codex 让全业务线员工参与软件开发
08-26 ChatGPT Work 网站登录功能上线 — 云浏览器可安全登录网站,ChatGPT 不接触用户凭据;支持预约、订餐、取消订阅等端到端任务
08-26 WebMCP 支持上线 — ChatGPT 桌面应用内嵌浏览器支持 WebMCP 开放标准,网站可为 agent 暴露工具
08-25 ChatGPT Business Premium Seats 发布 — $100/席 Premium 席位面向小企业和初创团队
08-25 The full stack behind abundant intelligence — CFO Sarah Friar 讲述芯片、算力、模型、产品层面的叠加效应
08-25 Jalapeño's first results show industry-leading speed and efficiency in AI inference — 自研推理芯片 Jalapeño 首批结果:更高吞吐、更低延迟
08-25 Disrupting a new covert influence campaign from Russia — 封禁俄罗斯来源账号,打击冒充以色列智库的影响力行动
08-25 Introducing the Admin plugin for ChatGPT Work and Codex — 工作区用量分析、成员管理、权限与限额调整
08-24 Advancing price-performance for developers with GPT‑5.6 in Kiro — GPT-5.6 登陆 Kiro,面向开发者软件构建全流程
08-20 Introducing Intelligence Age — 新博客探讨 AI 对权力、治理、经济与个人自由的重塑
08-20 Stampli cuts launch hours by 68% using ChatGPT Work — 用 Codex 和 ChatGPT Work 将数周发布工作压缩为数天
08-19 Offering Zero Data Retention for frontier models — 重申符合条件的 API 客户零数据留存,预览 Private Safety Processing
08-19 Replit expands access to software creation with GPT-5.6 Luna — Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动
08-18 ChatGPT Ads expands across Europe — 扩展至 31 个欧洲市场
08-18 Strengthening democratic oversight in national security — 面向政府机构的工具、培训与专业支持
08-18 Partnering with CodeAI to prepare the first AI generation — 合作培养学生的 AI 素养与批判性思维
08-18 Pacing model development in an era of cyber-critical capabilities — 加强前沿模型监控、对齐与安全
08-18 Introducing ChatGPT for Teens — 面向青少年,内置更强保护和家长控制
08-18 How NVIDIA scales expertise with ChatGPT Work — NVIDIA 团队用 ChatGPT Work 减少手动任务
08-18 Asana cleared 5 years of engineering work in 2 weeks with Codex — 约 $12K 成本完成预计 5 年的测试系统替换
08-17 The Defender's Window — AI 对网络攻防双方的影响与防御建议
08-17 OpenAI joins PORTS-Pike project — 扩大社区投资,支持南俄亥俄州数千就业
08-17 New policy ideas for the Intelligence Age — 资助 14 个独立 AI 政策研究项目

Anthropic / Claude Code

日期 新闻
08-27 Claude Code v2.1.248 released — 新增 --restricted 模式:移除命令执行工具和 WebFetch,限制文件操作于工作目录内,拒绝 bypassPermissions,忽略设置文件
08-26 Claude Code v2.1.247 released — 新增 SendFeedback 工具,Claude 可在会话出错时起草反馈报告,通过 /feedback 发送
08-25 Claude Code v2.1.246 released — 对 Bash 通配符允许规则(如 Bash(git * main))添加启动警告,因其可能匹配子命令前插入的选项
08-25 Claude Code v2.1.245 released — 修复 glibc 2.44 发行版(Arch Linux、CachyOS、Fedora Rawhide)启动崩溃
08-23 Claude Code v2.1.241 released — Bug 修复与稳定性改进
08-25 Claude 记忆功能升级 — chat 与 Claude Cowork 共享统一记忆,用户可控制记忆内容

Google / DeepMind

日期 新闻
08-27 Gemini Omni 1.1 Flash 发布 — 新增多模态视频生成与编辑能力:场景延展、起止帧指定、视频参考输入、4K 放大、360p 快速预览(HN 讨论Demis Hassabis 评述
08-27 Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena — Text-to-Video 排名 #1(1495 分,领先第三名 FLUX 3 Video +20 分),Image-to-Video 排名 #2(仅次于 MiniMax-H3)
08-26 Gemini 3.5 Transcribe 发布 — 新语音转文字模型,支持智能转录、函数调用、自定义词汇、多说话人识别、85+ 语言、实时流式(HN 讨论
08-27 3 new ways to plan and book travel in Search — AI Mode 搜索新增旅行规划与预订功能
08-25 5 ways to upgrade your home decor with Google Search — 搜索中的家居装饰建议
08-19 5 new ways to level up your learning with Search — 搜索中的学习工具更新
08-17 Get closer to the game with Gemini and Pixel — Gemini 和 Pixel 与足球俱乐部合作
08-22 Gemini 3.7 为最快增长模型发布 — Logan Kilpatrick 称 Gemini 3.7 是 Google 增长最快的模型发布

社区与评论

日期 新闻
08-27 Show HN: The load-bearing vocabulary of Claude — HN 324 分,分析 Claude 的"承重词汇"
08-27 MIT's Ad Hoc Committee on AI Use in Teaching — HN 105 分,MIT 发布 AI 教学使用建议报告
08-26 The turbulent AI era is here — HN 198 分,Bill Gates 撰文讨论 AI 时代的关键选择
08-26 swyx 警告 Codex "locked use" 功能 — 因依赖不稳定的 macOS 功能,一周内两次锁定 keychain,建议暂避
08-27 Simon Willison 讨论 Chat 与 Work 使用场景 — 调查用户何时切换到 ChatGPT Work

行业格局

Artificial Analysis — Intelligence 综合榜

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh) 62.5
2 Grok 4.6 (medium) 59.0
3 GLM-5.3-Flash 57.5

LMArena — Overall 榜

本期无变动。当前 Top 3:

排名 模型 分数
1 claude-fable-5 1507.8
2 claude-opus-4-6-high 1504.5
3 claude-opus-4-7-high 1502.0

干活选型

Artificial Analysis — Agentic 榜

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh) 58.4
2 GLM-5.3-Flash 58.2
3 Grok 4.6 (medium) 56.3

Artificial Analysis — Coding 榜

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Grok 4.6 (medium) 74.4

SWE-bench Verified

有变动:

模型 变化
Claude 4.5 Opus medium (20251101) ↑ 2→1(分数不变 79.2)
Claude 4.5 Opus ↓ 1→2(分数不变 79.2)
GPT 5.2 Codex ↑ 19→17(分数不变 72.8)
GPT 5.2 (high) ↓ 18→19(分数不变 72.8)
Claude 4 Sonnet + o4-mini ↑ 14→13(分数不变 74.4)
GPT-5 ↓ 13→14(分数不变 74.4)
GPT 5.1 Codex (medium) ↑ 32→31(分数不变 66.0)
GPT 5.1 (2025-11-13) (medium) ↓ 31→32(分数不变 66.0)
GLM 5 (high) ↓ 17→18(分数不变 72.8)
GLM 4.6 (T=1) ↓ 50→51(分数不变 55.4)
Qwen3-Coder 480B/A35B Instruct ↑ 51→50(分数不变 55.4)

所有变化均为同分排名互换,无分数变化。

Terminal-Bench 2.0

有变动:

模型 变化
Claude Opus 4.7 ↑ 3→2(分数不变 80.2)
Gemini 3.1 Pro ↓ 2→3(分数不变 80.2)
Grok 4 ↑ 39→38(分数不变 27.2)
Qwen 3 Coder 480B ↓ 38→39(分数不变 27.2)

均为同分排名互换,无分数变化。

SWE-bench Pro (Public)Artificial Analysis Coding/Agentic 榜单本期无变动(Top 3 见上方快照表)。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 全球网络防御联合倡议:超过 100 个组织(含 Anthropic、AWS、Google、Microsoft、Oracle)签署公开信,Sam Altman 明确声明"时间窗口紧迫,只有紧急且密集的集体应对才能奏效"。这标志着头部 AI 公司正将安全叙事从"模型对齐"扩展到"基础设施防御"层面,且是以行业联合而非单家公司的形式出现——姿态本身比公开信的技术细节更值得追踪。

  2. ChatGPT Work 网站登录功能:通过安全登录表单将用户凭据"传送"到目标网站表单,模型本身不接触凭据,配合自动审核模型检查表单与目标字段匹配度,同时支持 2FA 码和密码管理器。这意味着 ChatGPT 从"信息检索与生成"正式进入"代用户操作任意网站"阶段,且在凭据隔离上做了工程化设计——不再是 demo,而是面向 Plus/Pro/Business 用户的全量推送。

  3. Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena:以 1495 分领先第三名 FLUX 3 Video +20 分,Image-to-Video 以 +25 分的进步从上代 #5 跃升到 #2。在视频生成这个高度主观的领域,Arena 盲测数据是目前最可靠的横向比较手段——Google 在此赛道拿到了明确的第一。

来源 · 98 条