【OpenAI】ChatGPT Work 支持网站登录,可代用户完成端到端任务
ChatGPT Work 的云端浏览器新增安全登录功能,用户通过密码管理器授权后,ChatGPT 可代为登录网站完成预约、下单、取消订阅等操作,模型全程不接触用户凭据。该功能已面向 Plus、Pro、Business 用户在 web 和移动端上线。
【Google DeepMind】Gemini Omni 1.1 Flash 发布,登顶 Text-to-Video Arena
Gemini Omni 1.1 Flash 是 Google 最新多模态视频生成与编辑模型,支持场景延展、起止帧指定、视频参考输入及 4K 放大。该模型在 Text-to-Video Arena 排名第一(1495 分,领先第三名 FLUX 3 Video 20 分),在 Image-to-Video Arena 排名第二。
【OpenAI】Jalapeño 自研推理芯片公布首批结果
OpenAI 公布自研推理芯片 Jalapeño 的首批测试数据,声称在吞吐量和延迟方面达到行业领先水平,能效优于现有方案。CFO Sarah Friar 同步发文阐述从芯片到产品的全栈策略如何压低成本和扩大规模。Greg Brockman 透露 OpenAI 保持芯片团队精简,用 AI 驱动芯片设计改进循环。
【OpenAI / Anthropic 等】超 100 家组织联署全球网络防御倡议
OpenAI 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100 余家组织发表公开信,呼吁利用 AI 进展的窗口期加强全球网络防御能力建设。Sam Altman 称这是"关键 moment",要求各方严肃对待。
【Anthropic】Claude Code v2.1.248 新增 --restricted 模式
Claude Code v2.1.248 引入 --restricted 标志,移除命令执行和 WebFetch 工具,限制文件操作于工作目录内,拒绝 bypassPermissions,适用于安全敏感场景。此外 v2.1.247 新增 SendFeedback 工具,会话出错时 Claude 可草拟反馈报告供用户审阅发送。
Terminal Bench 2:Claude Opus 4.7 与 Gemini 3.1 Pro 互换
Claude Opus 4.7 在 Terminal Bench 2 中排名从第 3 升至第 2(80.2 分),Gemini 3.1 Pro 从第 2 降至第 3(80.2 分)。两者分数相同,排名变动因并列重排所致。变动幅度仅 1 位,未达到≥5 的重大变动阈值,仅供参考。
SWE-Bench Verified:Claude 4.5 Opus 与 4.5 Opus medium 互换第 1-2 位
Claude 4.5 Opus medium (20251101) 从第 2 升至第 1,Claude 4.5 Opus 从第 1 降至第 2,两者均为 79.2 分。其余 SWE-Bench 排名变动均 ≤2 位,不构成重大变化。
本期无排名变动≥5 或分数变动≥5% 的重大 Benchmark 变化。
--restricted 模式,移除命令执行与 WebFetch 工具| 日期 | 新闻 |
|---|---|
| 08-27 | Claude Code v2.1.248 released — 新增 --restricted 模式:移除命令执行工具和 WebFetch,限制文件操作于工作目录内,拒绝 bypassPermissions,忽略设置文件 |
| 08-26 | Claude Code v2.1.247 released — 新增 SendFeedback 工具,Claude 可在会话出错时起草反馈报告,通过 /feedback 发送 |
| 08-25 | Claude Code v2.1.246 released — 对 Bash 通配符允许规则(如 Bash(git * main))添加启动警告,因其可能匹配子命令前插入的选项 |
| 08-25 | Claude Code v2.1.245 released — 修复 glibc 2.44 发行版(Arch Linux、CachyOS、Fedora Rawhide)启动崩溃 |
| 08-23 | Claude Code v2.1.241 released — Bug 修复与稳定性改进 |
| 08-25 | Claude 记忆功能升级 — chat 与 Claude Cowork 共享统一记忆,用户可控制记忆内容 |
| 日期 | 新闻 |
|---|---|
| 08-27 | Gemini Omni 1.1 Flash 发布 — 新增多模态视频生成与编辑能力:场景延展、起止帧指定、视频参考输入、4K 放大、360p 快速预览(HN 讨论,Demis Hassabis 评述) |
| 08-27 | Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena — Text-to-Video 排名 #1(1495 分,领先第三名 FLUX 3 Video +20 分),Image-to-Video 排名 #2(仅次于 MiniMax-H3) |
| 08-26 | Gemini 3.5 Transcribe 发布 — 新语音转文字模型,支持智能转录、函数调用、自定义词汇、多说话人识别、85+ 语言、实时流式(HN 讨论) |
| 08-27 | 3 new ways to plan and book travel in Search — AI Mode 搜索新增旅行规划与预订功能 |
| 08-25 | 5 ways to upgrade your home decor with Google Search — 搜索中的家居装饰建议 |
| 08-19 | 5 new ways to level up your learning with Search — 搜索中的学习工具更新 |
| 08-17 | Get closer to the game with Gemini and Pixel — Gemini 和 Pixel 与足球俱乐部合作 |
| 08-22 | Gemini 3.7 为最快增长模型发布 — Logan Kilpatrick 称 Gemini 3.7 是 Google 增长最快的模型发布 |
| 日期 | 新闻 |
|---|---|
| 08-27 | Show HN: The load-bearing vocabulary of Claude — HN 324 分,分析 Claude 的"承重词汇" |
| 08-27 | MIT's Ad Hoc Committee on AI Use in Teaching — HN 105 分,MIT 发布 AI 教学使用建议报告 |
| 08-26 | The turbulent AI era is here — HN 198 分,Bill Gates 撰文讨论 AI 时代的关键选择 |
| 08-26 | swyx 警告 Codex "locked use" 功能 — 因依赖不稳定的 macOS 功能,一周内两次锁定 keychain,建议暂避 |
| 08-27 | Simon Willison 讨论 Chat 与 Work 使用场景 — 调查用户何时切换到 ChatGPT Work |
Artificial Analysis — Intelligence 综合榜
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh) | 62.5 |
| 2 | Grok 4.6 (medium) | 59.0 |
| 3 | GLM-5.3-Flash | 57.5 |
LMArena — Overall 榜
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.8 |
| 2 | claude-opus-4-6-high | 1504.5 |
| 3 | claude-opus-4-7-high | 1502.0 |
Artificial Analysis — Agentic 榜
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh) | 58.4 |
| 2 | GLM-5.3-Flash | 58.2 |
| 3 | Grok 4.6 (medium) | 56.3 |
Artificial Analysis — Coding 榜
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Grok 4.6 (medium) | 74.4 |
SWE-bench Verified
有变动:
| 模型 | 变化 |
|---|---|
| Claude 4.5 Opus medium (20251101) | ↑ 2→1(分数不变 79.2) |
| Claude 4.5 Opus | ↓ 1→2(分数不变 79.2) |
| GPT 5.2 Codex | ↑ 19→17(分数不变 72.8) |
| GPT 5.2 (high) | ↓ 18→19(分数不变 72.8) |
| Claude 4 Sonnet + o4-mini | ↑ 14→13(分数不变 74.4) |
| GPT-5 | ↓ 13→14(分数不变 74.4) |
| GPT 5.1 Codex (medium) | ↑ 32→31(分数不变 66.0) |
| GPT 5.1 (2025-11-13) (medium) | ↓ 31→32(分数不变 66.0) |
| GLM 5 (high) | ↓ 17→18(分数不变 72.8) |
| GLM 4.6 (T=1) | ↓ 50→51(分数不变 55.4) |
| Qwen3-Coder 480B/A35B Instruct | ↑ 51→50(分数不变 55.4) |
所有变化均为同分排名互换,无分数变化。
Terminal-Bench 2.0
有变动:
| 模型 | 变化 |
|---|---|
| Claude Opus 4.7 | ↑ 3→2(分数不变 80.2) |
| Gemini 3.1 Pro | ↓ 2→3(分数不变 80.2) |
| Grok 4 | ↑ 39→38(分数不变 27.2) |
| Qwen 3 Coder 480B | ↓ 38→39(分数不变 27.2) |
均为同分排名互换,无分数变化。
SWE-bench Pro (Public) 与 Artificial Analysis Coding/Agentic 榜单本期无变动(Top 3 见上方快照表)。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 全球网络防御联合倡议:超过 100 个组织(含 Anthropic、AWS、Google、Microsoft、Oracle)签署公开信,Sam Altman 明确声明"时间窗口紧迫,只有紧急且密集的集体应对才能奏效"。这标志着头部 AI 公司正将安全叙事从"模型对齐"扩展到"基础设施防御"层面,且是以行业联合而非单家公司的形式出现——姿态本身比公开信的技术细节更值得追踪。
ChatGPT Work 网站登录功能:通过安全登录表单将用户凭据"传送"到目标网站表单,模型本身不接触凭据,配合自动审核模型检查表单与目标字段匹配度,同时支持 2FA 码和密码管理器。这意味着 ChatGPT 从"信息检索与生成"正式进入"代用户操作任意网站"阶段,且在凭据隔离上做了工程化设计——不再是 demo,而是面向 Plus/Pro/Business 用户的全量推送。
Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena:以 1495 分领先第三名 FLUX 3 Video +20 分,Image-to-Video 以 +25 分的进步从上代 #5 跃升到 #2。在视频生成这个高度主观的领域,Arena 盲测数据是目前最可靠的横向比较手段——Google 在此赛道拿到了明确的第一。