← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-30

2026-08-30 08:33 CST
快速版 完整版

核心速览

【OpenAI】OpenAI 终止与 Cursor 合作,因 Cursor 被 SpaceX 收购

OpenAI 宣布在 Cursor 被 SpaceX 收购后,将终止向 Cursor 提供 OpenAI 模型的合同。Cursor 的 OpenAI 模型直接访问权限将于 11 月 12 日结束。OpenAI 模型目前服务约 5% 的 Cursor 用户流量。这意味着依赖 Cursor+OpenAI 组合的开发者需在三个月内迁移到其他模型或平台,OpenAI 表示将提供过渡支持。

原文链接

【Google DeepMind】Gemini Omni 1.1 Flash 发布,登顶 Text-to-Video Arena

Google 推出 Gemini Omni 1.1 Flash,支持视频生成与编辑,新增场景扩展、起止帧指定、4K 放大等功能,360p 快速预览降低迭代成本。该模型在 Text-to-Video Arena 排名第 1(1495 分,领先第 3 名 FLUX 3 Video +20 分),在 Image-to-Video Arena 排名第 2(仅次于 MiniMax-H3)。

原文链接

【OpenAI】Jalapeño 自研推理芯片首批结果显示行业领先的推理速度与效率

OpenAI 自研推理芯片 Jalapeño 首批测试结果公布,在吞吐量和延迟方面优于现有方案。CFO Sarah Friar 同时发文阐述 OpenAI 在芯片、算力、模型和产品全栈层面的策略,以更低成本交付更大规模的智能。

原文链接

【Anthropic】Model Hardware Standard(MHS)研究预览启动

Anthropic 启动 Model Hardware Standard 研究预览,定义 AI Agent 安全操控科研与先进制造中物理设备的新标准。这是 Agent 从纯软件向物理世界扩展的关键基础设施规范。

原文链接

【OpenAI】ChatGPT Work 云端浏览器新增网站登录功能

ChatGPT Work 的云端计算机现可安全登录网站,用户凭证通过安全表单传输,模型本身无法看到用户名和密码。这意味着 ChatGPT Work 可端到端完成需要登录的网页任务(如预约、下单、取消订阅等),无需用户中途接管。

原文链接

重大 Benchmark 变化

SWE-bench Verified 排名变动

  • Claude 4.5 Opus medium (20251101) 从第 2 名升至第 1 名(79.2 分),原排名第 1 的 Claude 4.5 Opus 降至第 2(同分 79.2)。两者分数相同,排名互换属同分微调。
  • GPT 5.2 Codex 从第 19 名升至第 17 名(72.8 分),GPT 5.2 (high) 从第 18 名降至第 19 名(同分 72.8)。

注:本轮 SWE-bench Verified 变动均为同分模型间的排名微调(分数未变),无模型出现 ≥5% 的分数变动。

快速预览

  • OpenAI 宣布在 Cursor 被 SpaceX 收购后终止向其提供模型,Cursor 方面称 OpenAI 模型仅占约 5% 流量
  • Google DeepMind 发布 Gemini Omni 1.1 Flash,登顶 Text-to-Video Arena
  • Claude Code 连发多个版本,新增 --restricted 模式和模型切换钩子
  • Anthropic 启动 Model Hardware Standard 研究预览,让 AI 智能体安全操作物理设备
  • OpenAI 联合 100+ 组织发起全球网络防御倡议

新闻

OpenAI

日期 新闻 要点
08-29 We're ending our partnership with Cursor following its acquisition by SpaceX OpenAI 提议 Cursor 对 OpenAI 模型的直接访问于 11 月 12 日终止
08-28 Our decision on Cursor following its acquisition by SpaceX 官方博客说明终止向 Cursor 提供 OpenAI 模型的决定
08-28 Supporting Thailand's next generation of AI startups 与泰国 MHESI 合作为 10 家健康、教育和福祉创业公司提供 8 周加速器
08-28 Claude Code v2.1.251 released 新增 PreModelSwitch/PostModelSwitch 钩子事件
08-28 Rosalind Workbench 连接科学问题与专用模型 从蛋白质结构分析到测序流程的一站式科研工作台
08-28 Gemini Omni 1.1 Flash 发布 新的多模态视频生成与编辑模型,支持场景延伸、起止帧指定、4K 上采样
08-27 Better answers, broader thinking: What students gain from ChatGPT 超过 1,000 名学生的随机对照研究
08-27 Expanding OpenAI's presence in Brazil 深化在巴西的开发者和企业合作
08-27 3 new ways to plan and book travel in Search Google Search AI 模式新增旅行规划功能
08-27 全球网络防御联合倡议 OpenAI 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100+ 组织发起
08-27 Claude Code v2.1.248 released 新增 --restricted 模式,移除命令执行和 WebFetch 工具
08-26 ChatGPT for Teachers 扩展至 55 个美国学区 覆盖超 10 万名教育工作者
08-26 The Hugging Face incident and the road ahead 发布 Hugging Face 安全事件技术调查报告
08-26 loveholidays uses Codex loveholidays 用 Codex 让全业务团队都能参与软件开发
08-26 Claude Code v2.1.247 released 新增 SendFeedback 工具,Claude 可起草反馈报告
08-25 Jalapeño 首批结果显示行业领先的推理速度和效率 OpenAI 自研推理芯片 Jalapeño 首次公开结果
08-25 The full stack behind abundant intelligence CFO Sarah Friar 阐述芯片、算力、模型、产品全栈协同
08-25 ChatGPT Work 云浏览器支持网站登录 用户可安全登录网站,ChatGPT 不会看到凭据
08-25 ChatGPT Business Premium 席位发布 100 美元/月 Premium 席位面向中小企业
08-25 Disrupting a new covert influence campaign from Russia 封禁俄罗斯来源账号利用 AI 推广虚假智库
08-25 Admin plugin for ChatGPT Work and Codex 分析工作区使用、管理成员权限、调整限额
08-25 Claude Code v2.1.246 released Bash 通配符允许规则启动警告
08-25 WebMCP 支持与黑客松 ChatGPT 桌面应用浏览器和 ChatGPT Sites 支持 WebMCP
08-24 GPT-5.6 in Kiro GPT-5.6 在 Kiro 中提供更好的性价比
08-20 Introducing Intelligence Age 新博客探讨 AI 对权力、治理、经济的影响
08-19 Zero Data Retention for frontier models 重申符合条件的 API 客户零数据保留
08-19 Replit Free Mode powered by GPT-5.6 Luna 免费模式让任何人无需担心 token 成本即可创建软件
08-18 ChatGPT Ads expands across Europe 广告业务扩展至 31 个欧洲市场
08-18 ChatGPT for Teens 面向青少年的 ChatGPT,内置保护和家长控制
08-18 Asana 用 Codex 两周完成预计五年的工程工作 替换旧测试系统,花费约 1.2 万美元
08-17 The Defender's Window AI 如何重塑攻防网络安全

Anthropic / Claude

日期 新闻 要点
08-27 Model Hardware Standard 研究预览启动 新标准让 AI 智能体安全操作科研和先进制造中的物理设备
08-25 Claude 记忆功能升级 聊天与 Claude Cowork 间共享统一记忆
08-21 Claude Security 扫描上线 Claude Mythos 5 企业版公测,无需单独模型访问

Google DeepMind

日期 新闻 要点
08-28 Gemini Omni 1.1 Flash 在 Flow 中上线 支持场景延伸、起止帧指定、视频参考、4K 上采样
08-27 Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena Text-to-Video 排名第 1,Image-to-Video 排名第 2
08-21 与 FenrisCreations 合作探索游戏 AI 持续学习、深度记忆、长程规划、多智能体动态
08-18 矩阵乘法速度新纪录 宣布 omega (ω) 新纪录

社区 / 个人动态

日期 来源 要点
08-29 Tibo 回应 Cursor 事件 称 5% 流量数据应有强前提说明,token 不等于收入或价值
08-29 Logan Kilpatrick "if your opponent is busy making a mistake, don't interrupt them"
08-28 Simon Willison LLM 套话高亮器更新至 38 个模式
08-22 Logan Kilpatrick: Gemini 3.7 增长最快 称 Gemini 3.7 是 Google 增长最快的模型发布
08-29 HN 热帖: Good Culture Is the Biggest Productivity Hack, Not AI 225 分
08-29 HN 热帖: StemDeck 开源本地 AI 音轨分离 199 分

Benchmark 快照

行业格局

Artificial Analysis / Intelligence(综合智能)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Grok 4.6 (medium) 59.0
3 GLM-5.3-Flash 57.5

LMArena / Overall

排名 模型 分数
1 claude-fable-5 1507.5
2 claude-opus-4-6-high 1504.8
3 claude-opus-4-7-high 1502.1

本期无变动。

干活选型

Artificial Analysis / Agentic(智能体)

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 GLM-5.3-Flash 58.2
3 Grok 4.6 (medium) 56.3

本期无变动。

Artificial Analysis / Coding

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Grok 4.6 (medium) 74.4

本期无变动。

SWE-bench Pro / Public

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

本期无变动。

SWE-bench Verified

排名 模型 分数
1 Claude 4.5 Opus medium (20251101) (live-SWE-agent) 79.2
2 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

SWE-bench Verified 变化:

模型 变化 旧排名 新排名 分数
Claude 4.5 Opus medium (20251101) 2 1 79.2(不变)
Claude 4.5 Opus 1 2 79.2(不变)
GPT 5.2 Codex 19 17 72.8(不变)
Claude 4 Sonnet + o4-mini 14 13 74.4(不变)
GPT-5 13 14 74.4(不变)

两个 Claude 4.5 Opus 变体分数同为 79.2,排名互换系同分内部调整;GPT 5.2 Codex 从第 19 升至第 17 跃升 2 位。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 终止向 Cursor 提供模型——OpenAI 在 Cursor 被 SpaceX 收购后提议 11 月 12 日切断模型访问,而 Cursor CEO Michael Truell 称 OpenAI 模型仅占约 5% 用户流量。OpenAI 的 Tibo 随即在 X 上指出该 5% 数据应有更强前提说明,且 token 量不等于收入或价值——这场分歧本质上是对"市场份额"叙事定义权的争夺,而非实际流量影响。

  2. Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena——该模型在 Text-to-Video Arena 以 1495 分领先第 3 名 FLUX 3 Video 达 20 分,同时在 Image-to-Video Arena 位居第 2(仅次于 MiniMax-H3 的 1494 分),这是 Google 在视频生成赛道首次同时占据两个榜单的前列位置。

  3. Anthropic 启动 Model Hardware Standard 研究预览——这是一个让 AI 智能体安全操作科研和先进制造中物理设备的新标准,区别于此前 AI 安全讨论多停留在软件层面,这是首次有头部实验室系统性提出物理设备操作的安全协议框架。

来源 · 94 条