【OpenAI】OpenAI 终止与 Cursor 合作,因 Cursor 被 SpaceX 收购
OpenAI 宣布在 Cursor 被 SpaceX 收购后,将终止向 Cursor 提供 OpenAI 模型的合同。Cursor 的 OpenAI 模型直接访问权限将于 11 月 12 日结束。OpenAI 模型目前服务约 5% 的 Cursor 用户流量。这意味着依赖 Cursor+OpenAI 组合的开发者需在三个月内迁移到其他模型或平台,OpenAI 表示将提供过渡支持。
【Google DeepMind】Gemini Omni 1.1 Flash 发布,登顶 Text-to-Video Arena
Google 推出 Gemini Omni 1.1 Flash,支持视频生成与编辑,新增场景扩展、起止帧指定、4K 放大等功能,360p 快速预览降低迭代成本。该模型在 Text-to-Video Arena 排名第 1(1495 分,领先第 3 名 FLUX 3 Video +20 分),在 Image-to-Video Arena 排名第 2(仅次于 MiniMax-H3)。
【OpenAI】Jalapeño 自研推理芯片首批结果显示行业领先的推理速度与效率
OpenAI 自研推理芯片 Jalapeño 首批测试结果公布,在吞吐量和延迟方面优于现有方案。CFO Sarah Friar 同时发文阐述 OpenAI 在芯片、算力、模型和产品全栈层面的策略,以更低成本交付更大规模的智能。
【Anthropic】Model Hardware Standard(MHS)研究预览启动
Anthropic 启动 Model Hardware Standard 研究预览,定义 AI Agent 安全操控科研与先进制造中物理设备的新标准。这是 Agent 从纯软件向物理世界扩展的关键基础设施规范。
【OpenAI】ChatGPT Work 云端浏览器新增网站登录功能
ChatGPT Work 的云端计算机现可安全登录网站,用户凭证通过安全表单传输,模型本身无法看到用户名和密码。这意味着 ChatGPT Work 可端到端完成需要登录的网页任务(如预约、下单、取消订阅等),无需用户中途接管。
SWE-bench Verified 排名变动
注:本轮 SWE-bench Verified 变动均为同分模型间的排名微调(分数未变),无模型出现 ≥5% 的分数变动。
--restricted 模式和模型切换钩子| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-29 | We're ending our partnership with Cursor following its acquisition by SpaceX | OpenAI 提议 Cursor 对 OpenAI 模型的直接访问于 11 月 12 日终止 |
| 08-28 | Our decision on Cursor following its acquisition by SpaceX | 官方博客说明终止向 Cursor 提供 OpenAI 模型的决定 |
| 08-28 | Supporting Thailand's next generation of AI startups | 与泰国 MHESI 合作为 10 家健康、教育和福祉创业公司提供 8 周加速器 |
| 08-28 | Claude Code v2.1.251 released | 新增 PreModelSwitch/PostModelSwitch 钩子事件 |
| 08-28 | Rosalind Workbench 连接科学问题与专用模型 | 从蛋白质结构分析到测序流程的一站式科研工作台 |
| 08-28 | Gemini Omni 1.1 Flash 发布 | 新的多模态视频生成与编辑模型,支持场景延伸、起止帧指定、4K 上采样 |
| 08-27 | Better answers, broader thinking: What students gain from ChatGPT | 超过 1,000 名学生的随机对照研究 |
| 08-27 | Expanding OpenAI's presence in Brazil | 深化在巴西的开发者和企业合作 |
| 08-27 | 3 new ways to plan and book travel in Search | Google Search AI 模式新增旅行规划功能 |
| 08-27 | 全球网络防御联合倡议 | OpenAI 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100+ 组织发起 |
| 08-27 | Claude Code v2.1.248 released | 新增 --restricted 模式,移除命令执行和 WebFetch 工具 |
| 08-26 | ChatGPT for Teachers 扩展至 55 个美国学区 | 覆盖超 10 万名教育工作者 |
| 08-26 | The Hugging Face incident and the road ahead | 发布 Hugging Face 安全事件技术调查报告 |
| 08-26 | loveholidays uses Codex | loveholidays 用 Codex 让全业务团队都能参与软件开发 |
| 08-26 | Claude Code v2.1.247 released | 新增 SendFeedback 工具,Claude 可起草反馈报告 |
| 08-25 | Jalapeño 首批结果显示行业领先的推理速度和效率 | OpenAI 自研推理芯片 Jalapeño 首次公开结果 |
| 08-25 | The full stack behind abundant intelligence | CFO Sarah Friar 阐述芯片、算力、模型、产品全栈协同 |
| 08-25 | ChatGPT Work 云浏览器支持网站登录 | 用户可安全登录网站,ChatGPT 不会看到凭据 |
| 08-25 | ChatGPT Business Premium 席位发布 | 100 美元/月 Premium 席位面向中小企业 |
| 08-25 | Disrupting a new covert influence campaign from Russia | 封禁俄罗斯来源账号利用 AI 推广虚假智库 |
| 08-25 | Admin plugin for ChatGPT Work and Codex | 分析工作区使用、管理成员权限、调整限额 |
| 08-25 | Claude Code v2.1.246 released | Bash 通配符允许规则启动警告 |
| 08-25 | WebMCP 支持与黑客松 | ChatGPT 桌面应用浏览器和 ChatGPT Sites 支持 WebMCP |
| 08-24 | GPT-5.6 in Kiro | GPT-5.6 在 Kiro 中提供更好的性价比 |
| 08-20 | Introducing Intelligence Age | 新博客探讨 AI 对权力、治理、经济的影响 |
| 08-19 | Zero Data Retention for frontier models | 重申符合条件的 API 客户零数据保留 |
| 08-19 | Replit Free Mode powered by GPT-5.6 Luna | 免费模式让任何人无需担心 token 成本即可创建软件 |
| 08-18 | ChatGPT Ads expands across Europe | 广告业务扩展至 31 个欧洲市场 |
| 08-18 | ChatGPT for Teens | 面向青少年的 ChatGPT,内置保护和家长控制 |
| 08-18 | Asana 用 Codex 两周完成预计五年的工程工作 | 替换旧测试系统,花费约 1.2 万美元 |
| 08-17 | The Defender's Window | AI 如何重塑攻防网络安全 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-27 | Model Hardware Standard 研究预览启动 | 新标准让 AI 智能体安全操作科研和先进制造中的物理设备 |
| 08-25 | Claude 记忆功能升级 | 聊天与 Claude Cowork 间共享统一记忆 |
| 08-21 | Claude Security 扫描上线 Claude Mythos 5 | 企业版公测,无需单独模型访问 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 08-28 | Gemini Omni 1.1 Flash 在 Flow 中上线 | 支持场景延伸、起止帧指定、视频参考、4K 上采样 |
| 08-27 | Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena | Text-to-Video 排名第 1,Image-to-Video 排名第 2 |
| 08-21 | 与 FenrisCreations 合作探索游戏 AI | 持续学习、深度记忆、长程规划、多智能体动态 |
| 08-18 | 矩阵乘法速度新纪录 | 宣布 omega (ω) 新纪录 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 08-29 | Tibo 回应 Cursor 事件 | 称 5% 流量数据应有强前提说明,token 不等于收入或价值 |
| 08-29 | Logan Kilpatrick | "if your opponent is busy making a mistake, don't interrupt them" |
| 08-28 | Simon Willison LLM 套话高亮器更新至 38 个模式 | |
| 08-22 | Logan Kilpatrick: Gemini 3.7 增长最快 | 称 Gemini 3.7 是 Google 增长最快的模型发布 |
| 08-29 | HN 热帖: Good Culture Is the Biggest Productivity Hack, Not AI | 225 分 |
| 08-29 | HN 热帖: StemDeck 开源本地 AI 音轨分离 | 199 分 |
Artificial Analysis / Intelligence(综合智能)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Grok 4.6 (medium) | 59.0 |
| 3 | GLM-5.3-Flash | 57.5 |
LMArena / Overall
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.5 |
| 2 | claude-opus-4-6-high | 1504.8 |
| 3 | claude-opus-4-7-high | 1502.1 |
本期无变动。
Artificial Analysis / Agentic(智能体)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | GLM-5.3-Flash | 58.2 |
| 3 | Grok 4.6 (medium) | 56.3 |
本期无变动。
Artificial Analysis / Coding
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Grok 4.6 (medium) | 74.4 |
本期无变动。
SWE-bench Pro / Public
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
本期无变动。
SWE-bench Verified
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
SWE-bench Verified 变化:
| 模型 | 变化 | 旧排名 | 新排名 | 分数 |
|---|---|---|---|---|
| Claude 4.5 Opus medium (20251101) | ↑ | 2 | 1 | 79.2(不变) |
| Claude 4.5 Opus | ↓ | 1 | 2 | 79.2(不变) |
| GPT 5.2 Codex | ↑ | 19 | 17 | 72.8(不变) |
| Claude 4 Sonnet + o4-mini | ↑ | 14 | 13 | 74.4(不变) |
| GPT-5 | ↓ | 13 | 14 | 74.4(不变) |
两个 Claude 4.5 Opus 变体分数同为 79.2,排名互换系同分内部调整;GPT 5.2 Codex 从第 19 升至第 17 跃升 2 位。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 终止向 Cursor 提供模型——OpenAI 在 Cursor 被 SpaceX 收购后提议 11 月 12 日切断模型访问,而 Cursor CEO Michael Truell 称 OpenAI 模型仅占约 5% 用户流量。OpenAI 的 Tibo 随即在 X 上指出该 5% 数据应有更强前提说明,且 token 量不等于收入或价值——这场分歧本质上是对"市场份额"叙事定义权的争夺,而非实际流量影响。
Gemini Omni 1.1 Flash 登顶 Text-to-Video Arena——该模型在 Text-to-Video Arena 以 1495 分领先第 3 名 FLUX 3 Video 达 20 分,同时在 Image-to-Video Arena 位居第 2(仅次于 MiniMax-H3 的 1494 分),这是 Google 在视频生成赛道首次同时占据两个榜单的前列位置。
Anthropic 启动 Model Hardware Standard 研究预览——这是一个让 AI 智能体安全操作科研和先进制造中物理设备的新标准,区别于此前 AI 安全讨论多停留在软件层面,这是首次有头部实验室系统性提出物理设备操作的安全协议框架。