【OpenAI】OpenAI 终止与 Cursor 合作,因 SpaceX 收购
OpenAI 宣布在 Cursor 被 SpaceX 收购后,将终止向其提供模型访问。Cursor 对 OpenAI 模型的直接访问将于 11 月 12 日结束。这意味着所有依赖 OpenAI 模型在 Cursor 内开发的用户需要在此前迁移到其他方案,直接影响大量开发者工作流。
Our decision on Cursor following its acquisition by SpaceX
【OpenAI】ChatGPT Work 云端浏览器支持网站登录
ChatGPT Work 的云端浏览器新增安全登录功能,用户可通过加密表单将凭证直接注入网站,模型本身无法看到用户名或密码。登录状态可跨会话持久化,使 ChatGPT 能端到端完成预订、取消订阅、提交报销等需要身份验证的任务。
ChatGPT Work sign-in announcement
【OpenAI】Hugging Face 安全事件调查报告发布
OpenAI 公布 Hugging Face 安全事件的完整技术报告,重建了涉事 agent 活动时间线,解释了现有安全防线为何失效,并制定了防止复发的新标准——覆盖训练和评估基础设施全链路,而非仅部署阶段。
The Hugging Face incident and the road ahead
【Google DeepMind】Gemini Omni 1.1 Flash 发布,登顶 Text-to-Video Arena
Gemini Omni 1.1 Flash 是 Google 最新的多模态视频生成与编辑模型,支持场景扩展、起止帧指定、视频参考输入及 4K 上采样。该模型在 Text-to-Video Arena 排名第一(领先第三名 FLUX 3 Video 20 分),Image-to-Video Arena 排名第二。
Gemini Omni 1.1 Flash announcement
【Anthropic】Model Hardware Standard 研究预览启动
Anthropic 启动 Model Hardware Standard (MHS) 研究预览第一阶段,为 AI 代理安全操作科研设备和先进制造中的物理硬件制定新标准。
Model Hardware Standard research preview
SWE-bench Verified:Claude 4.5 Opus 排名互换
本期无排名变动≥5 或分数变动≥5% 的重大变化。以上为同分排名微调,未达报告阈值,仅作记录。
--restricted 模式与模型切换钩子| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-29 | We're ending our partnership with Cursor following its acquisition by SpaceX | OpenAI 提出在 11 月 12 日终止 Cursor 对其模型的直接访问,并承诺为受影响的开发者提供过渡支持 |
| 08-28 | Our decision on Cursor following its acquisition by SpaceX | 官方博客正式说明终止 Cursor 合同的决定及背景 |
| 08-28 | Supporting Thailand's next generation of AI startups | 与泰国 MHESI 合作推出为期八周的加速器,支持 10 家健康、教育和福祉领域初创公司 |
| 08-27 | Better answers, broader thinking | 超过 1,000 名学生的随机对照研究,考察 ChatGPT 与批判性思维训练对学业表现的影响 |
| 08-27 | Expanding OpenAI's presence in Brazil | 扩大在巴西的业务,深化与当地开发者、企业和社区的合作 |
| 08-27 | Collective Cyberdefense open letter | 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100+ 组织发起全球网络防御公开信 |
| 08-26 | Learning never stops | 新报告探讨学生和教师如何利用 ChatGPT 延续课堂之外的持续学习 |
| 08-26 | Bringing ChatGPT for Teachers to more U.S. school districts | ChatGPT for Teachers 扩展至 55 个美国学区,覆盖超 10 万名教职员工 |
| 08-26 | The Hugging Face incident and the road ahead | 发布 Hugging Face 安全事件技术调查报告,详述现有防护为何失败及防再发生措施 |
| 08-26 | How loveholidays is making everyone a builder with Codex | loveholidays 使用 OpenAI Codex 让各业务团队快速将想法转化为产品 |
| 08-26 | ChatGPT Work can sign in to websites | ChatGPT Work 云端浏览器新增安全登录能力,可代用户完成预订、续费、购物等端到端任务,模型本身不接触密码 |
| 08-25 | ChatGPT Business Premium Seats | 推出 $100/月 Premium 席位,面向中小企业和初创团队提供更强大的工具和工作流 |
| 08-25 | The full stack behind abundant intelligence | CFO Sarah Friar 阐述芯片、算力、模型和产品各层面的叠加进步如何以更低成本提供更强的智能 |
| 08-25 | Jalapeño's first results show industry-leading speed and efficiency | 自研推理芯片 Jalapeño 首批结果显示更高吞吐和更低延迟 |
| 08-25 | Disrupting a new covert influence campaign from Russia | 封禁源自俄罗斯的账户,其利用 AI 推广虚假以色列智库并赞扬俄罗斯、批评西方 |
| 08-25 | Introducing the Admin plugin for ChatGPT Work and Codex | 新管理插件可分析工作区使用情况、管理成员权限、调整限额及处理管理请求 |
| 08-24 | Advancing price-performance with GPT-5.6 in Kiro | GPT-5.6 在 Kiro 中可用,帮助开发者以更好的性价比规划、构建、审查和测试软件 |
| 08-29 | GitHub plugin syncing for ChatGPT workspaces | 管理员可从公开或私有仓库导入 Codex 或 Claude marketplace 并共享插件,工作区每日自动同步更新 |
| 08-28 | Rosalind Workbench | 面向科学研究的工作台,连接蛋白质结构、序列分析和测序管线等专业模型与工具 |
| 08-27 | DevDay Exchange Seoul — apply by Sep 4 | OpenAI DevDay Exchange 将于 10 月 22 日在首尔举办,报名 9 月 4 日截止 |
| 08-26 | WebMCP support in ChatGPT desktop app | ChatGPT 桌面应用内置浏览器和 ChatGPT Sites 新增 WebMCP 支持,兼容网站可被 ChatGPT/Codex 自动利用 |
| 08-25 | WebMCP Challenge hackathon | 联合 Chrome Dev、Cloudflare、Shopify、Vercel、Render、Netlify 举办 10 天黑客松,奖金 $35,000 |
| 08-19 | Replit Free Mode powered by GPT-5.6 Luna | Replit 推出免费模式,由 GPT-5.6 Luna 驱动,用户无需担心 token 成本即可构建软件 |
| 08-18 | ChatGPT Ads expands across Europe | ChatGPT 广告扩展至 31 个欧洲市场 |
| 08-18 | Strengthening democratic oversight in national security | 启动新计划,为政府机构提供工具、培训和专业知识以加强 AI 在国家安全领域的民主监督 |
| 08-18 | ChatGPT for Teens | 面向青少年的 ChatGPT 版本,内置更强防护和健康使用功能,并提供家长控制 |
| 08-18 | Pacing model development in cyber-critical era | 加强前沿模型的监控、对齐和安全防护,以此指导模型开发节奏 |
| 08-18 | Asana cleared 5 years of engineering work in 2 weeks with Codex | Asana 用 Codex 两周完成预计需五年的测试系统替换工作,花费约 $12K |
| 08-18 | NVIDIA scales expertise with ChatGPT Work | NVIDIA 团队用 ChatGPT Work 减少手动任务并规模化工作流 |
| 08-17 | The Defender's Window | 探讨 AI 如何重塑网络安全攻防格局,以及 OpenAI 的防御措施 |
| 08-17 | OpenAI joins PORTS-Pike project | 加入 PORTS-Pike 项目,扩大社区投资并支持俄亥俄南部数千个工作岗位 |
| 08-17 | New policy ideas for the Intelligence Age | 资助 14 个独立项目探索 AI 政策新思路 |
| 08-20 | Introducing Intelligence Age blog | 新博客探讨变革性 AI 如何重塑权力、治理、经济和个人自由 |
| 08-19 | Offering Zero Data Retention for frontier models | 重申为符合条件的 API 客户提供零数据保留,并预告 Private Safety Processing |
| 08-20 | Stampli cuts launch hours by 68% | Stampli 用 Codex 和 ChatGPT Work 将数周上线生产压缩至数天 |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-28 | Gemini Omni 1.1 Flash rolling out | 生成式视频模型新版本,支持更可控迭代和更高质量输出 |
| 08-27 | Gemini Omni 1.1 Flash ranked #1 in Text-to-Video Arena | 登顶 Text-to-Video Arena(1495 分,领先 #3 FLUX 3 Video +20 分),Image-to-Video Arena 排名 #2 |
| 08-27 | 3 new ways to plan and book travel in Search | AI Mode in Search 推出三项旅行规划和预订功能 |
| 08-25 | 5 ways to upgrade your home decor with Google Search | 搜索推出家居装饰相关功能 |
| 08-21 | Games as AI research testbed — partnership with Fenris Creations | 探索持续学习、深度记忆、长期规划和多智能体动态等开放挑战 |
| 08-22 | Gemini 3.7 is fastest growing model launch to date | Logan Kilpatrick 称 Gemini 3.7 是 Google 历史上增长最快的模型发布 |
| 08-18 | New record for matrix multiplication omega | 宣布矩阵乘法指数 ω 的新纪录 |
| 08-28 | Co-Scientist extension for scientific discovery | Gemini Co-Scientist 扩展至材料科学、生物学和计算机科学领域 |
| 08-19 | 5 new ways to level up learning with Search | 搜索推出开学季学习工具 |
| 08-17 | Gemini and Pixel football club partnerships | Gemini 和 Pixel 与足球俱乐部合作 |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-27 | Model Hardware Standard research preview | Anthropic 启动 MHS 研究预览,建立 AI 智能体安全操控物理设备的新标准,面向科研和先进制造 |
| 08-25 | Claude memory now simpler and more powerful | Claude 在 chat 和 Claude Cowork 之间统一记忆,用户可控制记忆内容 |
| 08-21 | Claude Security scans on Claude Mythos 5 | 安全扫描功能运行在 Claude Mythos 5 上,向所有 Claude Enterprise 客户公开测试 |
| 日期 | 版本 | 摘要 |
|---|---|---|
| 08-28 | v2.1.251 | 新增 PreModelSwitch/PostModelSwitch 钩子事件;SessionStart resume 钩子接收会话过期度和重缓存成本 |
| 08-28 | v2.1.250 | Bug 修复和可靠性改进 |
| 08-27 | v2.1.248 | 新增 --restricted 模式:移除运行命令/代码的内置工具和 WebFetch,文件工具限制在工作目录内 |
| 08-26 | v2.1.247 | 新增 SendFeedback 工具,Claude 可起草反馈报告供用户审阅发送 |
| 08-25 | v2.1.246 | 新增 Bash 通配符 allow 规则启动警告 |
| 日期 | 标题 | 摘要 |
|---|---|---|
| 08-30 | ChatGPT 桌面端长对话加载提速 90%+ | Brent Traut 优化桌面端长对话加载速度和内存占用均超 90% |
| 08-28 | swyx 谈 80% GDP 可被 agent 自动化 | 在 Navigators 播客中讨论阻碍 agent 采用的瓶颈不在模型本身 |
| 08-28 | Simon Willison LLM cliché highlighter 达 38 个模式 | 更新 AI 文本套话检测工具 |
| 08-27 | Sam Altman 呼吁重视 AI 网络防御 | 强调当前是网络防御关键时刻,呼吁集体紧急应对 |
| 08-26 | Greg Brockman 称 AI 芯片设计被低估 | 评论 OpenAI 用小团队和 AI 改进循环做芯片设计 |
| 08-24 | What my dad taught me about AI coding in the 90s | HN 热帖(127 分),回顾 90 年代的 AI 编程经验 |
AA / Intelligence — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Grok 4.6 (medium) | 59.0 |
| 3 | GLM-5.3-Flash | 57.5 |
LMArena / Overall — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1507.48 |
| 2 | claude-opus-4-6-high | 1504.83 |
| 3 | claude-opus-4-7-high | 1502.13 |
AA / Agentic — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | GLM-5.3-Flash | 58.2 |
| 3 | Grok 4.6 (medium) | 56.3 |
AA / Coding — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Grok 4.6 (medium) | 74.4 |
SWE-bench Pro / Public — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
SWE-bench Verified — 本期有变动
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude 4.5 Opus medium (20251101) | ↑ | 2 → 1 | 79.2 |
| Claude 4.5 Opus | ↓ | 1 → 2 | 79.2 |
| GPT 5.2 Codex | ↑ | 19 → 17 | 72.8 |
| GPT 5.2 (high) | ↓ | 18 → 19 | 72.8 |
| Claude 4 Sonnet + o4-mini | ↑ | 14 → 13 | 74.4 |
| GPT-5 | ↓ | 13 → 14 | 74.4 |
| GPT 5.1 Codex (medium) | ↑ | 32 → 31 | 66.0 |
| GPT 5.1 (medium) | ↓ | 31 → 32 | 66.0 |
| GLM 5 (high) | ↓ | 17 → 18 | 72.8 |
| Qwen3-Coder 480B/A35B Instruct | ↑ | 51 → 50 | 55.4 |
| GLM 4.6 (T=1) | ↓ | 50 → 51 | 55.4 |
注:以上排名变化均为同分模型间的位次互换,分数本身未变。Top 5 当前完整排名为:Claude 4.5 Opus medium (20251101) 79.2、Claude 4.5 Opus 79.2、Doubao-Seed-Code 78.8、Gemini 3 Pro Preview 77.4、Claude 4 Sonnet 76.8。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 终止 Cursor 合作:Cursor 被 SpaceX 收购后,OpenAI 以明确时间表(11 月 12 日截止)切断模型直接访问,这意味着所有依赖 OpenAI 模型的 Cursor 用户必须在此前完成迁移——OpenAI 同时强调"准备好为开发者提供超出常规的过渡支持",实际上是在争夺这批高价值开发者留存到自家 Codex 生态。
ChatGPT Work 云端浏览器登录功能:模型本身不接触用户凭据(通过安全登录表单"传送"凭据到网站字段),加上自动审查模型检查表单目标——这一设计直接解决了 agent 代登录的安全信任瓶颈,使 ChatGPT Work 从"信息助手"升级为可端到端完成预订、续费等实际任务的执行体。
SWE-bench Verified Top 1 易主:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 同为 79.2 分,但排名从 #2 升至 #1,说明在 scaffold (live-SWE-agent) 加持下 medium 配置的版本在评测稳定性或提交时间戳上取得了优先判定——同分模型间排名互换虽不影响绝对实力判断,但 Top 1 的标签对市场认知有实际影响。