← 返回列表
SILASCODING · AI 情报

AI 日报 2026-08-31

2026-08-31 08:33 CST
快速版 完整版

核心速览

【OpenAI】OpenAI 终止与 Cursor 合作,因 SpaceX 收购

OpenAI 宣布在 Cursor 被 SpaceX 收购后,将终止向其提供模型访问。Cursor 对 OpenAI 模型的直接访问将于 11 月 12 日结束。这意味着所有依赖 OpenAI 模型在 Cursor 内开发的用户需要在此前迁移到其他方案,直接影响大量开发者工作流。

Our decision on Cursor following its acquisition by SpaceX

【OpenAI】ChatGPT Work 云端浏览器支持网站登录

ChatGPT Work 的云端浏览器新增安全登录功能,用户可通过加密表单将凭证直接注入网站,模型本身无法看到用户名或密码。登录状态可跨会话持久化,使 ChatGPT 能端到端完成预订、取消订阅、提交报销等需要身份验证的任务。

ChatGPT Work sign-in announcement

【OpenAI】Hugging Face 安全事件调查报告发布

OpenAI 公布 Hugging Face 安全事件的完整技术报告,重建了涉事 agent 活动时间线,解释了现有安全防线为何失效,并制定了防止复发的新标准——覆盖训练和评估基础设施全链路,而非仅部署阶段。

The Hugging Face incident and the road ahead

【Google DeepMind】Gemini Omni 1.1 Flash 发布,登顶 Text-to-Video Arena

Gemini Omni 1.1 Flash 是 Google 最新的多模态视频生成与编辑模型,支持场景扩展、起止帧指定、视频参考输入及 4K 上采样。该模型在 Text-to-Video Arena 排名第一(领先第三名 FLUX 3 Video 20 分),Image-to-Video Arena 排名第二。

Gemini Omni 1.1 Flash announcement

【Anthropic】Model Hardware Standard 研究预览启动

Anthropic 启动 Model Hardware Standard (MHS) 研究预览第一阶段,为 AI 代理安全操作科研设备和先进制造中的物理硬件制定新标准。

Model Hardware Standard research preview

重大 Benchmark 变化

SWE-bench Verified:Claude 4.5 Opus 排名互换

  • Claude 4.5 Opus medium (20251101) 从第 2 升至第 1,Claude 4.5 Opus 从第 1 降至第 2,两者分数均为 79.2,属同分排名微调。
  • GPT 5.2 Codex 从第 19 升至第 17(+2 位),GPT-5 从第 13 降至第 14,GPT 5.2 (high) 从第 18 降至第 19,分数均未变。

本期无排名变动≥5 或分数变动≥5% 的重大变化。以上为同分排名微调,未达报告阈值,仅作记录。

快速预览

  • OpenAI 宣布因 Cursor 被 SpaceX 收购而终止合作,Cursor 对 OpenAI 模型的直接访问将于 11 月 12 日结束
  • ChatGPT Work 云端浏览器新增网站登录能力,可代用户完成订票、续费等端到端任务
  • Google DeepMind 推出 Gemini Omni 1.1 Flash,登顶 Text-to-Video Arena 第一名
  • Anthropic 启动 Model Hardware Standard 研究预览,探索 AI 智能体安全操控物理设备
  • Claude Code 密集发布 v2.1.246–v2.1.251,新增 --restricted 模式与模型切换钩子

新闻

OpenAI

日期 标题 摘要
08-29 We're ending our partnership with Cursor following its acquisition by SpaceX OpenAI 提出在 11 月 12 日终止 Cursor 对其模型的直接访问,并承诺为受影响的开发者提供过渡支持
08-28 Our decision on Cursor following its acquisition by SpaceX 官方博客正式说明终止 Cursor 合同的决定及背景
08-28 Supporting Thailand's next generation of AI startups 与泰国 MHESI 合作推出为期八周的加速器,支持 10 家健康、教育和福祉领域初创公司
08-27 Better answers, broader thinking 超过 1,000 名学生的随机对照研究,考察 ChatGPT 与批判性思维训练对学业表现的影响
08-27 Expanding OpenAI's presence in Brazil 扩大在巴西的业务,深化与当地开发者、企业和社区的合作
08-27 Collective Cyberdefense open letter 联合 Anthropic、AWS、Google、Microsoft、Oracle 等 100+ 组织发起全球网络防御公开信
08-26 Learning never stops 新报告探讨学生和教师如何利用 ChatGPT 延续课堂之外的持续学习
08-26 Bringing ChatGPT for Teachers to more U.S. school districts ChatGPT for Teachers 扩展至 55 个美国学区,覆盖超 10 万名教职员工
08-26 The Hugging Face incident and the road ahead 发布 Hugging Face 安全事件技术调查报告,详述现有防护为何失败及防再发生措施
08-26 How loveholidays is making everyone a builder with Codex loveholidays 使用 OpenAI Codex 让各业务团队快速将想法转化为产品
08-26 ChatGPT Work can sign in to websites ChatGPT Work 云端浏览器新增安全登录能力,可代用户完成预订、续费、购物等端到端任务,模型本身不接触密码
08-25 ChatGPT Business Premium Seats 推出 $100/月 Premium 席位,面向中小企业和初创团队提供更强大的工具和工作流
08-25 The full stack behind abundant intelligence CFO Sarah Friar 阐述芯片、算力、模型和产品各层面的叠加进步如何以更低成本提供更强的智能
08-25 Jalapeño's first results show industry-leading speed and efficiency 自研推理芯片 Jalapeño 首批结果显示更高吞吐和更低延迟
08-25 Disrupting a new covert influence campaign from Russia 封禁源自俄罗斯的账户,其利用 AI 推广虚假以色列智库并赞扬俄罗斯、批评西方
08-25 Introducing the Admin plugin for ChatGPT Work and Codex 新管理插件可分析工作区使用情况、管理成员权限、调整限额及处理管理请求
08-24 Advancing price-performance with GPT-5.6 in Kiro GPT-5.6 在 Kiro 中可用,帮助开发者以更好的性价比规划、构建、审查和测试软件
08-29 GitHub plugin syncing for ChatGPT workspaces 管理员可从公开或私有仓库导入 Codex 或 Claude marketplace 并共享插件,工作区每日自动同步更新
08-28 Rosalind Workbench 面向科学研究的工作台,连接蛋白质结构、序列分析和测序管线等专业模型与工具
08-27 DevDay Exchange Seoul — apply by Sep 4 OpenAI DevDay Exchange 将于 10 月 22 日在首尔举办,报名 9 月 4 日截止
08-26 WebMCP support in ChatGPT desktop app ChatGPT 桌面应用内置浏览器和 ChatGPT Sites 新增 WebMCP 支持,兼容网站可被 ChatGPT/Codex 自动利用
08-25 WebMCP Challenge hackathon 联合 Chrome Dev、Cloudflare、Shopify、Vercel、Render、Netlify 举办 10 天黑客松,奖金 $35,000
08-19 Replit Free Mode powered by GPT-5.6 Luna Replit 推出免费模式,由 GPT-5.6 Luna 驱动,用户无需担心 token 成本即可构建软件
08-18 ChatGPT Ads expands across Europe ChatGPT 广告扩展至 31 个欧洲市场
08-18 Strengthening democratic oversight in national security 启动新计划,为政府机构提供工具、培训和专业知识以加强 AI 在国家安全领域的民主监督
08-18 ChatGPT for Teens 面向青少年的 ChatGPT 版本,内置更强防护和健康使用功能,并提供家长控制
08-18 Pacing model development in cyber-critical era 加强前沿模型的监控、对齐和安全防护,以此指导模型开发节奏
08-18 Asana cleared 5 years of engineering work in 2 weeks with Codex Asana 用 Codex 两周完成预计需五年的测试系统替换工作,花费约 $12K
08-18 NVIDIA scales expertise with ChatGPT Work NVIDIA 团队用 ChatGPT Work 减少手动任务并规模化工作流
08-17 The Defender's Window 探讨 AI 如何重塑网络安全攻防格局,以及 OpenAI 的防御措施
08-17 OpenAI joins PORTS-Pike project 加入 PORTS-Pike 项目,扩大社区投资并支持俄亥俄南部数千个工作岗位
08-17 New policy ideas for the Intelligence Age 资助 14 个独立项目探索 AI 政策新思路
08-20 Introducing Intelligence Age blog 新博客探讨变革性 AI 如何重塑权力、治理、经济和个人自由
08-19 Offering Zero Data Retention for frontier models 重申为符合条件的 API 客户提供零数据保留,并预告 Private Safety Processing
08-20 Stampli cuts launch hours by 68% Stampli 用 Codex 和 ChatGPT Work 将数周上线生产压缩至数天

Google DeepMind / Google

日期 标题 摘要
08-28 Gemini Omni 1.1 Flash rolling out 生成式视频模型新版本,支持更可控迭代和更高质量输出
08-27 Gemini Omni 1.1 Flash ranked #1 in Text-to-Video Arena 登顶 Text-to-Video Arena(1495 分,领先 #3 FLUX 3 Video +20 分),Image-to-Video Arena 排名 #2
08-27 3 new ways to plan and book travel in Search AI Mode in Search 推出三项旅行规划和预订功能
08-25 5 ways to upgrade your home decor with Google Search 搜索推出家居装饰相关功能
08-21 Games as AI research testbed — partnership with Fenris Creations 探索持续学习、深度记忆、长期规划和多智能体动态等开放挑战
08-22 Gemini 3.7 is fastest growing model launch to date Logan Kilpatrick 称 Gemini 3.7 是 Google 历史上增长最快的模型发布
08-18 New record for matrix multiplication omega 宣布矩阵乘法指数 ω 的新纪录
08-28 Co-Scientist extension for scientific discovery Gemini Co-Scientist 扩展至材料科学、生物学和计算机科学领域
08-19 5 new ways to level up learning with Search 搜索推出开学季学习工具
08-17 Gemini and Pixel football club partnerships Gemini 和 Pixel 与足球俱乐部合作

Anthropic / Claude

日期 标题 摘要
08-27 Model Hardware Standard research preview Anthropic 启动 MHS 研究预览,建立 AI 智能体安全操控物理设备的新标准,面向科研和先进制造
08-25 Claude memory now simpler and more powerful Claude 在 chat 和 Claude Cowork 之间统一记忆,用户可控制记忆内容
08-21 Claude Security scans on Claude Mythos 5 安全扫描功能运行在 Claude Mythos 5 上,向所有 Claude Enterprise 客户公开测试

Claude Code Releases

日期 版本 摘要
08-28 v2.1.251 新增 PreModelSwitch/PostModelSwitch 钩子事件;SessionStart resume 钩子接收会话过期度和重缓存成本
08-28 v2.1.250 Bug 修复和可靠性改进
08-27 v2.1.248 新增 --restricted 模式:移除运行命令/代码的内置工具和 WebFetch,文件工具限制在工作目录内
08-26 v2.1.247 新增 SendFeedback 工具,Claude 可起草反馈报告供用户审阅发送
08-25 v2.1.246 新增 Bash 通配符 allow 规则启动警告

社区 / 其他

日期 标题 摘要
08-30 ChatGPT 桌面端长对话加载提速 90%+ Brent Traut 优化桌面端长对话加载速度和内存占用均超 90%
08-28 swyx 谈 80% GDP 可被 agent 自动化 在 Navigators 播客中讨论阻碍 agent 采用的瓶颈不在模型本身
08-28 Simon Willison LLM cliché highlighter 达 38 个模式 更新 AI 文本套话检测工具
08-27 Sam Altman 呼吁重视 AI 网络防御 强调当前是网络防御关键时刻,呼吁集体紧急应对
08-26 Greg Brockman 称 AI 芯片设计被低估 评论 OpenAI 用小团队和 AI 改进循环做芯片设计
08-24 What my dad taught me about AI coding in the 90s HN 热帖(127 分),回顾 90 年代的 AI 编程经验

Benchmark 快照

行业格局

AA / Intelligence — 本期无变动

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 62.5
2 Grok 4.6 (medium) 59.0
3 GLM-5.3-Flash 57.5

LMArena / Overall — 本期无变动

排名 模型 分数
1 claude-fable-5 1507.48
2 claude-opus-4-6-high 1504.83
3 claude-opus-4-7-high 1502.13

干活选型

AA / Agentic — 本期无变动

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 58.4
2 GLM-5.3-Flash 58.2
3 Grok 4.6 (medium) 56.3

AA / Coding — 本期无变动

排名 模型 分数
1 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0
2 GPT-5.5 (xhigh) 74.9
3 Grok 4.6 (medium) 74.4

SWE-bench Pro / Public — 本期无变动

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified — 本期有变动

模型 变化 前排名 → 现排名 分数
Claude 4.5 Opus medium (20251101) 2 → 1 79.2
Claude 4.5 Opus 1 → 2 79.2
GPT 5.2 Codex 19 → 17 72.8
GPT 5.2 (high) 18 → 19 72.8
Claude 4 Sonnet + o4-mini 14 → 13 74.4
GPT-5 13 → 14 74.4
GPT 5.1 Codex (medium) 32 → 31 66.0
GPT 5.1 (medium) 31 → 32 66.0
GLM 5 (high) 17 → 18 72.8
Qwen3-Coder 480B/A35B Instruct 51 → 50 55.4
GLM 4.6 (T=1) 50 → 51 55.4

注:以上排名变化均为同分模型间的位次互换,分数本身未变。Top 5 当前完整排名为:Claude 4.5 Opus medium (20251101) 79.2、Claude 4.5 Opus 79.2、Doubao-Seed-Code 78.8、Gemini 3 Pro Preview 77.4、Claude 4 Sonnet 76.8。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 终止 Cursor 合作:Cursor 被 SpaceX 收购后,OpenAI 以明确时间表(11 月 12 日截止)切断模型直接访问,这意味着所有依赖 OpenAI 模型的 Cursor 用户必须在此前完成迁移——OpenAI 同时强调"准备好为开发者提供超出常规的过渡支持",实际上是在争夺这批高价值开发者留存到自家 Codex 生态。

  2. ChatGPT Work 云端浏览器登录功能:模型本身不接触用户凭据(通过安全登录表单"传送"凭据到网站字段),加上自动审查模型检查表单目标——这一设计直接解决了 agent 代登录的安全信任瓶颈,使 ChatGPT Work 从"信息助手"升级为可端到端完成预订、续费等实际任务的执行体。

  3. SWE-bench Verified Top 1 易主:Claude 4.5 Opus medium (20251101) 与 Claude 4.5 Opus 同为 79.2 分,但排名从 #2 升至 #1,说明在 scaffold (live-SWE-agent) 加持下 medium 配置的版本在评测稳定性或提交时间戳上取得了优先判定——同分模型间排名互换虽不影响绝对实力判断,但 Top 1 的标签对市场认知有实际影响。

来源 · 93 条