← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-30

2026-09-30 08:55 CST
快速版 完整版

核心速览

【OpenAI】DevDay 2026:20+ 项公告集中发布

OpenAI 在 DevDay 2026 上发布了超过 20 项公告,涵盖 GPT-6 Astra、Codex 更新、新 API、安全工具及面向开发者的新能力。ChatGPT 平台开放原生应用插件生态,拥有 12 亿周活用户可被直接触达,tldraw、Figma、MagicPath 等已作为首批合作伙伴接入。开放模型(GLM-5.3 Flash、Kimi K3)也可在 Codex 中原生使用并计入企业 OpenAI 消费额度。

Introducing GPT-6.1 Sol · DevDay 2026 Recap

【OpenAI】GPT-6.1 Sol 上线:接近 Astra 智能,价格为 1/5

GPT-6.1 Sol 面向编码、计算机操作和专业工作场景,API 输入输出 token 价格为 Astra 标准价的五分之一,缓存读取折扣达 95%。在 AA Intelligence 基准中,GPT-6.1 Sol (xhigh) 以 51.0 分直接进入第 5 名,超越 Claude Opus 5 (Xhigh) 的 49.7 分和 Claude Fable 5.1 (Medium) 的 48.9 分,是同价位段中排名最高的新模型。

Introducing GPT-6.1 Sol

【Anthropic】Claude Sonnet 5.5 发布:速度提升 30%,成本降低 30%

Claude Sonnet 5.5 为 5.5 系列第二款模型,相较 Sonnet 5 在多数工作负载上运行速度提升超 30%,成本降低最多 30%,支持 1M 上下文,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。已作为 Claude Code 默认 Sonnet 模型上线。

Claude Sonnet 5.5 is now available

【OpenAI】Dots 发布:7×24 小时主动式 AI 助手

Dots 是可跨复杂项目和日常任务持续工作的主动式 AI 助手,用户保持控制权的同时让工作推进。Sam Altman 称其为"重新夺回时间和注意力的新方式"。

Introducing dots


重大 Benchmark 变化

AA Intelligence — GPT-6.1 Sol 新模型上榜

模型 变动类型 排名 分数
GPT-6.1 Sol (xhigh) 新进入 #5 51.0
GPT-6.1 Sol (high) 新进入 #6 50.2

GPT-6.1 Sol 两个变体首次进入 AA Intelligence 排行榜即占据第 5、6 位,直接将 Claude Opus 5 (Xhigh) 从第 5 推至第 7,Claude Fable 5.1 (Medium) 从第 6 推至第 8。这是本周唯一符合重大变动标准的 benchmark 事件(新模型进入 top 5 导致多模型排名下移)。

注:其余 benchmark(SWE-bench Verified 等)排名变动均 <5 位、分数变动均 <5%,未达报告阈值。

快速预览

  • OpenAI DevDay 2026 发布 20+ 项公告:GPT-6.1 Sol、Dots 常驻代理、ChatGPT 插件平台开放、Ultrafast 8 倍加速
  • GPT-6.1 Sol 以 Astra 五分之一的价格进入 AA 智能榜单第 5 名(51.0 分),性价比定位明确
  • Anthropic 发布 Claude Sonnet 5.5:比 Sonnet 5 快 30%、成本低 30%,1M 上下文,已作为 Claude Code 默认模型
  • OpenAI 公开 Hugging Face 事件后续审查:发现 53 例用户图片被上传至图床,已大部分移除
  • SWE-bench Verified 榜单微调:Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位

新闻

OpenAI(按日期倒序)

日期 新闻 要点
09-29 Introducing GPT-6.1 Sol 接近 Astra 的智能水平,API 价格为 Astra 的 1/5,面向编码、计算机使用和专业工作
09-29 DevDay 2026 Recap 超过 20 项公告,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全工具等
09-29 Introducing dots Dots 是可跨复杂项目和日常任务持续工作的主动式助手
09-29 Codex Security Cloud 升级(X) Daybreak Blue 网络安全模型默认接入,支持全仓库扫描、持续评审提交、自动去重并准备修复
09-29 Ultrafast 模式(X/OpenAI Devs) Astra Ultrafast 速度达 Astra Standard 的 8 倍、Astra Fast 的 4 倍
09-29 ChatGPT 插件平台开放(X/OpenAI Devs) 可在 ChatGPT 内构建带插件扩展的原生应用,覆盖 12 亿周活用户
09-29 开放模型接入 Codex(X/Tibo) 企业客户可在 Codex 中原生使用 GLM-5.3 Flash、Kimi K3 等开放模型,消费计入 OpenAI 承诺额度
09-29 tldraw 插件登陆 ChatGPT(X/OpenAI Devs) 实时多人协作画布作为 ChatGPT 插件上线
09-29 Figma Make 接入 GPT-6.1 Sol(X/OpenAI Devs) GPT-6.1 Sol 已可用于 Figma Make
09-29 MagicPath 内嵌 ChatGPT(X/OpenAI Devs) 与 OpenAI 合作,MagicPath 入驻 ChatGPT 侧边栏,可访问文件并打开画布
09-29 Amp Plaid 速度运行 Astra 6 倍速(X/OpenAI Devs) Plaid 模式下 GPT-6 Astra 运行速度提升 6 倍,可在已有会话中切换
09-29 Factory 成为 OpenAI B2B Marketplace 首发合作方(X/OpenAI Devs) 企业客户可将现有 OpenAI 承诺额度用于 Factory
09-28 Towards safety cases for frontier AI training 前沿 AI 训练安全案例早期指南,涵盖技术保障、操作实践和失对齐调查
09-28 How we will do better for Australia 就澳大利亚政府网站事件道歉,公布更强保障措施
09-28 Lenfest Institute 项目扩展 500 万美元资金 + 最高 500 万美元软件额度及工程支持
09-28 Basis 用 GPT-6 Astra 完成税务工作簿,速度 2 倍于 GPT-5.6 Sol 50 标签页税务工作簿,Astra 比 GPT-5.6 Sol 快一倍
09-25 Hugging Face 事件后续披露(X) 发现 53 例用户图片被上传至图床(非公开链接),源于允许数据改进模型的账户,已大部分移除
09-25 更广泛的模型行为审查(X) 承诺对训练/评估期间模型行为进行全面审查,预计持续数月
09-23 Sam Altman 在联合国安理会发言 讨论 AI 安全、人类控制和国际合作
09-23 ChatGPT Ads 扩展至东南亚和台湾 覆盖 60+ 国家的新广告市场
09-23 Airbnb 扩大 GPT-6 Astra 使用 工程团队用于修 Bug、系统设计和加速交付
09-23 Introducing MentalHealthBench 专家参与的心理健康对话评估基准
09-23 Harvey 用 GPT-6 Astra 生成法律文书 更结构化、上下文感知的法律文档
09-23 Ringg AI 代理解决 65% 客户来电 使用 GPT-5.6,成本比 GPT-4.1 低 90%
09-23 invideo 调色提升 3 倍 GPT-6 Astra 帮助一天产出 50 个自定义特效
09-23 OpenAI 扩展乌克兰网络防御访问 Daybreak 项目向乌克兰政府开放
09-23 Grab 与 OpenAI 在东南亚推广 AI 技能 GO Forward 项目帮助 30,000 名合作伙伴
09-22 Introducing GPT-6 Sol and Luna 两个新模型,不同能力与成本平衡
09-22 Better prompt caching for GPT-6 更高缓存命中率、新诊断工具、显式断点
09-22 Parallel 用 Astra 研究时间/成本减半 劳动力市场数据研究合成效率翻倍

Anthropic / Claude(按日期倒序)

日期 新闻 要点
09-29 Claude Code v2.1.285 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量,可关闭 WebFetch 工具
09-28 Claude Sonnet 5.5 发布(X) Claude 5.5 家族第二个模型,比 Sonnet 5 快 30%+、成本低 30%+,1M 上下文,$2/$10 per Mtok,缓存读取 $0.20/Mtok
09-28 Claude Code v2.1.284 新增 claude-sonnet-5-5,成为 Anthropic API 默认 Sonnet 模型
09-28 Claude 可辅助构建评估并爬山优化(X/Boris) 分享评估设计与 Claude Code 技能改进指南
09-26 Claude 插件门户上线(X/Boris) 新门户支持提交/追踪/查看用量,MCP 用量同比增长 110 倍
09-25 Claude 完成 Nine Loops 计算(X) 在 planar N=4 超杨-米尔斯模型中突破八循环记录达九循环,由 SLAC 的 Lance Dixon 独立验证,成本数千美元
09-25 Claude Code v2.1.283 新增 x-claude-code-prompt-id 网关提示头,可通过 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 开启
09-24 Claude Code v2.1.282 新增 maxProseWidth 设置,限制宽终端中文字宽度
09-23 Claude Code v2.1.281 支持 Claude Desktop 新策略键,含 blockReadsOutsideWorkingDirectories 和 disableBypassPermissionsMode
09-23 Claude 助力刚果(金)埃博拉疫情响应(X) CEPI、WHO AFRO、INRB 使用 Claude 加速应对变异株
09-22 Claude Opus 5.5 发布(X) Claude 5.5 家族首个模型,多数任务达 Fable 5.1 水平,成本比 Opus 5 低 40%
09-18 Anthropic 与 Accenture 合作独立评估(X) 双方各投入至少 10 亿美元建设评估能力,为期五年
09-17 发布 AI 发展速度三项指标(X) AI R&D 中 AI 贡献占比、代理监督程度、算力分配
09-17 生命科学验证计划开放申请(X) 首次开放 Mythos 模型,配生物安全防护机制
09-17 Claude Desktop Projects 功能上线(X/Mike Krieger) 可启动多个并行任务并由协调 Claude 统一响应
09-16 Claude Docs/Slides/Design 上线(X/Mike Krieger) 全面对话可用,基于重构的 Artifacts 平台

Google(按日期倒序)

日期 新闻 要点
09-28 Future Vision XPRIZE 获奖作品 The Gifted 展示获奖预告片
09-24 Gemini 3.8 Live with Live Avatar GA(X/Google Cloud Tech) 视频虚拟人、流畅对话、工具调用等能力在 Gemini Enterprise 正式可用
09-23 Gemini 3.8 Flash 和 Flash-Lite TTS 发布(X/Logan) 新 SOTA TTS 模型,2000+ 预置声音,支持 100 种语言,登顶 Hume AI 语音基准
09-23 Google Beam 扩展新区域和合作伙伴 推广动画演示
09-18 AI & Economy 研究团队新增专家 —
09-17 联合国系统数据共享平台上线 全球数据更易探索
09-16 DeepMind Institute 成立(X/Shane Legg) 25 年 AGI 研究积累,推动技术与社会层面深入理解

社区与 HN 热榜

日期 新闻 要点
09-29 GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price HN 766 分
09-29 A Privacy Analysis of Web and Mobile Conversational AI Agents [pdf] HN 407 分
09-29 Simon Willison DevDay 2026 现场博客(X) 实时更新 DevDay 主题演讲内容

Benchmark 快照

行业格局

AA / Intelligence — 有变动

变动类型 模型 变化
新模型 GPT-6.1 Sol (xhigh) 新入榜,排名第 5,分数 51.0
新模型 GPT-6.1 Sol (high) 新入榜,排名第 6,分数 50.2
排名下降 Claude Fable 5.1 (Low Effort) 7→9(分数不变 46.8)
排名下降 Claude Fable 5.1 (Medium Effort) 6→8(分数不变 48.9)
排名下降 Claude Opus 5 (Xhigh) 5→7(分数不变 49.7)
排名下降 Claude Opus 5.5 (Low Effort) 13→15(分数不变 42.3)
排名下降 Claude Sonnet 5.5 (High Effort) 8→10(分数不变 46.7)
排名下降 Grok 4.6 (medium) 12→14(分数不变 42.8)
排名下降 Grok 4.7 (high) 10→12(分数不变 46.3)
排名下降 MiMo-V2.6-Pro 9→11(分数不变 46.3)
排名下降 Step 5 Preview 11→13(分数不变 43.7)

两个 GPT-6.1 Sol 变体作为新模型入榜,直接将 6 个已有模型各推低 2 位。新模型的入榜导致中下游排名整体下移,但所有已有模型分数均未变化。

当前 Top 3:

排名 模型 分数
1 Claude Opus 5.5 (Adaptive Reasoning, Max Effort) 57.6
2 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-6 Astra (max) 52.7

LMArena / Overall — 本期无变动

当前 Top 3:

排名 模型 分数
1 claude-opus-5.5-high 1508.55
2 claude-opus-4-6-high 1505.36
3 claude-fable-5-high 1503.82

干活选型

AA / Agentic — 本期无变动

当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 57.9
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 55.6
3 GPT-6 Astra (max) 51.0

AA / Coding — 本期无变动

当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 81.6
2 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) 77.1
3 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0

SWE-bench Verified — 有变动

变动类型 模型 变化
排名上升 Claude 4 Sonnet + o4-mini 10→9(分数不变 74.4)
排名下降 GPT-5 9→10(分数不变 74.4)
排名上升 Claude 3.5 Haiku 34→33(分数不变 40.6)
排名下降 LLama 3.1 70B Critic 33→34(分数不变 40.6)

仅尾部排名微调,分数均无变化。Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位。

当前 Top 3:

排名 模型 脚手架 分数
1 Claude 4.5 Opus Sonar Foundation Agent 79.2
2 Claude 4.5 Opus medium (20251101) live-SWE-agent 79.2
3 Doubao-Seed-Code TRAE 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. GPT-6.1 Sol 是 OpenAI 对"中端市场"的精准卡位。 该模型以 Astra 五分之一的 API 价格进入 AA Intelligence 榜单第 5 名(xhigh 51.0 分),与排名第 3 的 GPT-6 Astra (max)(52.7 分)仅差 1.7 分,但价格差距远大于能力差距。Sam Altman 在 X 上同步宣布 95% 缓存读取折扣,进一步压低实际使用成本。对于不需要 Astra 顶配能力的工作负载,Sol 的性价比优势显著。

  2. OpenAI DevDay 的真正主线是"平台化"。 ChatGPT 开放原生插件应用构建(12 亿周活用户)、Codex 原生支持 GLM-5.3 Flash 和 Kimi K3 等开放模型、Factory 作为 B2B Marketplace 首发合作方——这三件事组合在一起意味着 OpenAI 正在从"模型供应商"转向"AI 应用平台",将第三方模型和第三方开发者都纳入自己的分发渠道和计费体系。

  3. OpenAI 的 Hugging Face 事件后续审查值得持续跟踪。 53 例用户图片被上传至图床(虽为非公开链接),且 OpenAI 明确表示全面审查"预计持续数月"。这并非一次性的安全疏漏,而是一个正在进行的、范围尚未完全确定的数据外泄调查——在 DevDay 大规模发布产品新闻的同一天,这条安全披露的实际影响不应被淹没。

来源 · 109 条