【OpenAI】DevDay 2026:20+ 项公告集中发布
OpenAI 在 DevDay 2026 上发布了超过 20 项公告,涵盖 GPT-6 Astra、Codex 更新、新 API、安全工具及面向开发者的新能力。ChatGPT 平台开放原生应用插件生态,拥有 12 亿周活用户可被直接触达,tldraw、Figma、MagicPath 等已作为首批合作伙伴接入。开放模型(GLM-5.3 Flash、Kimi K3)也可在 Codex 中原生使用并计入企业 OpenAI 消费额度。
Introducing GPT-6.1 Sol · DevDay 2026 Recap
【OpenAI】GPT-6.1 Sol 上线:接近 Astra 智能,价格为 1/5
GPT-6.1 Sol 面向编码、计算机操作和专业工作场景,API 输入输出 token 价格为 Astra 标准价的五分之一,缓存读取折扣达 95%。在 AA Intelligence 基准中,GPT-6.1 Sol (xhigh) 以 51.0 分直接进入第 5 名,超越 Claude Opus 5 (Xhigh) 的 49.7 分和 Claude Fable 5.1 (Medium) 的 48.9 分,是同价位段中排名最高的新模型。
【Anthropic】Claude Sonnet 5.5 发布:速度提升 30%,成本降低 30%
Claude Sonnet 5.5 为 5.5 系列第二款模型,相较 Sonnet 5 在多数工作负载上运行速度提升超 30%,成本降低最多 30%,支持 1M 上下文,定价 $2/$10 per Mtok,缓存读取 $0.20/Mtok。已作为 Claude Code 默认 Sonnet 模型上线。
Claude Sonnet 5.5 is now available
【OpenAI】Dots 发布:7×24 小时主动式 AI 助手
Dots 是可跨复杂项目和日常任务持续工作的主动式 AI 助手,用户保持控制权的同时让工作推进。Sam Altman 称其为"重新夺回时间和注意力的新方式"。
AA Intelligence — GPT-6.1 Sol 新模型上榜
| 模型 | 变动类型 | 排名 | 分数 |
|---|---|---|---|
| GPT-6.1 Sol (xhigh) | 新进入 | #5 | 51.0 |
| GPT-6.1 Sol (high) | 新进入 | #6 | 50.2 |
GPT-6.1 Sol 两个变体首次进入 AA Intelligence 排行榜即占据第 5、6 位,直接将 Claude Opus 5 (Xhigh) 从第 5 推至第 7,Claude Fable 5.1 (Medium) 从第 6 推至第 8。这是本周唯一符合重大变动标准的 benchmark 事件(新模型进入 top 5 导致多模型排名下移)。
注:其余 benchmark(SWE-bench Verified 等)排名变动均 <5 位、分数变动均 <5%,未达报告阈值。
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-29 | Introducing GPT-6.1 Sol | 接近 Astra 的智能水平,API 价格为 Astra 的 1/5,面向编码、计算机使用和专业工作 |
| 09-29 | DevDay 2026 Recap | 超过 20 项公告,涵盖 GPT-6 Astra、ChatGPT、Codex、API、安全工具等 |
| 09-29 | Introducing dots | Dots 是可跨复杂项目和日常任务持续工作的主动式助手 |
| 09-29 | Codex Security Cloud 升级(X) | Daybreak Blue 网络安全模型默认接入,支持全仓库扫描、持续评审提交、自动去重并准备修复 |
| 09-29 | Ultrafast 模式(X/OpenAI Devs) | Astra Ultrafast 速度达 Astra Standard 的 8 倍、Astra Fast 的 4 倍 |
| 09-29 | ChatGPT 插件平台开放(X/OpenAI Devs) | 可在 ChatGPT 内构建带插件扩展的原生应用,覆盖 12 亿周活用户 |
| 09-29 | 开放模型接入 Codex(X/Tibo) | 企业客户可在 Codex 中原生使用 GLM-5.3 Flash、Kimi K3 等开放模型,消费计入 OpenAI 承诺额度 |
| 09-29 | tldraw 插件登陆 ChatGPT(X/OpenAI Devs) | 实时多人协作画布作为 ChatGPT 插件上线 |
| 09-29 | Figma Make 接入 GPT-6.1 Sol(X/OpenAI Devs) | GPT-6.1 Sol 已可用于 Figma Make |
| 09-29 | MagicPath 内嵌 ChatGPT(X/OpenAI Devs) | 与 OpenAI 合作,MagicPath 入驻 ChatGPT 侧边栏,可访问文件并打开画布 |
| 09-29 | Amp Plaid 速度运行 Astra 6 倍速(X/OpenAI Devs) | Plaid 模式下 GPT-6 Astra 运行速度提升 6 倍,可在已有会话中切换 |
| 09-29 | Factory 成为 OpenAI B2B Marketplace 首发合作方(X/OpenAI Devs) | 企业客户可将现有 OpenAI 承诺额度用于 Factory |
| 09-28 | Towards safety cases for frontier AI training | 前沿 AI 训练安全案例早期指南,涵盖技术保障、操作实践和失对齐调查 |
| 09-28 | How we will do better for Australia | 就澳大利亚政府网站事件道歉,公布更强保障措施 |
| 09-28 | Lenfest Institute 项目扩展 | 500 万美元资金 + 最高 500 万美元软件额度及工程支持 |
| 09-28 | Basis 用 GPT-6 Astra 完成税务工作簿,速度 2 倍于 GPT-5.6 Sol | 50 标签页税务工作簿,Astra 比 GPT-5.6 Sol 快一倍 |
| 09-25 | Hugging Face 事件后续披露(X) | 发现 53 例用户图片被上传至图床(非公开链接),源于允许数据改进模型的账户,已大部分移除 |
| 09-25 | 更广泛的模型行为审查(X) | 承诺对训练/评估期间模型行为进行全面审查,预计持续数月 |
| 09-23 | Sam Altman 在联合国安理会发言 | 讨论 AI 安全、人类控制和国际合作 |
| 09-23 | ChatGPT Ads 扩展至东南亚和台湾 | 覆盖 60+ 国家的新广告市场 |
| 09-23 | Airbnb 扩大 GPT-6 Astra 使用 | 工程团队用于修 Bug、系统设计和加速交付 |
| 09-23 | Introducing MentalHealthBench | 专家参与的心理健康对话评估基准 |
| 09-23 | Harvey 用 GPT-6 Astra 生成法律文书 | 更结构化、上下文感知的法律文档 |
| 09-23 | Ringg AI 代理解决 65% 客户来电 | 使用 GPT-5.6,成本比 GPT-4.1 低 90% |
| 09-23 | invideo 调色提升 3 倍 | GPT-6 Astra 帮助一天产出 50 个自定义特效 |
| 09-23 | OpenAI 扩展乌克兰网络防御访问 | Daybreak 项目向乌克兰政府开放 |
| 09-23 | Grab 与 OpenAI 在东南亚推广 AI 技能 | GO Forward 项目帮助 30,000 名合作伙伴 |
| 09-22 | Introducing GPT-6 Sol and Luna | 两个新模型,不同能力与成本平衡 |
| 09-22 | Better prompt caching for GPT-6 | 更高缓存命中率、新诊断工具、显式断点 |
| 09-22 | Parallel 用 Astra 研究时间/成本减半 | 劳动力市场数据研究合成效率翻倍 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-29 | Claude Code v2.1.285 | 新增 CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量,可关闭 WebFetch 工具 |
| 09-28 | Claude Sonnet 5.5 发布(X) | Claude 5.5 家族第二个模型,比 Sonnet 5 快 30%+、成本低 30%+,1M 上下文,$2/$10 per Mtok,缓存读取 $0.20/Mtok |
| 09-28 | Claude Code v2.1.284 | 新增 claude-sonnet-5-5,成为 Anthropic API 默认 Sonnet 模型 |
| 09-28 | Claude 可辅助构建评估并爬山优化(X/Boris) | 分享评估设计与 Claude Code 技能改进指南 |
| 09-26 | Claude 插件门户上线(X/Boris) | 新门户支持提交/追踪/查看用量,MCP 用量同比增长 110 倍 |
| 09-25 | Claude 完成 Nine Loops 计算(X) | 在 planar N=4 超杨-米尔斯模型中突破八循环记录达九循环,由 SLAC 的 Lance Dixon 独立验证,成本数千美元 |
| 09-25 | Claude Code v2.1.283 | 新增 x-claude-code-prompt-id 网关提示头,可通过 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 开启 |
| 09-24 | Claude Code v2.1.282 | 新增 maxProseWidth 设置,限制宽终端中文字宽度 |
| 09-23 | Claude Code v2.1.281 | 支持 Claude Desktop 新策略键,含 blockReadsOutsideWorkingDirectories 和 disableBypassPermissionsMode |
| 09-23 | Claude 助力刚果(金)埃博拉疫情响应(X) | CEPI、WHO AFRO、INRB 使用 Claude 加速应对变异株 |
| 09-22 | Claude Opus 5.5 发布(X) | Claude 5.5 家族首个模型,多数任务达 Fable 5.1 水平,成本比 Opus 5 低 40% |
| 09-18 | Anthropic 与 Accenture 合作独立评估(X) | 双方各投入至少 10 亿美元建设评估能力,为期五年 |
| 09-17 | 发布 AI 发展速度三项指标(X) | AI R&D 中 AI 贡献占比、代理监督程度、算力分配 |
| 09-17 | 生命科学验证计划开放申请(X) | 首次开放 Mythos 模型,配生物安全防护机制 |
| 09-17 | Claude Desktop Projects 功能上线(X/Mike Krieger) | 可启动多个并行任务并由协调 Claude 统一响应 |
| 09-16 | Claude Docs/Slides/Design 上线(X/Mike Krieger) | 全面对话可用,基于重构的 Artifacts 平台 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-28 | Future Vision XPRIZE 获奖作品 The Gifted | 展示获奖预告片 |
| 09-24 | Gemini 3.8 Live with Live Avatar GA(X/Google Cloud Tech) | 视频虚拟人、流畅对话、工具调用等能力在 Gemini Enterprise 正式可用 |
| 09-23 | Gemini 3.8 Flash 和 Flash-Lite TTS 发布(X/Logan) | 新 SOTA TTS 模型,2000+ 预置声音,支持 100 种语言,登顶 Hume AI 语音基准 |
| 09-23 | Google Beam 扩展新区域和合作伙伴 | 推广动画演示 |
| 09-18 | AI & Economy 研究团队新增专家 | — |
| 09-17 | 联合国系统数据共享平台上线 | 全球数据更易探索 |
| 09-16 | DeepMind Institute 成立(X/Shane Legg) | 25 年 AGI 研究积累,推动技术与社会层面深入理解 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 09-29 | GPT 6.1 Sol: Near-Astra intelligence for a fifth of the price | HN 766 分 |
| 09-29 | A Privacy Analysis of Web and Mobile Conversational AI Agents [pdf] | HN 407 分 |
| 09-29 | Simon Willison DevDay 2026 现场博客(X) | 实时更新 DevDay 主题演讲内容 |
AA / Intelligence — 有变动
| 变动类型 | 模型 | 变化 |
|---|---|---|
| 新模型 | GPT-6.1 Sol (xhigh) | 新入榜,排名第 5,分数 51.0 |
| 新模型 | GPT-6.1 Sol (high) | 新入榜,排名第 6,分数 50.2 |
| 排名下降 | Claude Fable 5.1 (Low Effort) | 7→9(分数不变 46.8) |
| 排名下降 | Claude Fable 5.1 (Medium Effort) | 6→8(分数不变 48.9) |
| 排名下降 | Claude Opus 5 (Xhigh) | 5→7(分数不变 49.7) |
| 排名下降 | Claude Opus 5.5 (Low Effort) | 13→15(分数不变 42.3) |
| 排名下降 | Claude Sonnet 5.5 (High Effort) | 8→10(分数不变 46.7) |
| 排名下降 | Grok 4.6 (medium) | 12→14(分数不变 42.8) |
| 排名下降 | Grok 4.7 (high) | 10→12(分数不变 46.3) |
| 排名下降 | MiMo-V2.6-Pro | 9→11(分数不变 46.3) |
| 排名下降 | Step 5 Preview | 11→13(分数不变 43.7) |
两个 GPT-6.1 Sol 变体作为新模型入榜,直接将 6 个已有模型各推低 2 位。新模型的入榜导致中下游排名整体下移,但所有已有模型分数均未变化。
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Adaptive Reasoning, Max Effort) | 57.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-6 Astra (max) | 52.7 |
LMArena / Overall — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-opus-5.5-high | 1508.55 |
| 2 | claude-opus-4-6-high | 1505.36 |
| 3 | claude-fable-5-high | 1503.82 |
AA / Agentic — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 57.9 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 55.6 |
| 3 | GPT-6 Astra (max) | 51.0 |
AA / Coding — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) | 77.1 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
SWE-bench Verified — 有变动
| 变动类型 | 模型 | 变化 |
|---|---|---|
| 排名上升 | Claude 4 Sonnet + o4-mini | 10→9(分数不变 74.4) |
| 排名下降 | GPT-5 | 9→10(分数不变 74.4) |
| 排名上升 | Claude 3.5 Haiku | 34→33(分数不变 40.6) |
| 排名下降 | LLama 3.1 70B Critic | 33→34(分数不变 40.6) |
仅尾部排名微调,分数均无变化。Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位。
当前 Top 3:
| 排名 | 模型 | 脚手架 | 分数 |
|---|---|---|---|
| 1 | Claude 4.5 Opus | Sonar Foundation Agent | 79.2 |
| 2 | Claude 4.5 Opus medium (20251101) | live-SWE-agent | 79.2 |
| 3 | Doubao-Seed-Code | TRAE | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-6.1 Sol 是 OpenAI 对"中端市场"的精准卡位。 该模型以 Astra 五分之一的 API 价格进入 AA Intelligence 榜单第 5 名(xhigh 51.0 分),与排名第 3 的 GPT-6 Astra (max)(52.7 分)仅差 1.7 分,但价格差距远大于能力差距。Sam Altman 在 X 上同步宣布 95% 缓存读取折扣,进一步压低实际使用成本。对于不需要 Astra 顶配能力的工作负载,Sol 的性价比优势显著。
OpenAI DevDay 的真正主线是"平台化"。 ChatGPT 开放原生插件应用构建(12 亿周活用户)、Codex 原生支持 GLM-5.3 Flash 和 Kimi K3 等开放模型、Factory 作为 B2B Marketplace 首发合作方——这三件事组合在一起意味着 OpenAI 正在从"模型供应商"转向"AI 应用平台",将第三方模型和第三方开发者都纳入自己的分发渠道和计费体系。
OpenAI 的 Hugging Face 事件后续审查值得持续跟踪。 53 例用户图片被上传至图床(虽为非公开链接),且 OpenAI 明确表示全面审查"预计持续数月"。这并非一次性的安全疏漏,而是一个正在进行的、范围尚未完全确定的数据外泄调查——在 DevDay 大规模发布产品新闻的同一天,这条安全披露的实际影响不应被淹没。