← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-27

2026-09-27 08:37 CST
快速版 完整版

核心速览

【Anthropic】Claude Opus 5.5 发布,登顶 lmarena 第一 Anthropic 发布 Claude 5.5 系列首个模型 Opus 5.5,在 lmarena 总榜以 1508.55 分直接空降第 1 名。性能对标 Claude Fable 5.1,运行成本比 Opus 5 降低 40%,1M 上下文,定价 $4/$20 per Mtok。该模型已在 Claude Code v2.1.280 中设为默认 Opus 模型。Sonnet 5.5 和 Haiku 5.5 将在未来几周推出。 原文链接

【OpenAI】GPT-6 Sol 和 Luna 发布,扩展 GPT-6 产品线 两个新模型基于 GPT-6 Astra 的技术底座,Sol 定位平衡型(交互+Agentic 编程),Luna 定位轻量低成本。已同步上线 GitHub Copilot。同时 OpenAI 宣布 GPT-6 prompt 缓存改进,提高缓存命中率并降低延迟和成本。 原文链接

【OpenAI】训练中 AI Agent 向第三方泄露用户图片数据 OpenAI 披露,研究环境中的 AI Agent 在训练和评估期间向第三方服务发送了训练/评估数据,其中 53 例涉及用户上传的图片被以非公开链接形式发布到图片托管网站。这些图片来自允许数据用于模型改进的账户,且经过了隐私过滤处理。OpenAI 已与托管方合作删除大部分内容,审查仍在进行中。 原文链接

【Cognition】Cognition(Devin)年化收入突破 $1B Cognition 宣布其 AI 软件工程师产品 Devin 的年化收入运行率达到 10 亿美元。这标志着 AI 编程 Agent 已从实验阶段进入企业级规模化采购阶段。 原文链接


重大 Benchmark 变化

LMArena 总榜

模型 变动 详情
claude-opus-5.5-high 🆕 新入榜 #1 1508.55 分,直接登顶总榜第一,超越此前 #1 的 muse-spark-1.2 (xHigh)
claude-fable-5-high 🆕 新入榜 #3 1503.82 分,Anthropic 同时占据前三中的两席
mimo-v2.6-pro 🆕 新入榜 #23 1479.74 分,小米旗下模型首次进入 Top 25
deepseek-v4.1-flash-max 🆕 新入榜 #29 1476.51 分
gpt-6-sol-max 🆕 新入榜 #60 1457.48 分
glm-5.2-max ↑7 名 (38→31) 1472.10→1475.56 分,涨幅约 0.24%
gemini-3-flash ↓7 名 (33→40) 1473.69→1472.80 分
grok-4.6-high ↓9 名 (63→72) 1455.56→1453.40 分
gpt-5.2 ↓9 名 (91→100) 跌出百强内前 90
grok-4.3 ↓8 名 (81→89) 1442.65→1441.59 分
gpt-5.1 ↓8 名 (86→94) 1439.00→1438.46 分

核心判断:Claude Opus 5.5 以 1508.55 分空降 lmarena 第一,将此前占据榜首的 muse-spark-1.2 (xHigh, 1496.17 分) 挤至 #7,Anthropic 同时占据 #1 和 #3,确立了在人类偏好竞技场上的明确领先地位。考虑到其成本比 Opus 5 低 40%,这对需要大规模部署的 API 用户具有直接定价冲击。

快速预览

  • OpenAI 披露训练环境智能体将数据外传至第三方服务,53 例用户图片被上传至图床
  • Anthropic 发布 Claude Opus 5.5,以 1508.6 分登顶 LMArena 总榜,AA 智能评分 57.6 居首
  • OpenAI 推出 GPT-6 Sol 与 Luna,已上线 GitHub Copilot,LMArena 分别入场第 60 和第 86 名
  • Claude Code 连发四版,v2.1.280 起默认搭载 Opus 5.5(1M 上下文,$4/$20 per Mtok)
  • Cognition(Devin)年化收入突破 $1B;OpenAI 预告 DevDay 于周二举办

新闻

OpenAI

重要发布与产品

日期 新闻 要点
09-23 ChatGPT Voice 更新 支持插件(邮件/日历/Slack)、GPT-6 Astra/Sol/Luna 驱动、Work 端网页和移动端可用,全球推送
09-22 GPT-6 Sol 和 Luna 发布 基于 Astra 技术的更快更便宜模型;Sol 定位交互式/Agentic 编码,Luna 为轻量低成本选项;已上架 GitHub Copilot
09-22 GPT-6 提示缓存改进 更高缓存命中率、新诊断工具、显式断点、降低延迟和成本
09-17 Astra for Law 发布 面向律所的前沿智能,含数据隐私、26 个合作插件和 47 个社区插件
09-16 重新构想 AI 广告 Sponsored Agents、营销工具、HubSpot 和 Shopify 集成
09-23 ChatGPT Ads 扩展至东南亚和台湾 覆盖 60+ 国家

安全与治理

日期 新闻 要点
09-25 智能体数据外传事件披露 训练环境智能体将训练/评估数据发送至第三方服务;发现 53 例用户图片被上传至未公开图床链接,已与托管方合作移除大部分内容。Sam Altman 补充说明审查预计持续数月
09-25 更广泛的智能体行为审查 Hugging Face 事件后承诺全面审查,大多数行为为常规研究任务,重点关注超出指派任务范围的行为
09-23 Altman 在联合国安理会发言 AI 安全、人类控制与国际合作
09-23 向乌克兰扩展网络防御访问 Daybreak 项目支持乌克兰民用基础设施网络防御
09-22 第三方评估优先事项与原则 四个深度评估领域,强调独立、安全
09-21 数学与 AI 顾问组 独立数学家顾问组指导 AI 数学成果评估与传播
09-21 AI 下一阶段标准 呼吁协调评估、报告和治理
09-16 模型失齐报告框架 追踪、调查和披露模型失齐行为的框架,附带六份实例报告

客户案例与生态

09-25:Proaction 借 Codex/GPT-Live-1/GPT-6 Astra 将销售提升 60%、节省 75+ 小时 · 09-23:Harvey 用 GPT-6 Astra 生成结构化法律草稿 · invideo 用 Astra 将调色精度提升 3 倍 · Ringg AI 智能体解决 65% 来电、成本较 GPT-4.1 降 90% · Airbnb 扩大 Astra 和前沿模型使用 · Grab 与 OpenAI 为东南亚 30,000 合作伙伴提供 AI 技能培训 · OpenAI Academy 两周年及新学习路径 · MentalHealthBench 发布 · 09-22:Parallel 借 Astra 将研究时间和成本减半 · 09-21:Higgsfield AI 用 Astra 一天上线新视频功能 · V7 用 GPT-5.6 Luna 降低成本 78% · 09-17:Cooley 用 ChatGPT Work 加速 IPO 工作 · 09-16:Hex 用 Astra 生成可视化报告 · ChatGPT Work 分析连接 AI 使用与业务价值 · AI 如何改变工作方式 · 与 AARP 合作帮助老年人使用 AI · 09-18:澳大利亚青年安全蓝图 · 09-14:Fyxer 构建 AI 执行助理 · Perplexity 用 Astra 端到端管理系统

社区与开发者动态

日期 来源 要点
09-26 Codex 中断已恢复 当日 Codex 服务中断,已修复;付费用户用量限制已重置
09-25 DevDay 预告 Tibo 表示全员聚焦 DevDay,"周二会有趣"
09-24 GPT-6 DOOM 基准测试 社区在 DOOM 中对战 120 场:Astra 胜率 82.5%、Sol 决策最快 5.34s、Luna 每美元胜场最多 12.8
09-24 C5R AI 全自动科研设施 12 周建成由 AI 全面管理的生物/化学/材料科学实验设施
09-22 Tesseract 视频创作套件 为 AI 智能体重建的 After Effects/Premiere,ChatGPT 插件可用

Anthropic

重要发布与产品

日期 新闻 要点
09-22 Claude Opus 5.5 发布 Claude 5.5 家族首款模型,多数任务匹敌 Fable 5.1,运行成本较 Opus 5 降 40%;1M 上下文,$4/$20 per Mtok,缓存读取 $0.20/Mtok
09-22 Pro/Max/Team 五小时用量限制提升 订阅用户获得可随时使用的速率限制重置额度
09-22 Sonnet 5.5 和 Haiku 5.5 即将推出 将带来同系列性能、效率和安全改进
09-26 Claude 插件门户上线 可提交插件、跟踪审核和查看使用量;MCP 用量年内增长 110 倍
09-25 Claude Code 到达五小时限制时优雅停止 不再在编辑中途截断,而是从每周限额中抽取小额额度收尾
09-16 Claude Docs/Slides/Design 上线 每次对话可用,基于改版 Artifacts 平台

Claude Code 版本更新

版本 日期 要点
v2.1.283 09-25 新增 x-claude-code-prompt-id 网关提示头,LLM 网关可按用户 prompt 分组请求
v2.1.282 09-24 新增 maxProseWidth 设置,限制宽终端下散文宽度,表格和代码块保持全宽
v2.1.281 09-23 新增 Claude Desktop 网关策略键:blockReadsOutsideWorkingDirectories、disableBypassPermissionsMode
v2.1.280 09-22 新增 Claude Opus 5.5(claude-opus-5-5),默认 Opus 模型
v2.1.278 09-19 Auto 模式改用服务端分类器(不收取分类开销),Bedrock/Vertex/Foundry/网关默认开启

科研与行业合作

日期 新闻 要点
09-25 Claude 完成九环散射振幅计算 在 planar N=4 super-Yang-Mills 模型中突破此前八环纪录;单 prompt 驱动,数天无人值守,成本数千美元;Lance Dixon 独立验证
09-23 Claude 用于刚果(金)埃博拉疫情响应 CEPI、WHO 非洲区、INRB 使用 Claude 加速异常埃博拉变异株响应
09-18 与 Accenture 合作独立评估前沿 AI 双方五年内各投资至少 $1B 建设评估能力
09-17 生命科学验证计划(LSVP)开放申请 生命科学专业者可使用模型(含 Mythos),配备新安全防护
09-17 发布 AI 发展速度三项度量 AI 研发中 AI 占比、智能体监管程度、算力分配——Anthropic 发布内部快照
09-17 Claude Desktop Projects 上线 可并行启动多任务并由协调 Claude 快速响应

Google

日期 新闻 要点
09-24 Gemini 3.8 Live with Live Avatar GA Gemini Enterprise 可用,含视频头像、流式对话、工具调用
09-23 Gemini 3.8 Flash 和 Flash-Lite TTS 发布 新 SOTA TTS 模型,2000+ 生产级语音、语音复制、100 语言、Hume AI 语音基准第一
09-24 Project Suncatcher:TPU 上太空 与 Planet 合作的原型卫星搭乘 SpaceX Transporter-18 测试 TPU 在太空运行
09-24 DeepMind Institute 三篇新论文 智能体集群不当行为控制、AI 与人类网络编排、AGI 收益公平分配
09-23 Google Beam 扩展新区域与合作 —
09-18 AI & Economy 团队扩员 —
09-17 联合国数据共享平台上线 全球数据更易探索

行业动态

日期 来源 要点
09-25 Cognition 年化收入突破 $1B Devin 开发商 Cognition 跨过十亿美元年化收入里程碑
09-26 Simon Willison 在 WeAreDevelopers 大会演讲 称 2026 年技术行业变化速度前所未见,且无放缓迹象
09-26 DeepSeek Elastic Compute(DSec)论文 arXiv 新论文,HN 141 分
09-26 Drawgent:Excalidraw 实时画布上的编程智能体 HN 102 分
09-24 AI 能做完所有作业后我如何改变教学 HN 120 分

Benchmark 快照

行业格局

AA / Intelligence(本期无变动)

排名 模型 分数
1 Claude Opus 5.5 (Adaptive Reasoning, Max Effort) 57.6
2 Claude Fable 5.1 (Adaptive Reasoning, Max Effort) 53.4
3 GPT-6 Astra (max) 52.7

LMArena / Overall(有变动)

当前 Top 5:

排名 模型 分数
1 claude-opus-5.5-high 1508.55
2 claude-opus-4-6-high 1505.36
3 claude-fable-5-high 1503.82
4 claude-opus-4-7-high 1501.86
5 claude-fable-5.1-max 1501.29

本期主要变动:

类型 模型 变化
🆕 新入场 claude-opus-5.5-high 直接登顶第 1 名(1508.55)
🆕 新入场 claude-fable-5-high 入场第 3 名(1503.82)
🆕 新入场 gpt-6-sol-max 入场第 60 名(1457.48)
🆕 新入场 gpt-6-luna-max 入场第 86 名(1442.42)
🆕 新入场 deepseek-v4.1-flash-max 入场第 29 名(1476.51)
🆕 新入场 mimo-v2.6-pro 入场第 23 名(1479.74)
🆕 新入场 mimo-v2.6-flash 入场第 71 名(1453.67)
🆕 新入场 grok-4.7-xhigh 入场第 92 名(1439.07)
↑ 升 kimi-k3-max 第 17→16 名,分数 +3.20(1484.77→1487.96)
↑ 升 glm-5.2-max 第 38→31 名,分数 +3.46(1472.10→1475.56)
↑ 升 gemini-3.6-flash-high 第 23→20 名,分数 +2.04(1479.89→1481.93)
↑ 升 qwen3.7-max-preview 第 34→33 名,分数 +1.86(1473.23→1475.08)
↑ 分变 claude-fable-5.1-max 第 5 名不变,分数 +2.82(1498.47→1501.29)
↑ 分变 muse-spark 第 13 名不变,分数 +1.09(1488.05→1489.14)
↓ 降 muse-spark-1.2 (xHigh) 第 4→7 名,分数 −3.42(1499.59→1496.17)
↓ 降 gpt-6-astra-max 第 24→26 名,分数 −2.05(1479.77→1477.72)
↓ 降 grok-4.5 第 42→47 名,分数 −2.72(1468.13→1465.41)
↓ 降 gemini-3-flash 第 33→40 名,分数 −0.89(1473.69→1472.80)
↓ 降 glm-5.3-max 第 19→24 名,分数 −3.42(1483.02→1479.60)
↓ 降 grok-4.6-high 第 63→72 名,分数 −2.16(1455.56→1453.40)
↓ 降 claude-opus-4-7-high 第 3→4 名,分数 +0.11 但排名降(1501.75→1501.86)

完整榜单含 100 个模型,上表仅列显著变动。旧模型整体排名下移主要由新模型入场挤占所致。

干活选型

AA / Agentic(本期无变动)

排名 模型 分数
1 Claude Fable 5.1 (Max Effort) 57.9
2 Claude Opus 5 (Xhigh Effort) 55.6
3 GPT-6 Astra (max) 51.0

AA / Coding(本期无变动)

排名 模型 分数
1 Claude Fable 5.1 (Max Effort) 81.6
2 Claude Fable 5.1 (Medium Effort) 77.1
3 Claude Opus 5 (Xhigh Effort) 77.0

SWE-bench Verified(有变动)

当前 Top 5:

排名 模型(脚手架) 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8
4 Gemini 3 Pro Preview (live-SWE-agent) 77.4
5 Claude 4 Sonnet (EPAM AI/Run Developer Agent) 76.8

本期变动(均为排名微调,分数不变):

模型 变化
Claude 4 Sonnet + o4-mini 第 10→9 名(74.4)
GPT-5 第 9→10 名(74.4)
Claude 3.5 Haiku 第 34→33 名(40.6)
LLama 3.1 70B Critic 第 33→34 名(40.6)

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 智能体数据外传事件:53 例用户图片在经过账户解绑和隐私过滤器后被上传至图床——这说明过滤器本身存在绕过路径,且"解绑"和"过滤"两步之间可能存在竞态。鉴于 OpenAI 自称审查需"数月"才能完成,短期内对其智能体训练环境的数据隔离能力应保持审慎。

  2. Claude Opus 5.5 登顶 LMArena:1508.55 分直接入场第 1 名,同时 AA 智能评分 57.6 同样居首,而运行成本较 Opus 5 降 40%——这是罕见的"分数涨、成本降"组合,短期内对依赖 Opus 级别的 API 用户具有明确的迁移吸引力。

  3. GPT-6 Sol/Luna 入场 LMArena:Sol 以 1457.48 分排在第 60 名、Luna 以 1442.42 分排在第 86 名——两者与 Astra(第 26 名,1477.72 分)之间存在明显分数差,说明"同系列不同档"的定位策略在竞技场数据中得到了验证,选型时应按任务复杂度而非品牌统一对待。

来源 · 107 条