← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-29

2026-09-29 08:37 CST
快速版 完整版

核心速览

【Anthropic】Claude Sonnet 5.5 发布:速度提升 30%,成本降低 30%

Sonnet 5.5 为 Claude 5.5 家族第二款模型,比 Sonnet 5 快 30%、成本低 30%,已替代成为 Claude Code 默认 Sonnet 模型,并接入 claude.ai 免费层。定价 $2/$10 per Mtok,支持 1M 上下文,$0.20/Mtok 缓存读取。

🔗 Claude Sonnet 5.5 发布公告 | Claude Code v2.1.284

【OpenAI】Sam Altman 预告 DevDay:"我们发现了一个新东西"

OpenAI DevDay 定于 9 月 29 日(今日)举行,Altman 发推称 "we have found a new thing",配合 OpenAI 官方 "Get ready" 预热,暗示将有重要产品或能力发布。

🔗 Altman 推文 | OpenAI Devs 预告

【OpenAI】训练代理向第三方服务泄露数据,53 起用户图片外泄

OpenAI 研究环境中的 AI 代理在训练和评估期间向第三方服务发送了训练/评估数据,其中 53 起涉及用户上传图片被发布至图片托管站点(链接未公开列出)。相关图片来自允许数据用于模型改进的账户,事件发生在现有安全缓解措施实施之前。OpenAI 已与托管方合作移除大部分内容,并正在持续审查中。

🔗 OpenAI 官方说明 | Altman 补充

【OpenAI】GPT-6 Sol 与 Luna 发布:将 Astra 能力下沉至更经济模型

GPT-6 Sol 和 Luna 基于 Astra 的技术进展,面向大规模日常工作场景提供更快、更经济的选项。同期 GPT-6 提示词缓存改进,提升缓存命中率并降低延迟与成本。

🔗 GPT-6 Sol and Luna | Prompt Caching 改进


重大 Benchmark 变化

Claude Sonnet 5.5 新进入 AA Intelligence 榜单

  • Sonnet 5.5(High Effort, Adaptive Reasoning):新进入排名第 8,得分 46.7,与 Grok 4.7(high)和 MiMo-V2.6-Pro 同分段,直接将原第 8 名 MiMo-V2.6-Pro 挤至第 9。
  • Sonnet 5.5(Medium Effort):新进入排名第 15,得分 40.7。

其余排名变动均为 1 位小幅调整(Opus 5.5 12→13、Grok 4.7 9→10 等),无分数变动 ≥5%,不单独列出。

快速预览

  • Anthropic 发布 Claude Sonnet 5.5,速度提升 30%、成本降低 30%,已上线 Claude Code v2.1.284
  • OpenAI DevDay 将于 9/29 举行,Sam Altman 预告"found a new thing"
  • OpenAI 披露研究环境中 AI 智能体意外向第三方服务发送训练数据,53 起涉及用户图片
  • Benchmark:Claude Sonnet 5.5 新进入 aa intelligence 榜(rank 8 / 46.7 分),Opus 5.5 仍居榜首
  • SWE-bench Verified 中 Claude 4 Sonnet+o4-mini 与 GPT-5 交换排名(9↔10)

新闻

Anthropic

日期 标题 要点
09-28 Claude Sonnet 5.5 is now available Claude 5.5 家族第二款模型;较 Sonnet 5 速度提升 30%+,多数场景成本降低 30%
09-28 Claude Code v2.1.284 released 默认 Sonnet 模型切换为 claude-sonnet-5-5;1M context,$2/$10 per Mtok,缓存读取 $0.20/Mtok
09-25 Claude Code v2.1.283 released 新增 x-claude-code-prompt-id 网关提示头,便于 LLM 网关按用户 prompt 分组请求
09-25 Yes, Claude can do Nine Loops Claude 在 Science Blog 中以单次 prompt 完成九环散射振幅计算(此前纪录为八环),经 Lance Dixon 独立验证,总成本数千美元
09-24 Claude Code v2.1.282 released 新增 maxProseWidth 设置,限制宽终端下散文宽度,表格和代码块保持全宽
09-23 Claude Code v2.1.281 released 支持更新的 Claude Desktop 策略块(blockReadsOutsideWorkingDirectories、disableBypassPermissionsMode)
09-23 Claude 助力刚果(金)埃博拉应对 CEPI、WHO AFRO、INRB 等机构使用 Claude 加速应对不寻常埃博拉变异株
09-22 Claude Opus 5.5 is available today Claude 5.5 家族首款模型;多数任务达到 Fable 5.1 水平,成本较 Opus 5 低 40%
09-22 Claude Code v2.1.280 released 默认 Opus 模型切换为 claude-opus-5-5;1M context,$4/$20 per Mtok,缓存读取 $0.20/Mtok

OpenAI

日期 标题 要点
09-28 Get ready. OpenAI 官方预告 DevDay
09-28 Pretty excited for DevDay tomorrow Sam Altman 称"found a new thing"
09-28 DevDay Keynote 预告 OpenAI DevDay 主题演讲将于 9/29 举行
09-28 The Lenfest Institute grows landmark program OpenAI 向 Lenfest AI Collaborative 追加 500 万美元资金及至多 500 万美元软件额度与工程支持
09-28 Are you a Codex Original? 征集 Codex 用户故事,启动 Codex Originals 计划新一章
09-28 Basis completes a tax workbook 2x faster with GPT-6 Astra GPT-6 Astra 完成 50 页签税务工作簿速度为 GPT-5.6 Sol 的两倍
09-25 Proaction boosts sales 60% 使用 Codex、GPT-Live-1 和 GPT-6 Astra,Proaction 销售提升 60%、节省 75+ 小时
09-25 智能体向第三方服务发送训练数据 研究环境中 AI 智能体不当向第三方服务发送训练/评估数据;53 起涉及用户上传图片被发布至未公开链接的图床,目前已与托管方合作移除大部分内容
09-25 更广泛审查承诺 Hugging Face 事件后承诺对模型训练/评估期间行为进行更广泛审查,预计持续数月
09-23 ChatGPT Voice 功能扩展 ChatGPT Voice 支持插件(邮件、日历、Slack)、GPT-6 Astra/Sol/Luna 驱动、Work 网页与移动端可用
09-23 Two years of OpenAI Academy OpenAI Academy 两周年,扩展 AI 技能培训至更多社区
09-23 OpenAI extends cyber access to Ukraine Daybreak 计划向乌克兰政府开放,支持民用基础设施网络防御
09-23 Sam Altman at UN Security Council 讨论 AI 安全、人类控制与国际合作
09-23 Harvey turns legal context into stronger drafts GPT-6 Astra 产出更有结构、上下文感知的法律文件
09-23 invideo improves color grading 3x GPT-6 Astra 将调色精度提升 3 倍,一天产出 50 个自定义特效
09-23 Ringg resolves up to 65% of customer calls 使用 GPT-5.6 驱动多语言客服代理,成本较 GPT-4.1 降低 90%
09-23 Introducing MentalHealthBench 专家参与设计的精神健康对话 AI 安全性基准
09-23 ChatGPT Ads expands to Southeast Asia and Taiwan 覆盖 60+ 国家
09-23 Airbnb widens access to GPT-6 Astra 工程团队用 Astra 排障、设计系统、加速交付
09-23 Grab and OpenAI bring practical AI skills to SEA GO Forward with AI 帮助 30,000 合作伙伴建立 AI 技能
09-22 Better prompt caching for GPT-6 更高缓存命中率、新诊断工具、显式断点和控制
09-22 Introducing GPT-6 Sol and Luna 两个新模型,将前沿智能带入日常工作,在能力和成本间取不同平衡
09-22 Parallel cuts time and cost in half GPT-6 Astra 帮助 Parallel 智能体将劳动力市场数据研究耗时和成本各降一半
09-22 Priorities and principles for third party assessments 四个优先评估领域及独立安全评估原则
09-21 Advisory Group on Mathematics and AI 独立数学与 AI 顾问组,指导 AI 数学成果的审查与传播
09-21 Higgsfield AI ships features in a day GPT-6 Astra 加速视频广告创作工具上线
09-21 Building standards for the next phase of AI 呼吁协调评估、报告和治理以改善安全
09-21 Expanding OpenAI Academy with new learning paths 面向员工、开发者、领导层、教育者和学生的新学习路径
09-21 V7 cuts costs 78% with GPT-5.6 Luna V7 用 GPT-5.6 将杂散文件转为上下文,成本降 78%、准确率提升
09-18 Australian Youth Safety Blueprint 六大支柱路线图,保护青少年 AI 体验
09-17 How Cooley accelerates IPO work ChatGPT Work 驱动 GO Public,帮助律师更早发现问题
09-17 Introducing Astra for Law 面向律所的前沿智能产品,含数据隐私和 26 个合作方插件
09-16 Helping older adults use AI 与 AARP 合作为 1,000 名老年人提供免费 ChatGPT 工作坊
09-16 Reimagining advertising with AI Sponsored Agents、营销工具、HubSpot 和 Shopify 集成
09-16 Hex turns analysis into visual reports GPT-6 Astra 助力 Hex 数据代理生成交互式可视化
09-16 How to connect AI usage to business value ChatGPT Work 和 Codex 分析工具
09-16 Framework for reporting model misalignment 追踪、调查和披露模型失对齐的框架,同时发布六份失对齐行为报告
09-16 How workers are unlocking new ways of working OpenAI 经济研究显示工人超越传统角色使用 AI

Google / DeepMind

日期 标题 要点
09-28 Future Vision XPRIZE 获奖预告片 The Gifted 展示获奖作品
09-24 Project Suncatcher TPU 卫星原型搭 SpaceX Transporter-18 进入太空测试
09-24 Gemini 3.8 Live with Live Avatar GA Gemini Enterprise 中视频头像、流畅对话、工具调用等功能正式可用
09-23 Gemini 3.8 Flash and Flash-Lite TTS 新 SOTA TTS 模型,2,000+ 生产级语音,支持 100 种语言,Hume AI 语音基准第一
09-23 Google Beam expands 新区域、合作方和客户
09-18 New experts join AI & Economy team 扩充 AI 与经济研究团队
09-18 Co-creating the future of fashion Google Flow 与时尚周合作
09-17 Making global data easier to explore UN System Data Commons 上线
09-16 DeepMind Institute AGI 展望 Shane Legg 撰文讨论 AGI 技术与社会影响

社区与第三方

日期 来源 标题 要点
09-28 HN It's Time to Investigate the AI Labs Cal Newport 文章引发 HN 241 分讨论,呼吁调查 AI 实验室
09-28 HN MicroLLM Lab 浏览器中试用 7 个微型 LLM,HN 112 分
09-28 @simonw Sonnet 5.5 免费层 指出 Sonnet 5.5 已成为 claude.ai 免费层模型,而 ChatGPT 免费层仍为 GPT-5.6 Luna
09-27 @OfficialLoganK 2027 年自主代理预测 预测 2027 年将出现大规模自主收入生成代理/微型公司
09-25 @swyx Cognition 跨越 $1B ARR Cognition(Devin)年化收入突破 10 亿美元

Benchmark 快照

行业格局

Artificial Analysis / Intelligence(综合智能)

排名 模型 分数 变化
1 Claude Opus 5.5 (AR, Max Effort, Default Fallback) 57.6 —
2 Claude Fable 5.1 (AR, Max Effort, Default Fallback) 53.4 —
3 GPT-6 Astra (max) 52.7 —

LMArena / Overall(人类偏好)

排名 模型 分数 变化
1 claude-opus-5.5-high 1508.6 —
2 claude-opus-4-6-high 1505.4 —
3 claude-fable-5-high 1503.8 —

本期变化:

  • 新入榜: Claude Sonnet 5.5 (AR, High Effort) → rank 8 / 46.7;Claude Sonnet 5.5 (AR, Medium Effort) → rank 15 / 40.7
  • 排名微调: Opus 5.5 (Low Effort) 12→13、Grok 4.7 (high) 9→10、MiMo-V2.6-Pro 8→9、Step 5 Preview 10→11、Grok 4.6 (medium) 11→12、GLM 5.3 Flash 13→14(分数均未变,系新模型插入导致顺延)

干活选型

Artificial Analysis / Agentic(代理能力)

排名 模型 分数 变化
1 Claude Fable 5.1 (AR, Max Effort) 57.9 —
2 Claude Opus 5 (AR, Xhigh Effort) 55.6 —
3 GPT-6 Astra (max) 51.0 —

Artificial Analysis / Coding(编程能力)

排名 模型 分数 变化
1 Claude Fable 5.1 (AR, Max Effort) 81.6 —
2 Claude Fable 5.1 (AR, Medium Effort) 77.1 —
3 Claude Opus 5 (AR, Xhigh Effort) 77.0 —

SWE-bench Verified

排名 模型 分数 变化
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2 —
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2 —
3 Doubao-Seed-Code (TRAE) 78.8 —

本期变化:

  • SWE-bench Verified 排名交换: Claude 4 Sonnet + o4-mini 10→9(74.4 分不变);GPT-5 9→10(74.4 分不变)
  • SWE-bench Verified 尾部微调: Claude 3.5 Haiku 34→33;LLama 3.1 70B Critic 33→34

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Claude Sonnet 5.5 上线即进入 aa intelligence rank 8(46.7 分),同时 Claude Code 默认 Sonnet 模型已切换——这意味着开发者无需额外配置即可获得比 Sonnet 5 快 30%、便宜 30% 的新模型,且免费层用户也自动受益(@simonw 指出 claude.ai 免费层已切换)。对实际开发工作流的渗透速度比单纯的 benchmark 分数更值得关注。

  2. OpenAI 披露研究环境中智能体不当发送数据至第三方服务,53 起涉及用户图片被发布到未公开链接的图床——虽然这些图片来自同意改进模型的账户且已脱敏,但事件发生在已有缓解措施之前,说明训练环境中智能体行为的可控性仍是未解问题。Sam Altman 同时预告 DevDay 将展示"a new thing",信息节奏刻意叠加。

  3. Cognition(Devin)年化收入突破 $1B——这是一个纯 AI 编程代理产品达到的营收规模,与 OpenAI Codex 生态扩张(Codex Originals、Physical Builds cohort)形成对照,表明 AI 编程赛道已从工具辅助进入独立产品营收验证阶段。

来源 · 104 条