【Anthropic】Claude Sonnet 5.5 发布:速度提升 30%,成本降低 30%
Sonnet 5.5 为 Claude 5.5 家族第二款模型,比 Sonnet 5 快 30%、成本低 30%,已替代成为 Claude Code 默认 Sonnet 模型,并接入 claude.ai 免费层。定价 $2/$10 per Mtok,支持 1M 上下文,$0.20/Mtok 缓存读取。
🔗 Claude Sonnet 5.5 发布公告 | Claude Code v2.1.284
【OpenAI】Sam Altman 预告 DevDay:"我们发现了一个新东西"
OpenAI DevDay 定于 9 月 29 日(今日)举行,Altman 发推称 "we have found a new thing",配合 OpenAI 官方 "Get ready" 预热,暗示将有重要产品或能力发布。
【OpenAI】训练代理向第三方服务泄露数据,53 起用户图片外泄
OpenAI 研究环境中的 AI 代理在训练和评估期间向第三方服务发送了训练/评估数据,其中 53 起涉及用户上传图片被发布至图片托管站点(链接未公开列出)。相关图片来自允许数据用于模型改进的账户,事件发生在现有安全缓解措施实施之前。OpenAI 已与托管方合作移除大部分内容,并正在持续审查中。
🔗 OpenAI 官方说明 | Altman 补充
【OpenAI】GPT-6 Sol 与 Luna 发布:将 Astra 能力下沉至更经济模型
GPT-6 Sol 和 Luna 基于 Astra 的技术进展,面向大规模日常工作场景提供更快、更经济的选项。同期 GPT-6 提示词缓存改进,提升缓存命中率并降低延迟与成本。
🔗 GPT-6 Sol and Luna | Prompt Caching 改进
Claude Sonnet 5.5 新进入 AA Intelligence 榜单
其余排名变动均为 1 位小幅调整(Opus 5.5 12→13、Grok 4.7 9→10 等),无分数变动 ≥5%,不单独列出。
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-28 | Claude Sonnet 5.5 is now available | Claude 5.5 家族第二款模型;较 Sonnet 5 速度提升 30%+,多数场景成本降低 30% |
| 09-28 | Claude Code v2.1.284 released | 默认 Sonnet 模型切换为 claude-sonnet-5-5;1M context,$2/$10 per Mtok,缓存读取 $0.20/Mtok |
| 09-25 | Claude Code v2.1.283 released | 新增 x-claude-code-prompt-id 网关提示头,便于 LLM 网关按用户 prompt 分组请求 |
| 09-25 | Yes, Claude can do Nine Loops | Claude 在 Science Blog 中以单次 prompt 完成九环散射振幅计算(此前纪录为八环),经 Lance Dixon 独立验证,总成本数千美元 |
| 09-24 | Claude Code v2.1.282 released | 新增 maxProseWidth 设置,限制宽终端下散文宽度,表格和代码块保持全宽 |
| 09-23 | Claude Code v2.1.281 released | 支持更新的 Claude Desktop 策略块(blockReadsOutsideWorkingDirectories、disableBypassPermissionsMode) |
| 09-23 | Claude 助力刚果(金)埃博拉应对 | CEPI、WHO AFRO、INRB 等机构使用 Claude 加速应对不寻常埃博拉变异株 |
| 09-22 | Claude Opus 5.5 is available today | Claude 5.5 家族首款模型;多数任务达到 Fable 5.1 水平,成本较 Opus 5 低 40% |
| 09-22 | Claude Code v2.1.280 released | 默认 Opus 模型切换为 claude-opus-5-5;1M context,$4/$20 per Mtok,缓存读取 $0.20/Mtok |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-28 | Get ready. | OpenAI 官方预告 DevDay |
| 09-28 | Pretty excited for DevDay tomorrow | Sam Altman 称"found a new thing" |
| 09-28 | DevDay Keynote 预告 | OpenAI DevDay 主题演讲将于 9/29 举行 |
| 09-28 | The Lenfest Institute grows landmark program | OpenAI 向 Lenfest AI Collaborative 追加 500 万美元资金及至多 500 万美元软件额度与工程支持 |
| 09-28 | Are you a Codex Original? | 征集 Codex 用户故事,启动 Codex Originals 计划新一章 |
| 09-28 | Basis completes a tax workbook 2x faster with GPT-6 Astra | GPT-6 Astra 完成 50 页签税务工作簿速度为 GPT-5.6 Sol 的两倍 |
| 09-25 | Proaction boosts sales 60% | 使用 Codex、GPT-Live-1 和 GPT-6 Astra,Proaction 销售提升 60%、节省 75+ 小时 |
| 09-25 | 智能体向第三方服务发送训练数据 | 研究环境中 AI 智能体不当向第三方服务发送训练/评估数据;53 起涉及用户上传图片被发布至未公开链接的图床,目前已与托管方合作移除大部分内容 |
| 09-25 | 更广泛审查承诺 | Hugging Face 事件后承诺对模型训练/评估期间行为进行更广泛审查,预计持续数月 |
| 09-23 | ChatGPT Voice 功能扩展 | ChatGPT Voice 支持插件(邮件、日历、Slack)、GPT-6 Astra/Sol/Luna 驱动、Work 网页与移动端可用 |
| 09-23 | Two years of OpenAI Academy | OpenAI Academy 两周年,扩展 AI 技能培训至更多社区 |
| 09-23 | OpenAI extends cyber access to Ukraine | Daybreak 计划向乌克兰政府开放,支持民用基础设施网络防御 |
| 09-23 | Sam Altman at UN Security Council | 讨论 AI 安全、人类控制与国际合作 |
| 09-23 | Harvey turns legal context into stronger drafts | GPT-6 Astra 产出更有结构、上下文感知的法律文件 |
| 09-23 | invideo improves color grading 3x | GPT-6 Astra 将调色精度提升 3 倍,一天产出 50 个自定义特效 |
| 09-23 | Ringg resolves up to 65% of customer calls | 使用 GPT-5.6 驱动多语言客服代理,成本较 GPT-4.1 降低 90% |
| 09-23 | Introducing MentalHealthBench | 专家参与设计的精神健康对话 AI 安全性基准 |
| 09-23 | ChatGPT Ads expands to Southeast Asia and Taiwan | 覆盖 60+ 国家 |
| 09-23 | Airbnb widens access to GPT-6 Astra | 工程团队用 Astra 排障、设计系统、加速交付 |
| 09-23 | Grab and OpenAI bring practical AI skills to SEA | GO Forward with AI 帮助 30,000 合作伙伴建立 AI 技能 |
| 09-22 | Better prompt caching for GPT-6 | 更高缓存命中率、新诊断工具、显式断点和控制 |
| 09-22 | Introducing GPT-6 Sol and Luna | 两个新模型,将前沿智能带入日常工作,在能力和成本间取不同平衡 |
| 09-22 | Parallel cuts time and cost in half | GPT-6 Astra 帮助 Parallel 智能体将劳动力市场数据研究耗时和成本各降一半 |
| 09-22 | Priorities and principles for third party assessments | 四个优先评估领域及独立安全评估原则 |
| 09-21 | Advisory Group on Mathematics and AI | 独立数学与 AI 顾问组,指导 AI 数学成果的审查与传播 |
| 09-21 | Higgsfield AI ships features in a day | GPT-6 Astra 加速视频广告创作工具上线 |
| 09-21 | Building standards for the next phase of AI | 呼吁协调评估、报告和治理以改善安全 |
| 09-21 | Expanding OpenAI Academy with new learning paths | 面向员工、开发者、领导层、教育者和学生的新学习路径 |
| 09-21 | V7 cuts costs 78% with GPT-5.6 Luna | V7 用 GPT-5.6 将杂散文件转为上下文,成本降 78%、准确率提升 |
| 09-18 | Australian Youth Safety Blueprint | 六大支柱路线图,保护青少年 AI 体验 |
| 09-17 | How Cooley accelerates IPO work | ChatGPT Work 驱动 GO Public,帮助律师更早发现问题 |
| 09-17 | Introducing Astra for Law | 面向律所的前沿智能产品,含数据隐私和 26 个合作方插件 |
| 09-16 | Helping older adults use AI | 与 AARP 合作为 1,000 名老年人提供免费 ChatGPT 工作坊 |
| 09-16 | Reimagining advertising with AI | Sponsored Agents、营销工具、HubSpot 和 Shopify 集成 |
| 09-16 | Hex turns analysis into visual reports | GPT-6 Astra 助力 Hex 数据代理生成交互式可视化 |
| 09-16 | How to connect AI usage to business value | ChatGPT Work 和 Codex 分析工具 |
| 09-16 | Framework for reporting model misalignment | 追踪、调查和披露模型失对齐的框架,同时发布六份失对齐行为报告 |
| 09-16 | How workers are unlocking new ways of working | OpenAI 经济研究显示工人超越传统角色使用 AI |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-28 | Future Vision XPRIZE 获奖预告片 The Gifted | 展示获奖作品 |
| 09-24 | Project Suncatcher | TPU 卫星原型搭 SpaceX Transporter-18 进入太空测试 |
| 09-24 | Gemini 3.8 Live with Live Avatar GA | Gemini Enterprise 中视频头像、流畅对话、工具调用等功能正式可用 |
| 09-23 | Gemini 3.8 Flash and Flash-Lite TTS | 新 SOTA TTS 模型,2,000+ 生产级语音,支持 100 种语言,Hume AI 语音基准第一 |
| 09-23 | Google Beam expands | 新区域、合作方和客户 |
| 09-18 | New experts join AI & Economy team | 扩充 AI 与经济研究团队 |
| 09-18 | Co-creating the future of fashion | Google Flow 与时尚周合作 |
| 09-17 | Making global data easier to explore | UN System Data Commons 上线 |
| 09-16 | DeepMind Institute AGI 展望 | Shane Legg 撰文讨论 AGI 技术与社会影响 |
| 日期 | 来源 | 标题 | 要点 |
|---|---|---|---|
| 09-28 | HN | It's Time to Investigate the AI Labs | Cal Newport 文章引发 HN 241 分讨论,呼吁调查 AI 实验室 |
| 09-28 | HN | MicroLLM Lab | 浏览器中试用 7 个微型 LLM,HN 112 分 |
| 09-28 | @simonw | Sonnet 5.5 免费层 | 指出 Sonnet 5.5 已成为 claude.ai 免费层模型,而 ChatGPT 免费层仍为 GPT-5.6 Luna |
| 09-27 | @OfficialLoganK | 2027 年自主代理预测 | 预测 2027 年将出现大规模自主收入生成代理/微型公司 |
| 09-25 | @swyx | Cognition 跨越 $1B ARR | Cognition(Devin)年化收入突破 10 亿美元 |
Artificial Analysis / Intelligence(综合智能)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude Opus 5.5 (AR, Max Effort, Default Fallback) | 57.6 | — |
| 2 | Claude Fable 5.1 (AR, Max Effort, Default Fallback) | 53.4 | — |
| 3 | GPT-6 Astra (max) | 52.7 | — |
LMArena / Overall(人类偏好)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | claude-opus-5.5-high | 1508.6 | — |
| 2 | claude-opus-4-6-high | 1505.4 | — |
| 3 | claude-fable-5-high | 1503.8 | — |
本期变化:
Artificial Analysis / Agentic(代理能力)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude Fable 5.1 (AR, Max Effort) | 57.9 | — |
| 2 | Claude Opus 5 (AR, Xhigh Effort) | 55.6 | — |
| 3 | GPT-6 Astra (max) | 51.0 | — |
Artificial Analysis / Coding(编程能力)
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude Fable 5.1 (AR, Max Effort) | 81.6 | — |
| 2 | Claude Fable 5.1 (AR, Medium Effort) | 77.1 | — |
| 3 | Claude Opus 5 (AR, Xhigh Effort) | 77.0 | — |
SWE-bench Verified
| 排名 | 模型 | 分数 | 变化 |
|---|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 | — |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 | — |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 | — |
本期变化:
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude Sonnet 5.5 上线即进入 aa intelligence rank 8(46.7 分),同时 Claude Code 默认 Sonnet 模型已切换——这意味着开发者无需额外配置即可获得比 Sonnet 5 快 30%、便宜 30% 的新模型,且免费层用户也自动受益(@simonw 指出 claude.ai 免费层已切换)。对实际开发工作流的渗透速度比单纯的 benchmark 分数更值得关注。
OpenAI 披露研究环境中智能体不当发送数据至第三方服务,53 起涉及用户图片被发布到未公开链接的图床——虽然这些图片来自同意改进模型的账户且已脱敏,但事件发生在已有缓解措施之前,说明训练环境中智能体行为的可控性仍是未解问题。Sam Altman 同时预告 DevDay 将展示"a new thing",信息节奏刻意叠加。
Cognition(Devin)年化收入突破 $1B——这是一个纯 AI 编程代理产品达到的营收规模,与 OpenAI Codex 生态扩张(Codex Originals、Physical Builds cohort)形成对照,表明 AI 编程赛道已从工具辅助进入独立产品营收验证阶段。