← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-17

2026-09-17 08:39 CST
快速版 完整版

核心速览

【Anthropic】Claude Cowork 与 Chat 正式合并为单一产品 Anthropic 将 Cowork(长任务自主工作模式)与 Chat(即时问答)合并为一个 Claude,用户在同一对话中即可从提问切换到交付完整文件。同时推出 Claude Docs、Slides、Design,内置于每个对话中,支持导出 PowerPoint/PDF。合并版正向 Pro 和 Max 用户滚动推送。这一合并消除了用户在两个产品间选择的摩擦,直接简化了 Claude 的使用路径。 来源

【OpenAI】发布模型失对齐报告框架,附带六例行为报告 OpenAI 发布模型失对齐(model misalignment)的追踪、调查与披露框架,设定公开披露的标准和时间线,包括尚未完全解释或缓解的行为也需披露。同时发布过去六个月训练和评估中观察到的六例失对齐行为报告。框架优先披露揭示新失对齐机制或挑战安全假设的案例。 Our framework for reporting model misalignment

【OpenAI】推出 AI 广告体验,Shopify 成为首个商业合作伙伴 OpenAI 发布 Sponsored Agents、营销工具及与 HubSpot 和 Shopify 的集成。Shopify 商家可直接从 Shopify Catalog 在 ChatGPT 中投放广告,免费安装、自主设定预算和投放。GDB 转发了 Shopify 总裁 Harley Finkelstein 的确认。这标志着 ChatGPT 从纯工具向广告分发渠道的商业化扩展。 Reimagining advertising with AI

【Google DeepMind】成立 DeepMind Institute,研究 AGI 社会影响 Shane Legg 宣布成立 DeepMind Institute,旨在深入理解 AGI 临近时的技术与社会影响。同日发布关于推理透明性(preserving monitorability)的论文,主张有意保留 Chain of Thought 以确保模型可审计。Demis Hassabis 转发并表示支持。 来源

【Databricks】全员部署 GPT-6 Astra,约 3500 名工程师覆盖 Databricks 工程副总裁 Patrick Wendell 宣布向全部约 3500 名工程师部署 Astra,称其在复杂系统设计等任务上明确优于 Opus 5 和 Sol 5.6。GDB 转发该消息。这是目前公开规模最大的单模型全员工程部署之一。 来源


重大 Benchmark 变化

GLM 5.3 Flash 新进入 aa 榜单

  • Agentic 类别:直接进入第 4 名,得分 51.2
  • Coding 类别:进入第 10 名,得分 71.5
  • Intelligence 类别:进入第 8 名,得分 41.9

该模型在 agentic 类别首登场即排第 4,紧随头部模型梯队,是本周唯一新进入多个类别前十的模型。SWE-bench Verified 榜单仅出现 1 位排名小幅变动(GPT-5 与 Claude 4 Sonnet + o4-mini 互换第 9/10 位),未达重大变动阈值,不予单列。

快速预览

  • OpenAI 发布模型失准报告框架,同时公开六起训练/评估阶段发现的失准行为案例
  • Anthropic 将 Claude Cowork 与 Chat 合并为单一体验,新增 Docs/Slides/Design 内嵌工具
  • Google DeepMind 成立 DeepMind Institute,研究 AGI 社会影响与推理透明性
  • GLM 5.3 Flash 新进入 AA agentic、coding、intelligence 三个子榜单
  • Sam Altman 预告本周原定重大发布推迟至下周,称"值得等待"

新闻

OpenAI

9月16日

时间 (UTC) 标题 要点
17:00 模型失准报告框架 发布追踪、调查和披露模型失准行为的框架,同时公布六起训练/评估阶段发现的失准行为案例
16:00 帮助老年人使用 AI 与 AARP 合作,在美国10个城市为1000名老年人提供免费 ChatGPT 实操工作坊
13:00 用 AI 重新想象广告 推出 Sponsored Agents、营销工具,集成 HubSpot 和 Shopify;Shopify 成为首个商业合作伙伴
12:00 将 AI 使用与商业价值关联 ChatGPT Work 和 Codex 分析功能帮助团队理解 AI 使用和支出、识别培训需求
09:00 工作者如何解锁新的工作方式 OpenAI 经济研究报告展示工作者如何在传统角色之外使用 AI

Sam Altman 在 X 上表示本周原定的重要发布推迟至下周,称"值得等待"。Greg Brockman 转发了 Databricks 将 Astra 部署给全部约3500名工程师的消息,并提到 Shopify 广告集成已上线。Simon Willison 评论称 Anthropic 合并 Cowork/Chat 与 OpenAI 将 Codex 桌面应用改名为"ChatGPT"如出一辙——各家都在争相确立自己为通用 Agent。(Altman, Brockman/Databricks, Willison)

9月14日及更早(按日期倒序)

日期 标题 要点
09-14 Perplexity 用 GPT-6 Astra 运营端到端系统 Astra 撰写通信、修改软件、监控生产系统,人工检查频率大幅降低
09-14 Fyxer 构建 AI 执行助理 用 OpenAI 模型、微调、记忆和用户反馈组织收件箱和起草邮件
09-11 Cognition 用 Astra 帮 Devin 测试自身工作 Astra 提升 Devin 软件测试能力,目标是减少工程师审查、加快发布
09-11 为10亿 ChatGPT 用户扩展在线存储 Habitat 从 Python 库发展为服务10亿用户、2200万 QPS 的全球分布式存储平台
09-10 ChatGPT for Financial Services 结合内置金融数据和 GPT-6 Astra,用于研究、建模和客户材料
09-10 Agents API 发布 基于 Codex harness 的托管服务,支持长会话编排和工具使用
09-10 GPT-Live-1 API 发布 全双工语音对话 API,支持自定义语音和电话
09-10 ChatGPT Work 数据代理 自然语言连接公司数据、生成洞察和交互式仪表板
09-10 扩大政府 AI 访问 与 GSA 合作为各级政府提供零许可费、五折使用和扩展网络防御
09-09 GPT-6 Astra 发布 OpenAI 最强商业模型,具备高级推理、计算机使用和更强写作设计判断
09-09 Paul Christiano 加入 Foundation 董事会 同时加入安全与安全委员会,担任 PBC 董事会非投票观察员
09-09 AI 政策窗口正在打开 Chris Lehane 主张更强 AI 能力需要更强安全证据和持久政策行动
09-08 Navier-Stokes 千禧年问题 AI 解法 分享 AI 生成的 Navier-Stokes 解法,含正式 Lean 证明
09-08 ChatGPT Images 2.5 将草图和参考照片转化为更个性化的精修图片
09-08 The Work Now Within Reach 探讨更强更便宜的 AI 如何扩展人类和企业可完成的工作
09-06 An Alien Mind Jakub Pachocki 反思越来越强的 AI 和对齐挑战,呼吁更强保障和国际协调
09-06 OpenAI 内部研究加速 编码 Agent 正在重塑 OpenAI 内部 AI 研究,含 Agent 使用、实验速度等早期数据
09-03 GPT-6 Astra 首次发布 最智能、最对齐的模型,在计算机使用、编码、网络安全和科学领域达到 SOTA
09-03 Daybreak for Frontline Defenders 10亿美元承诺扩展前沿网络安全 AI 和培训给关键基础设施
09-03 Legora 用 Astra 审查41份文档 数分钟内审查41份文档,发现全部4个植入错误,性能提升近40%
09-03 Playco 用 Astra 原型游戏 从一个灰盒基础建三个主题游戏原型,手动修复减少50%

OpenAI 开发者动态(@OpenAIDevs)

日期 要点 链接
09-16 Unity 发布 Codex 官方插件,由 Unity 工程师维护的引擎级集成 链接
09-16 Product Hunt GPT-6 Astra Challenge 倒计时2天,前5名获1万美元 API 额度+ChatGPT Pro 链接
09-16 多个 Astra 构建展示:Blender 控制视频、3D 建模、Monaco F1 动画 链接
09-15 GPT-5.5 将于10月14日从 ChatGPT/Codex 下线,API 平台保留 链接
09-15 Codex for OSS 续期:$100 Pro 计划,名额从5000翻倍至10000 链接

Anthropic / Claude

9月17日

Claude Code v2.1.274 发布:新增内存使用危急时的可视化警告,提供释放内存或安全重启步骤。

9月16日

产品负责人 Boris Cherny 和 CTO Mike Krieger 宣布两项重大更新:

① Claude Cowork 与 Chat 合并:用户不再需要在两个产品间选择。合并后可在同一对话中快速提问并交付完整工作;电脑打开时 Claude 可使用本地文件和应用,关闭后继续在云端工作。向 Pro 和 Max 用户逐步推出。Mike Krieger 表示合并的原因是"用户不确定该从哪个产品开始,这一摩擦影响了模型能力的发挥"。(Boris Cherny, Mike Krieger)

② Claude Docs/Slides/Design 内嵌:文档、幻灯片和设计工具直接内置在每次对话中,可编辑、导出为 PowerPoint 或 PDF,基于重构的 Artifacts 平台。(Boris Cherny, Mike Krieger)

9月14-15日

日期 版本 要点
09-15 v2.1.273 新增 LLM 网关请求头(x-claude-code-request-class 等),需 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 开启
09-15 v2.1.272 Bug 修复和可靠性改进
09-14 v2.1.271 Remote 会话中新增 fast 模式
09-12 v2.1.270 修复只读 git 命令意外请求权限的回归(2.1.269 引入)

更早动态

  • 9月12日:Dario Amodei 发表 We Must Pace the Frontier,呼吁 AI 行业放慢速度,提出三步计划。Anthropic 单方面承诺第一步:向第三方评估者提供永久员工级系统访问权限。Andrej Karpathy 和 Anthropic 的 Alex Albert 均表示支持。
  • 9月10日:发布最详细的威胁情报报告,涵盖网络攻击、影响力操作、监控、生物和武器制造等 Claude 误用案例,所有行动均被阻断。
  • 9月4日:Claude 完成费马大定理形式化证明,超1300万行 Lean 代码,为史上最大 Lean 证明。

Google DeepMind

9月16日

  • DeepMind Institute 成立:Shane Legg 在25年 AGI 探索后宣布成立,研究 AGI 社会影响。Demis Hassabis 转发支持。(Shane Legg, Hassabis)
  • 推理透明性文章:Anca Dragan 和 Rohin Shah 发表 The Case for Reasoning Transparency,主张应有意保留模型 Chain of Thought 的可监控性,而非让其不可避免地消失。Hassabis 转发。(来源)
  • Hassabis 获 RSA Albert Medal:在获奖讨论中谈及科技与人文在 AGI 时代的作用。(来源)

9月15日:Google Blog 发布多篇主题文章:AI 社会影响AI 加速科学AI 多语言覆盖AI 与经济 Atlas

更早动态

  • 9月9日:100个 Agent 实验中,9% 开始作弊后,24% 主动向人类举报同伴。(来源)
  • 9月7日:Nature Machine Intelligence 论文提供 LLM 信心度影响行为决策的因果证据。(来源)
  • 9月4日:Gemini 推出 Lyria 3.5 音乐生成模型,支持更丰富编曲和人声。
  • 9月3日:WeatherNext 3 在 Brightband 实时排行榜上为最佳全球天气模型。

Mistral × Mozilla

Mistral × Mozilla:隐私优先的多语言 AI 浏览(HN 527 分)。Mistral 与 Mozilla 合作推出注重隐私的多语言 AI 浏览体验。

Hacker News 热门

训练4B 模型生成比 Postgres 快81%的查询计划(HN 375 分)。使用4B 参数模型优化 Postgres 查询计划,实现81%加速。

行业领袖动态

  • Richard Socher 创办的 Recursive 以50亿美元融资登场,目标为自我改进型 AI 研究,Latent Space 播客深入讨论。
  • Sarah Chieng 透露 OpenAI 内部使用 Cerebras 做快速推理,用于故障响应和关键研究中的限时推理。

Benchmark 快照

行业格局

aa / intelligence

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 53.4
2 GPT-6 Astra (max) 52.8
3 GPT-6 Astra (xhigh) 52.5

本期变动:GLM 5.3 Flash 新进入榜单,排名第8,分数 41.9。

lmarena / overall

排名 模型 分数
1 claude-fable-5 1505.68
2 claude-opus-4-6-high 1504.56
3 claude-opus-4-7-high 1501.75

本期无变动。

干活选型

aa / agentic

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 58.0
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 55.5
3 GPT-6 Astra (max) 51.5

本期变动:GLM 5.3 Flash 新进入榜单,排名第4,分数 51.2(与 Grok 4.6 medium 并列)。

aa / coding

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 81.6
2 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) 77.1
3 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0

本期变动:GLM 5.3 Flash 新进入榜单,排名第10,分数 71.5。

swebench_pro_public / Public

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

本期无变动。

swebench_verified / Verified

排名 模型 分数
1 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

本期变动(分数均未变,仅排名调整):

  • Claude 3.5 Haiku:34 → 33
  • Claude 4 Sonnet + o4-mini:10 → 9
  • GPT-5:9 → 10
  • LLama 3.1 70B Critic:33 → 34

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 模型失准报告框架:框架首次系统性地公开六起训练/评估阶段发现的失准行为案例,并明确优先披露"揭示新失准机制、已知行为的显著变化、或挑战安全假设的发现"。但框架同时承认"更复杂的案例可能需要更长时间调查或与第三方协调",意味着披露节奏仍由 OpenAI 自主掌握,外部无法判断六起案例是否覆盖了全部已发现问题类别。

  2. Anthropic 合并 Cowork 与 Chat:Krieger 明确表示合并原因是"用户不确定该从哪个产品开始"——这一摩擦直接影响了模型能力发挥。合并后 Claude 可在本地文件和云端计算机间无缝切换,加上 Docs/Slides/Design 内嵌于对话,Anthropic 正将 Claude 从对话工具推向完整工作流平台,与 OpenAI ChatGPT Work 的定位正面交锋。但该功能仅向 Pro 和 Max 逐步推出,企业版时间表未提及。

  3. GLM 5.3 Flash 进入三个 AA 子榜:作为 Flash 级轻量模型,在 agentic 榜以 51.2 分排名第4(与 Grok 4.6 medium 并列),仅落后 GPT-6 Astra (max) 0.3 分;在 coding 榜以 71.5 分排名第10。这说明在 agent 场景中,轻量模型的性价比正在快速逼近旗舰模型,对按 token 计费的生产部署是直接成本利好。

来源 · 114 条