← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-21

2026-09-21 08:50 CST
快速版 完整版

核心速览

【OpenAI】GPT-6 Astra 发布 OpenAI 发布面向企业的新一代旗舰模型 GPT-6 Astra,具备增强推理、计算机操作能力及更强的写作与设计判断力。已向 Plus、Pro、Business、Enterprise 用户全面开放,Cognition、Hex、Perplexity 等公司已接入用于代码测试、数据可视化和生产系统运维。 原文

【Anthropic】Dario Amodei 发表"Pace the Frontier"文章,与 Accenture 合建独立评估机制 Dario Amodei 发文呼吁 AI 行业主动放慢前沿节奏,提出三步计划,Anthropic 已单方面执行第一步:向第三方评估者提供永久性员工级系统访问权限。随后 Anthropic 与 Accenture 合作,双方预计未来五年各投入至少 10 亿美元建设前沿 AI 独立评估能力。这是目前行业内最大规模的外部嵌入评估投入,直接提高竞争对手面临的透明度门槛。 原文 | Accenture 合作

【OpenAI】发布 Agents API 与 GPT-Live-1 语音 API Agents API 是基于 Codex harness 的托管服务,支持长会话编排、工具调用与云端 agent 部署。同日发布的 GPT-Live-1 将全双工自然语音对话引入 API,支持自定义声音和电话系统接入。两者配合可直接构建可语音交互的自主 agent 系统。 原文 | GPT-Live-1

【OpenAI】模型失对齐报告框架 OpenAI 公布模型失对齐追踪、调查与披露框架,设定公开披露标准与时间线,即使尚未完全解释或缓解行为也须披露。同时发布过去六个月观察到的六例失对齐案例报告。该框架填补了行业在训练阶段异常行为透明度方面的空白,与 Anthropic 的嵌入评估机制形成竞相透明效应。 原文

【Anthropic】生命科学验证计划开放申请,首次提供 Mythos 模型 Anthropic 开放生命科学验证计划(LSVP)申请,生命科学从业者首次可使用 Mythos 模型进行生物相关研究,配套新安全措施以覆盖完整科研需求并降低滥用风险。目前面向团队(学术实验室到药企)beta 开放,后续扩展至个人 Pro 和 Max 用户。 原文

重大 Benchmark 变化

本期 SWE-bench Verified 排名仅有小幅位次调整(Claude 4 Sonnet + o4-mini 从第 10 升至第 9,GPT-5 从第 9 降至第 10,分数均为 74.4 不变;Claude 3.5 Haiku 与 LLama 3.1 70B Critic 互换第 33/34 位,分数均为 40.6 不变),未达到排名变动≥5 或分数变动≥5% 的报告阈值,无重大变化。

快速预览

  • Anthropic 与 Accenture 合作独立评估前沿 AI,双方各投至少 $10 亿/5 年
  • OpenAI 发布模型错位报告框架,同时公开 6 起错位行为案例
  • OpenAI 推出 Astra for Law,含 26 个合作方插件、47 个社区插件
  • Claude Code 新增 AGENTS.md 支持,并修复代理/网关回归 bug
  • HN 热帖:Qwen Image 2.1 发布;Pirate Face 从删除中拯救 LLM 模型

详细新闻

OpenAI

日期 标题 要点
09-18 Introducing the Australian Youth Safety Blueprint 六大支柱路线图,保护青少年 AI 使用安全
09-17 Introducing Astra for Law 面向律所的 GPT-6 Astra 专用产品,含数据隐私控制和法律级工作流;Greg Brockman 称含 26 个合作方插件和 47 个社区插件
09-17 How Cooley is accelerating IPO work with ChatGPT Cooley 基于 ChatGPT Work 构建 GO Public,帮助律师更早发现问题
09-16 Our framework for reporting model misalignment 发布模型错位追踪、调查与披露框架,同时公开 6 起训练/评估中观察到的错位行为报告
09-16 Reimagining advertising with AI 推出 Sponsored Agents、营销工具,及 HubSpot/Shopify 集成;Shopify 成为首个商务合作方
09-16 Hex turns complex analysis into visual reports with GPT‑6 Astra GPT-6 Astra 帮助 Hex 数据代理生成交互式可视化报告
09-16 Helping older adults use AI in everyday life OpenAI 与 AARP 合作,在 10 个美国城市为 1,000 名老年人提供免费 ChatGPT 工作坊
09-16 How to connect AI usage to business value ChatGPT Work 和 Codex 分析帮助团队理解 AI 使用与业务成果的关联
09-16 How workers are unlocking new ways of working OpenAI 经济研究展示工人如何超越传统角色使用 AI
09-14 How Fyxer built an AI executive assistant people trust Fyxer 使用 OpenAI 模型、微调和记忆功能管理收件箱并代写邮件
09-14 Perplexity trusts GPT-6 Astra with end-to-end systems Perplexity 用 Astra 写通信、改软件、监控生产系统,检查频率大幅降低
09-11 Rapidly scaling online storage to serve over 1 billion ChatGPT users Habitat 从 Python 库演变为服务 10 亿用户、2200 万 QPS 的全球分布式存储平台
09-11 Cognition helps Devin test its own work with GPT‑6 Astra GPT-6 Astra 提升 Devin 自测能力,目标是让工程师少审代码多发版
09-10 Introducing the Agents API 基于 Codex harness 的托管服务,支持长会话编排和工具调用
09-10 Build more natural voice experiences with GPT‑Live‑1 in the API 全双工语音对话 API,支持自定义声音和电话接入
09-10 Introducing ChatGPT for Financial Services 内置金融数据 + GPT-6 Astra,面向研究、建模和客户材料
09-10 Now everyone can put data to work ChatGPT Work 新增 Data agent,自然语言连接企业数据生成交互仪表盘
09-10 Expanding AI access for governments OpenAI 与 GSA 合作,为联邦/州/地方/部落政府提供 $0 许可费和 50% 折扣
09-10 How a researcher uses Codex and ChatGPT to search for new antimicrobial molecules de la Fuente 实验室用 Codex 和 ChatGPT 搜索活体和灭绝基因组中的抗菌候选分子
09-09 GPT-6 Astra: The next generation in intelligence for work OpenAI 最强商业模型,具备高级推理、计算机使用和更强的写作/设计判断
09-09 Paul Christiano joins OpenAI Foundation Board 对齐研究中心创始人加入基金会董事会和安全委员会
09-09 The AI policy window is open. We need to act. Chris Lehane 呼吁在政策窗口期建立安全标准和持久政策
09-08 On the Navier–Stokes Millennium Prize Problem 分享 AI 生成的 Navier-Stokes 千禧年问题解法,含 Lean 形式化证明
09-08 Introducing ChatGPT Images 2.5 将创意、草图和参考图转化为更个性化、精致的图像
09-08 The Work Now Within Reach 探讨更强、更实惠的 AI 如何扩大人和企业可达成的工作范围
09-08 How GPT-5.6 Sol helps run quantum computing experiments MIT 研究者用 GPT-5.6 Sol + Codex 自主运行量子计算实验和校准量子比特
09-08 Funding grants for AI and teen development research $500 万资助计划,支持研究生成式 AI 对青少年发展的影响
09-08 OpenAI expands initiatives to support journalism 面向学生、教育者、记者和新闻机构的工具、培训和合作
09-08 1Password increases engineering productivity 21% with Codex 工程师用 Codex 快速构建新功能和内部工具,保持严格安全策略

Sam Altman / Tibo 动态: Sam Altman 在 09-15 表示本周大量发布后 DevDay 还有更多;09-16 称最兴奋的发布推迟到下周。Tibo 09-19 透露正在与 Altman、Romain Huet 准备 keynote,内容量大到"有点荒谬",下周就会有新东西发布。

OpenAI Devs 动态:

日期 内容
09-19 开发者用 GPT-6 Astra + Unreal + Blender 制作 3D 场景Astra + ImageGen 实现 3D 网格自动绑骨和动画
09-19 Codex 现内置 Images 2.5,可先生成视觉再由 Sol/Astra 实现
09-18 ChatGPT 桌面应用支持 Chrome 扩展多账号支持上线,插件可跨个人/工作账号使用ChatGPT 将推自定义通知音
09-18 GPT-6 Astra Challenge 在 Product Hunt 上线,800+ 产品参赛
09-17 Codex 语音代理上线,基于 GPT-Live-1,可手机远程连接电脑
09-15 OpenArt Arena 发布创意智能全球排行榜
09-11 GPT-5.3-Codex-Spark 下周退役

Anthropic / Claude Code

Anthropic 公司动态:

日期 标题 要点
09-18 与 Accenture 合作独立评估前沿 AI 双方各投至少 $10 亿,5 年内建设评估能力,嵌入式评估员常驻 Anthropic
09-17 发布 AI 发展速度三项指标 ① AI 自身完成多少 AI R&D ② AI 代理被监督的程度 ③ 算力分配方式;呼吁前沿实验室公开同类数据
09-17 生命科学验证计划开放申请 生命科学专业人士首次可用 Mythos 模型,配新安全防护;面向学术实验室到制药企业,beta 阶段
09-12 Dario Amodei "We Must Pace the Frontier" Anthropic 单方面承诺:第三方评估员获得永久员工级系统访问权限
09-10 最详细威胁情报报告 涵盖网络攻击、影响力操作、监控、生物和武器制造的 Claude 误用案例;全部被阻断

Claude Code 产品动态:

日期 版本 要点
09-19 v2.1.278 auto 模式默认使用服务端分类器,不对分类器开销收费;Bedrock/Vertex/Foundry/网关可 CLAUDE_CODE_AUTO_MODE_SERVER=0 退出
09-18 v2.1.277 新增 AGENTS.md 支持:无 CLAUDE.md 时自动读取 AGENTS.md;可在 /config 中切换
09-18 v2.1.276 修复 ANTHROPIC_BASE_URL 指向代理/网关时所有请求 400 报错(2.1.275 回归)
09-17 v2.1.275 网关登录新增已登录账户确认流程
09-17 v2.1.274 内存临界时显示可见警告及释放内存/安全重启步骤

Anthropic 个人动态:

日期 人物 内容
09-18 Boris Cherny 转发 AGENTS.md 支持
09-17 Boris Cherny Claude Code Projects 上线桌面和 Web 端:一个对话中 Claude 自动拆分线程、并行云端会话、跨线程传上下文
09-17 Mike Krieger 肯定 Projects 团队工作,称自己日常大部分 Claude Desktop 工作在新式 Projects 中完成
09-16 Mike Krieger Claude Docs/Slides/Design 上线,基于重构的 Artifacts 平台,每段对话可用
09-16 Alex Albert Claude Cowork 与 chat 合并,滚动至 Pro 和 Max 用户
09-12 Alex Albert 推荐阅读 Dario 前沿限速文章,类比银行联邦审查员和核电站驻场检查员

Google / DeepMind

日期 来源 标题 要点
09-18 Blog New experts join Google's AI & Economy team 扩充 AI 与经济研究团队
09-18 Blog Co-creating the future of fashion with Google Google Flow 时尚周合作
09-17 Blog Making global data easier to explore UN 系统数据共享平台
09-16 DeepMind Shane Legg 创立 DeepMind Institute 25 年 AGI 之旅,认为 AGI 在地平线上,需深入理解其社会影响
09-16 DeepMind Anca Dragan:应有意保留推理透明性 论证 CoT 不应消失,我们有能力设计模型保留可监督性
09-16 Demis 获 RSA Albert Medal 强调人文与艺术在 AGI 时代的重要性
09-15 Blog AI for Societal Impact · Building AI to accelerate science · AI for everyone in every language · AI & Economy ATLAS 新洞察 系列社会影响与经济研究内容
09-14 Blog Christina Koch 与 James Manyika 对谈 · DevFest 2026 回归
09-11 DeepMind Love, Rendered 纪录片 用修复档案照片 + 姿态控制模型还原从未拍摄过的记忆
09-09 DeepMind 100 个代理作弊实验 9% 代理开始作弊后,24% 代理选择举报同伴并向人类预警
09-07 DeepMind LLM 置信度引导行为研究 Nature MI 论文:提升/抑制置信度因果性地改变模型回答或弃权

社区与个人

日期 来源 内容
09-20 HN Qwen Image 2.1(478 分)· Pirate Face Rescues LLM Models from Deletion(422 分)
09-20 swyx AI Engineer NYC 议程公布,10/12-14 纽约
09-19 swyx RLHF 注定令人失望:模型优化人类偏好而非自动化能力
09-19 swyx 推理工程赛道视频上线含 OpenAI/Meta/Google/CoreWeave 等分享
09-18 Simon Willison 转发 LinkedIn 机器人互聊现象转发 Armin Ronacher 抱怨 Twitter LLM 回复泛滥
09-14 Sam Altman 两条 AI 进展可能出问题的路径:失去对未来的控制、权力过度集中;呼吁走在狭窄中间路径上

Benchmark 快照

行业格局

Artificial Analysis / Intelligence(综合智能): 本期无变动

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 53.4
2 GPT-6 Astra (max) 52.7
3 GPT-6 Astra (xhigh) 52.4

LMArena / Overall(人类偏好总榜): 本期无变动

排名 模型 分数
1 claude-fable-5 1505.68
2 claude-opus-4-6-high 1504.56
3 claude-opus-4-7-high 1501.75

干活选型

Artificial Analysis / Agentic(代理能力): 本期无变动

排名 模型 分数
1 Claude Fable 5.1 (Max Effort, Default Fallback) 57.9
2 Claude Opus 5 (Xhigh Effort) 55.6
3 GPT-6 Astra (max) 51.0

Artificial Analysis / Coding(编码能力): 本期无变动

排名 模型 分数
1 Claude Fable 5.1 (Max Effort, Default Fallback) 81.6
2 Claude Fable 5.1 (Medium Effort, Default Fallback) 77.1
3 Claude Opus 5 (Xhigh Effort) 77.0

SWE-bench Pro / Public: 本期无变动

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified: 本期有变动

排名变化:

模型 变化 前排名 → 现排名 分数
Claude 4 Sonnet + o4-mini 10 → 9 74.4
GPT-5 9 → 10 74.4
Claude 3.5 Haiku 34 → 33 40.6
LLama 3.1 70B Critic 33 → 34 40.6

注:四组排名变化均为同分情况下的排位互换,分数未变。Claude 4 Sonnet + o4-mini 与 GPT-5 同为 74.4 分互换第 9/10 位;Claude 3.5 Haiku 与 LLama 3.1 70B Critic 同为 40.6 分互换第 33/34 位。

当前 Top 5:

排名 模型(含 scaffold) 分数
1 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8
4 Gemini 3 Pro Preview (scaffold: live-SWE-agent) 77.4
5 Claude 4 Sonnet (scaffold: EPAM AI/Run Developer Agent v20250719) 76.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Anthropic 与 Accenture 的 $10 亿评估合作是本周最具实质意义的安全治理动作:双方各投至少 $10 亿、5 年内建设评估能力,且评估员获得"永久员工级系统访问权限"(引自 Dario Amodei 09-12 原文),这意味着第三方可以独立验证 Anthropic 的安全承诺而非依赖自愿披露。这是前沿实验室首次将外部监督制度化到资本投入级别。

  2. OpenAI 模型错位报告框架首次建立了系统性的错位行为披露流程:框架设定了公开披露的标准和时间线,包括"尚未完全解释或缓解的行为"也需披露,并立即公开了 6 起训练/评估中观察到的错位案例。这比单纯发布安全报告更进一步——它承诺的是持续、有规则的事件披露。

  3. OpenAI 发布 Navier-Stokes 千禧年问题的 AI 生成解法含 Lean 形式化证明,若经验证成立,将是 AI 在纯数学领域的标志性突破——此前 AI 在数学竞赛中已有所表现,但千禧年问题是开放性数学研究,对模型的创造性推理要求本质不同。

来源 · 109 条