← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-22

2026-09-22 08:37 CST
快速版 完整版

核心速览

【xAI】Grok 4.7 发布 xAI 发布 Grok 4.7,登顶 Hacker News 热榜(481 分)。该模型在 AA Intelligence 基准中以 46.3 分首次入榜即排名第 8,直接将其前代 Grok 4.6 从第 8 推至第 10,并对 Step 5 Preview、GLM 5.3 Flash 等模型排名造成连锁下移。 来源 · HN 讨论

【OpenAI】发布模型失对齐报告框架 OpenAI 公布模型失对齐(misalignment)跟踪框架,设定公开披露的标准与时间线,同时发布过去六个月观察到的 6 起失对齐行为报告。框架明确:即使尚未完全解释或缓解的行为也需按时间线披露,复杂案例可与第三方协调。 Our framework for reporting model misalignment

【Anthropic】与 Accenture 合作独立评估,双方各投至少 10 亿美元 Anthropic 与 Accenture 达成合作,在 Anthropic 内部嵌入独立评估团队,对前沿 AI 进行独立评估。双方各自承诺未来五年至少投入 10 亿美元建设评估能力,这是 Dario Amodei "Pace the Frontier" 倡议的具体落地——第三方评估者将获得员工级永久访问权限。 Accenture 嵌入式评估

【Anthropic】Claude Code 新增 AGENTS.md 支持 Claude Code v2.1.277 发布,新增 AGENTS.md 支持:项目中无 CLAUDE.md 时自动读取 AGENTS.md 作为指令文件。同日 v2.1.278 将 auto 模式默认切换至服务端分类器,Bedrock/Vertex/Foundry 及网关用户不再被收取分类器开销费用。 Claude Code v2.1.277 · v2.1.278

【OpenAI】成立数学与 AI 顾问组 OpenAI 与独立数学家顾问组合作,指导 AI 数学成果的评审与传播,确保学术标准并构建支持数学研究的工具。该顾问组将参与评估新数学结果的沟通方式。 Advisory Group on Mathematics and AI


重大 Benchmark 变化

AA Intelligence:两个新模型入榜,多家排名连锁下移

本次无单一模型排名变动 ≥5 或分数变动 ≥5%,但有两个新模型首次入榜值得关注:

模型 变动类型 排名 分数
Grok 4.7 (high) 新入榜 #8 46.3
MiMo-V2.6-Pro 新入榜 #7 46.3

两个新模型同时以 46.3 分进入第 7、8 位,导致 Grok 4.6(8→10)、Step 5 Preview(7→9)、GLM 5.3 Flash(9→11)、Claude Opus 5 Low(11→13)、GPT-5.5 xhigh(12→14)、Claude Sonnet 5 Max(13→15)各下移 2 位。

SWE-bench Verified 方面仅 Claude 4 Sonnet + o4-mini(10→9)与 GPT-5(9→10)互换了位置,无重大变动。

快速预览

  • Grok 4.7 发布并进入 AA 智能榜单第 8 名(46.3 分),HN 热度 481 分
  • OpenAI 连发三条治理相关公告:数学与 AI 顾问小组、全球 AI 标准路线图、OpenAI Academy 扩展
  • Anthropic 与 Accenture 合作独立评估前沿 AI,双方各承诺至少 10 亿美元、为期五年
  • Claude Code 一周内发布 5 个版本,新增 AGENTS.md 支持并将 auto 模式切至服务端分类器
  • Anthropic 开放生命科学验证计划,首次向外部提供 Mythos 模型访问

新闻

OpenAI

日期 标题 要点
09-21 Advisory Group on Mathematics and Artificial Intelligence 成立独立数学顾问小组,指导 AI 数学成果的评估与传播,确保学术标准
09-21 Building standards for the next phase of AI 提出全球 AI 标准路径,呼吁协调评估、报告与治理以提升安全性
09-21 Higgsfield AI ships new video features in a day with GPT-6 Astra Higgsfield AI 借助 GPT-6 Astra 一天内上线视频广告制作功能,面向小企业
09-21 Expanding OpenAI Academy with new learning paths OpenAI Academy 新增面向员工、开发者、领导者、教育者与学生的学习路径
09-21 How V7 gives AI agents institutional memory V7 使用 GPT-5.6 将企业散落文件转化为 AI agent 可用的上下文,支持来源链接
09-16 Our framework for reporting model misalignment 发布模型失对齐报告框架,设定公开披露标准与时间线,同时发布六份异常行为报告
09-16 Reimagining advertising with AI 推出 Sponsored Agents、营销工具及 HubSpot/Shopify 集成;Shopify 商家可直接在 ChatGPT 投放广告
09-16 Hex turns complex analysis into visual reports with GPT-6 Astra GPT-6 Astra 帮助 Hex 数据 agent 将分析结果转为可交互可视化
09-10 Introducing the Agents API 基于 Codex harness 的托管云 agent 服务,支持长会话与工具调用
09-10 Build more natural voice experiences with GPT-Live-1 in the API 全双工语音对话 API,支持自定义语音与电话集成
09-10 Introducing ChatGPT for Financial Services 结合内置金融数据与 GPT-6 Astra,面向研究、建模与客户交付物
09-10 Now everyone can put data to work ChatGPT Work 新增 Data agent,自然语言连接企业数据并生成交互式仪表盘
09-09 GPT-6 Astra: The next generation in intelligence for work OpenAI 最强商业模型,具备高级推理、计算机操作与更强的写作和设计判断力
09-09 Paul Christiano joins OpenAI Foundation Board ARC 创始人 Christiano 加入基金会董事会及安全委员会,担任 PBC 董事会非投票观察员

Sam Altman / Tibo 动态:

  • 09-19 Tibo 表示正在与 Altman、Romet 筹备 keynote,"内容多到有点离谱",下周将有预热内容(来源
  • 09-16 Altman 表示本周原计划发布的主要内容推迟到下周,"值得等待"(来源

Anthropic / Claude Code

日期 标题 要点
09-19 Claude Code v2.1.278 auto 模式默认切换至服务端分类器,不对分类器开销收费;Bedrock/Vertex/Foundry 及网关用户可 CLAUDE_CODE_AUTO_MODE_SERVER=0 退出
09-18 Claude Code v2.1.277 新增 AGENTS.md 支持:无 CLAUDE.md 时自动读取 AGENTS.md;可在 /config 中切换(Bedrock/Vertex/Foundry 暂不支持)
09-18 Claude Code v2.1.276 修复 ANTHROPIC_BASE_URL 指向代理/网关时所有请求返回 400 的回归 bug
09-18 Anthropic × Accenture 独立评估合作 双方各承诺至少 10 亿美元、五年内建设前沿 AI 独立评估能力,嵌入评估员常驻 Anthropic
09-17 Measuring the pace of AI development 发布三项内部指标:AI 完成 AI R&D 的比例、agent 监督质量、算力分配方式
09-17 Life Sciences Verification Program 面向生命科学专业团队开放(beta),首次提供 Mythos 模型访问,配备新型生物安全护栏
09-17 Projects in Claude Code 一个对话即一个项目,Claude 自行拆分线程、并行运行云会话并传递上下文;beta 阶段
09-16 Claude Docs / Slides / Design 全对话内置文档、幻灯片与设计工具,基于重构的 Artifacts 平台
09-16 Chat 与 Cowork 合并 合并为单一 Claude 体验,支持快速提问与长任务交接,逐步推送至 Pro 和 Max
09-12 Dario Amodei: We Must Pace the Frontier 呼吁行业主动减速,Anthropic 单边承诺给予第三方评估员常驻员工级系统访问权限

Google / DeepMind

日期 标题 要点
09-18 New experts join Google's AI & Economy team 扩充 AI 与经济研究团队
09-17 Making global data easier to explore 联合国系统数据共享平台
09-16 DeepMind Institute 成立 Shane Legg 宣布成立 DeepMind Institute,专注 AGI 技术与社会影响研究
09-16 The case for reasoning transparency Anca Dragan 与 Rohin Shah 论证应有意保留 CoT 可监控性,反对"CoT 必然消失"论

xAI

日期 标题 要点
09-21 Grok 4.7 新模型发布;HN 热度 481 分;进入 AA intelligence 榜单第 8 名(46.3 分)

社区动态

日期 标题 要点
09-21 AI coding has made CI a bottleneck Linear 重构 CI 以应对 AI 编码带来的流水线压力;HN 122 分
09-21 Simon Willison: Jev 与 System One 模型 梳理 Jev 及"系统一"决策模型这一新品类,探讨可靠 AI 与 chat-first 范式的终结
09-21 swyx: Jev podcast 预告 Latent.Space 将发布 Jev 创始人访谈,讨论 RLCD、intelligence/$ 及不预训练的理由
09-18 ChatGPT 桌面端支持 Chrome 扩展 可在应用内浏览器安装、固定和使用 1Password 等扩展;企业管理员可集中部署
09-18 ChatGPT 插件多账号支持 多数插件支持同时连接个人与工作账号,上下文跨账号汇聚至同一对话

OpenAI 开发者生态(GPT-6 Astra 挑战赛等)


Benchmark 快照

行业格局

AA Intelligence — 本期有变动:

变化类型 模型 说明
🆕 新入榜 MiMo-V2.6-Pro 第 7 名,46.3 分
🆕 新入榜 Grok 4.7 (high) 第 8 名,46.3 分
↓ 排名下降 Step 5 Preview 7→9(43.7 分,分数不变)
↓ 排名下降 Grok 4.6 (medium) 8→10(42.8 分)
↓ 排名下降 GLM 5.3 Flash 9→11(41.8 分)
↓ 排名下降 Muse Spark 1.2 (xhigh) 10→12(39.6 分)
↓ 排名下降 Claude Opus 5 (Low) 11→13(39.4 分)
↓ 排名下降 GPT-5.5 (xhigh) 12→14(38.4 分)
↓ 排名下降 Claude Sonnet 5 (Max) 13→15(38.2 分)

当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 53.4
2 GPT-6 Astra (max) 52.7
3 GPT-6 Astra (xhigh) 52.4

LMArena Overall — 本期无变动

当前 Top 3:

排名 模型 分数
1 claude-fable-5 1505.68
2 claude-opus-4-6-high 1504.56
3 claude-opus-4-7-high 1501.75

干活选型

AA Agentic — 本期无变动

当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 57.9
2 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 55.6
3 GPT-6 Astra (max) 51.0

AA Coding — 本期无变动

当前 Top 3:

排名 模型 分数
1 Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) 81.6
2 Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) 77.1
3 Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) 77.0

SWE-bench Pro (Public) — 本期无变动

当前 Top 3:

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

SWE-bench Verified — 本期有变动:

变化类型 模型 说明
↑ 排名上升 Claude 4 Sonnet + o4-mini 10→9(74.4 分)
↓ 排名下降 GPT-5 9→10(74.4 分,分数相同,位次互换)
↑ 排名上升 Claude 3.5 Haiku 34→33(40.6 分)
↓ 排名下降 LLama 3.1 70B Critic 33→34(40.6 分)

当前 Top 3:

排名 模型 分数
1 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. Grok 4.7 进入 AA 智能榜单即与 MiMo-V2.6-Pro 并列 46.3 分——两个新模型同分进入第 7、8 名,直接挤掉 Step 5 Preview 和 Grok 4.6 各两个位次,说明中段竞争密度在上升;但二者距榜首 Claude Fable 5.1(53.4)仍有 7 分差距,头部格局未被动摇。Grok 4.7 在 HN 获得 481 分热度,社区关注度远超同期其他模型发布。

  2. Anthropic 与 Accenture 各承诺至少 10 亿美元、五年内建设独立评估能力——这是 Dario Amodei "We Must Pace the Frontier" 文章中"嵌入评估员"承诺的具体落地,且资金量级在 AI 治理领域罕见。评估员将获得常驻员工级系统访问权限,这意味着第三方可以独立验证安全措施合规性而非依赖实验室自查。

  3. OpenAI 一日连发三条治理公告(数学顾问小组 + 全球标准路线图 + Academy 扩展),结合 09-16 发布的模型失对齐报告框架(含六份异常行为公开报告,设定披露时间线),OpenAI 正在从"发布产品"转向"发布治理制度"——其框架明确要求即便未完全解释或缓解异常行为时也须按时间线公开披露,这在前沿实验室中尚属首次。

来源 · 114 条