【xAI】Grok 4.7 发布 xAI 发布 Grok 4.7,登顶 Hacker News 热榜(481 分)。该模型在 AA Intelligence 基准中以 46.3 分首次入榜即排名第 8,直接将其前代 Grok 4.6 从第 8 推至第 10,并对 Step 5 Preview、GLM 5.3 Flash 等模型排名造成连锁下移。 来源 · HN 讨论
【OpenAI】发布模型失对齐报告框架 OpenAI 公布模型失对齐(misalignment)跟踪框架,设定公开披露的标准与时间线,同时发布过去六个月观察到的 6 起失对齐行为报告。框架明确:即使尚未完全解释或缓解的行为也需按时间线披露,复杂案例可与第三方协调。 Our framework for reporting model misalignment
【Anthropic】与 Accenture 合作独立评估,双方各投至少 10 亿美元 Anthropic 与 Accenture 达成合作,在 Anthropic 内部嵌入独立评估团队,对前沿 AI 进行独立评估。双方各自承诺未来五年至少投入 10 亿美元建设评估能力,这是 Dario Amodei "Pace the Frontier" 倡议的具体落地——第三方评估者将获得员工级永久访问权限。 Accenture 嵌入式评估
【Anthropic】Claude Code 新增 AGENTS.md 支持 Claude Code v2.1.277 发布,新增 AGENTS.md 支持:项目中无 CLAUDE.md 时自动读取 AGENTS.md 作为指令文件。同日 v2.1.278 将 auto 模式默认切换至服务端分类器,Bedrock/Vertex/Foundry 及网关用户不再被收取分类器开销费用。 Claude Code v2.1.277 · v2.1.278
【OpenAI】成立数学与 AI 顾问组 OpenAI 与独立数学家顾问组合作,指导 AI 数学成果的评审与传播,确保学术标准并构建支持数学研究的工具。该顾问组将参与评估新数学结果的沟通方式。 Advisory Group on Mathematics and AI
AA Intelligence:两个新模型入榜,多家排名连锁下移
本次无单一模型排名变动 ≥5 或分数变动 ≥5%,但有两个新模型首次入榜值得关注:
| 模型 | 变动类型 | 排名 | 分数 |
|---|---|---|---|
| Grok 4.7 (high) | 新入榜 | #8 | 46.3 |
| MiMo-V2.6-Pro | 新入榜 | #7 | 46.3 |
两个新模型同时以 46.3 分进入第 7、8 位,导致 Grok 4.6(8→10)、Step 5 Preview(7→9)、GLM 5.3 Flash(9→11)、Claude Opus 5 Low(11→13)、GPT-5.5 xhigh(12→14)、Claude Sonnet 5 Max(13→15)各下移 2 位。
SWE-bench Verified 方面仅 Claude 4 Sonnet + o4-mini(10→9)与 GPT-5(9→10)互换了位置,无重大变动。
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-21 | Advisory Group on Mathematics and Artificial Intelligence | 成立独立数学顾问小组,指导 AI 数学成果的评估与传播,确保学术标准 |
| 09-21 | Building standards for the next phase of AI | 提出全球 AI 标准路径,呼吁协调评估、报告与治理以提升安全性 |
| 09-21 | Higgsfield AI ships new video features in a day with GPT-6 Astra | Higgsfield AI 借助 GPT-6 Astra 一天内上线视频广告制作功能,面向小企业 |
| 09-21 | Expanding OpenAI Academy with new learning paths | OpenAI Academy 新增面向员工、开发者、领导者、教育者与学生的学习路径 |
| 09-21 | How V7 gives AI agents institutional memory | V7 使用 GPT-5.6 将企业散落文件转化为 AI agent 可用的上下文,支持来源链接 |
| 09-16 | Our framework for reporting model misalignment | 发布模型失对齐报告框架,设定公开披露标准与时间线,同时发布六份异常行为报告 |
| 09-16 | Reimagining advertising with AI | 推出 Sponsored Agents、营销工具及 HubSpot/Shopify 集成;Shopify 商家可直接在 ChatGPT 投放广告 |
| 09-16 | Hex turns complex analysis into visual reports with GPT-6 Astra | GPT-6 Astra 帮助 Hex 数据 agent 将分析结果转为可交互可视化 |
| 09-10 | Introducing the Agents API | 基于 Codex harness 的托管云 agent 服务,支持长会话与工具调用 |
| 09-10 | Build more natural voice experiences with GPT-Live-1 in the API | 全双工语音对话 API,支持自定义语音与电话集成 |
| 09-10 | Introducing ChatGPT for Financial Services | 结合内置金融数据与 GPT-6 Astra,面向研究、建模与客户交付物 |
| 09-10 | Now everyone can put data to work | ChatGPT Work 新增 Data agent,自然语言连接企业数据并生成交互式仪表盘 |
| 09-09 | GPT-6 Astra: The next generation in intelligence for work | OpenAI 最强商业模型,具备高级推理、计算机操作与更强的写作和设计判断力 |
| 09-09 | Paul Christiano joins OpenAI Foundation Board | ARC 创始人 Christiano 加入基金会董事会及安全委员会,担任 PBC 董事会非投票观察员 |
Sam Altman / Tibo 动态:
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-19 | Claude Code v2.1.278 | auto 模式默认切换至服务端分类器,不对分类器开销收费;Bedrock/Vertex/Foundry 及网关用户可 CLAUDE_CODE_AUTO_MODE_SERVER=0 退出 |
| 09-18 | Claude Code v2.1.277 | 新增 AGENTS.md 支持:无 CLAUDE.md 时自动读取 AGENTS.md;可在 /config 中切换(Bedrock/Vertex/Foundry 暂不支持) |
| 09-18 | Claude Code v2.1.276 | 修复 ANTHROPIC_BASE_URL 指向代理/网关时所有请求返回 400 的回归 bug |
| 09-18 | Anthropic × Accenture 独立评估合作 | 双方各承诺至少 10 亿美元、五年内建设前沿 AI 独立评估能力,嵌入评估员常驻 Anthropic |
| 09-17 | Measuring the pace of AI development | 发布三项内部指标:AI 完成 AI R&D 的比例、agent 监督质量、算力分配方式 |
| 09-17 | Life Sciences Verification Program | 面向生命科学专业团队开放(beta),首次提供 Mythos 模型访问,配备新型生物安全护栏 |
| 09-17 | Projects in Claude Code | 一个对话即一个项目,Claude 自行拆分线程、并行运行云会话并传递上下文;beta 阶段 |
| 09-16 | Claude Docs / Slides / Design | 全对话内置文档、幻灯片与设计工具,基于重构的 Artifacts 平台 |
| 09-16 | Chat 与 Cowork 合并 | 合并为单一 Claude 体验,支持快速提问与长任务交接,逐步推送至 Pro 和 Max |
| 09-12 | Dario Amodei: We Must Pace the Frontier | 呼吁行业主动减速,Anthropic 单边承诺给予第三方评估员常驻员工级系统访问权限 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-18 | New experts join Google's AI & Economy team | 扩充 AI 与经济研究团队 |
| 09-17 | Making global data easier to explore | 联合国系统数据共享平台 |
| 09-16 | DeepMind Institute 成立 | Shane Legg 宣布成立 DeepMind Institute,专注 AGI 技术与社会影响研究 |
| 09-16 | The case for reasoning transparency | Anca Dragan 与 Rohin Shah 论证应有意保留 CoT 可监控性,反对"CoT 必然消失"论 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-21 | Grok 4.7 | 新模型发布;HN 热度 481 分;进入 AA intelligence 榜单第 8 名(46.3 分) |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-21 | AI coding has made CI a bottleneck | Linear 重构 CI 以应对 AI 编码带来的流水线压力;HN 122 分 |
| 09-21 | Simon Willison: Jev 与 System One 模型 | 梳理 Jev 及"系统一"决策模型这一新品类,探讨可靠 AI 与 chat-first 范式的终结 |
| 09-21 | swyx: Jev podcast 预告 | Latent.Space 将发布 Jev 创始人访谈,讨论 RLCD、intelligence/$ 及不预训练的理由 |
| 09-18 | ChatGPT 桌面端支持 Chrome 扩展 | 可在应用内浏览器安装、固定和使用 1Password 等扩展;企业管理员可集中部署 |
| 09-18 | ChatGPT 插件多账号支持 | 多数插件支持同时连接个人与工作账号,上下文跨账号汇聚至同一对话 |
AA Intelligence — 本期有变动:
| 变化类型 | 模型 | 说明 |
|---|---|---|
| 🆕 新入榜 | MiMo-V2.6-Pro | 第 7 名,46.3 分 |
| 🆕 新入榜 | Grok 4.7 (high) | 第 8 名,46.3 分 |
| ↓ 排名下降 | Step 5 Preview | 7→9(43.7 分,分数不变) |
| ↓ 排名下降 | Grok 4.6 (medium) | 8→10(42.8 分) |
| ↓ 排名下降 | GLM 5.3 Flash | 9→11(41.8 分) |
| ↓ 排名下降 | Muse Spark 1.2 (xhigh) | 10→12(39.6 分) |
| ↓ 排名下降 | Claude Opus 5 (Low) | 11→13(39.4 分) |
| ↓ 排名下降 | GPT-5.5 (xhigh) | 12→14(38.4 分) |
| ↓ 排名下降 | Claude Sonnet 5 (Max) | 13→15(38.2 分) |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 53.4 |
| 2 | GPT-6 Astra (max) | 52.7 |
| 3 | GPT-6 Astra (xhigh) | 52.4 |
LMArena Overall — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1505.68 |
| 2 | claude-opus-4-6-high | 1504.56 |
| 3 | claude-opus-4-7-high | 1501.75 |
AA Agentic — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 55.6 |
| 3 | GPT-6 Astra (max) | 51.0 |
AA Coding — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
SWE-bench Pro (Public) — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
SWE-bench Verified — 本期有变动:
| 变化类型 | 模型 | 说明 |
|---|---|---|
| ↑ 排名上升 | Claude 4 Sonnet + o4-mini | 10→9(74.4 分) |
| ↓ 排名下降 | GPT-5 | 9→10(74.4 分,分数相同,位次互换) |
| ↑ 排名上升 | Claude 3.5 Haiku | 34→33(40.6 分) |
| ↓ 排名下降 | LLama 3.1 70B Critic | 33→34(40.6 分) |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Grok 4.7 进入 AA 智能榜单即与 MiMo-V2.6-Pro 并列 46.3 分——两个新模型同分进入第 7、8 名,直接挤掉 Step 5 Preview 和 Grok 4.6 各两个位次,说明中段竞争密度在上升;但二者距榜首 Claude Fable 5.1(53.4)仍有 7 分差距,头部格局未被动摇。Grok 4.7 在 HN 获得 481 分热度,社区关注度远超同期其他模型发布。
Anthropic 与 Accenture 各承诺至少 10 亿美元、五年内建设独立评估能力——这是 Dario Amodei "We Must Pace the Frontier" 文章中"嵌入评估员"承诺的具体落地,且资金量级在 AI 治理领域罕见。评估员将获得常驻员工级系统访问权限,这意味着第三方可以独立验证安全措施合规性而非依赖实验室自查。
OpenAI 一日连发三条治理公告(数学顾问小组 + 全球标准路线图 + Academy 扩展),结合 09-16 发布的模型失对齐报告框架(含六份异常行为公开报告,设定披露时间线),OpenAI 正在从"发布产品"转向"发布治理制度"——其框架明确要求即便未完全解释或缓解异常行为时也须按时间线公开披露,这在前沿实验室中尚属首次。