1.【Anthropic】与 Accenture 合资 10 亿美元嵌入独立 AI 评估
Anthropic 与 Accenture 达成合作,双方各投入至少 10 亿美元用于前沿 AI 独立评估能力建设,为期五年。这是 Anthropic 此前承诺在内部嵌入第三方评估员的具体落地——评估员将获得员工级系统永久访问权限,可核查安全措施合规性、报告事件并评估训练中的模型对齐情况。该模式参照银行业联邦审查员和核电站驻厂检查员制度,在科技行业尚属首次。Anthropic 已同时发布三项 AI 发展速度度量指标(AI 参与 R&D 比例、Agent 监督程度、算力分配),呼吁其他前沿实验室跟进公开。
2.【OpenAI】发布模型失准报告框架,附带六起失准案例
OpenAI 发布模型失准(misalignment)追踪、调查与披露框架,设定公开披露标准与时间线,即使行为尚未完全解释或缓解也会披露。同时发布过去六个月训练/评估中观察到的六起失准行为报告。框架优先披露三类案例:揭示新失准机制、已知行为发生显著变化、或挑战现有安全假设的发现。
3.【Anthropic】Claude Code 推出 Projects,合并 Chat 与 Cowork
Claude Code 上线 Projects 功能,将原有 Chat 与 Cowork 合并为单一体验。一个 Project 即一次对话,Claude 自动拆分为多个并行云端会话线程,线程间传递上下文,用户离开后持续运行。同步上线 Claude Docs、Slides 和 Design 工具,由重构后的 Artifacts 平台驱动,已面向 Pro 和 Max 用户推送。
4.【OpenAI】推出 Astra for Law,法律行业垂直方案
OpenAI 发布 Astra for Law,由 GPT-6 Astra 驱动,面向律所和法律科技公司。包含法律级保密控制、法律数据源连接能力,以及 26 个合作伙伴插件和 47 个社区插件。这是 OpenAI 继 ChatGPT for Financial Services 之后的第二个行业垂直方案。
本期无排名变动≥5 或分数变动≥5% 的重大变化。Step 5 Preview 新进入 aa intelligence 榜单第 7 名(43.7 分),属新模型上榜而非现有模型排名剧变,不构成重大变动。SWE-bench Verified 中 Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 名,分数均为 74.4,无实质变化。
| 日期 | 新闻 |
|---|---|
| 09-18 | We're partnering with Accenture on independent evaluation of frontier AI — Anthropic 与 Accenture 合作独立评估前沿 AI,双方预计五年内各投至少 10 亿美元建设评估能力。 |
| 09-17 | Measuring the pace of AI development — Anthropic 发布三项内部指标:AI 研发中 AI 自身贡献比例、Agent 监督程度、算力分配,呼吁所有前沿实验室公开同样的数据。 |
| 09-17 | Life Sciences Verification Program 开放申请 — 生命科学从业者首次可使用 Mythos 模型进行生物学相关工作,配套新安全机制,beta 阶段面向学术实验室到药企。 |
| 09-12 | RT Dario Amodei: We Must Pace the Frontier — Dario Amodei 撰文呼吁行业放慢节奏,Anthropic 单方面承诺第一步:向第三方评估者提供永久员工级系统访问权限。 |
| 09-10 | Threat intelligence report — 发布迄今最详细的威胁情报报告,涵盖网络攻击、影响力操作、监控、生物、武器等滥用方向,报告内所有操作均被阻断。 |
| 日期 | 人员 | 内容 |
|---|---|---|
| 09-17 | Mike Krieger | 赞赏 Projects 功能,称已成为自己的日常主力工具。 |
| 09-17 | Boris Cherny | Claude Code Projects 在桌面和网页端 beta 推出;一个 Project 是一条对话,Claude 自动拆分为并行云端线程并传递上下文。 |
| 09-16 | Alex Albert | Claude Cowork 与 chat 合并为单一 Claude,同时推出 Claude Docs/Slides/Design。 |
| 09-12 | Alex Albert | 推荐阅读 Dario Amodei 的放慢前沿文章,将嵌入式评估比作银行驻场审查员和核电站常驻督察。 |
| 版本 | 日期 | 变更 |
|---|---|---|
| v2.1.278 | 09-19 | auto mode 默认改用服务端分类器,不再收取分类器开销;Bedrock/Vertex/Foundry/网关同理,CLAUDE_CODE_AUTO_MODE_SERVER=0 可退出。 |
| v2.1.277 | 09-18 | 新增 AGENTS.md 支持:无 CLAUDE.md 时自动读取 AGENTS.md,可在 /config 中切换(Bedrock/Vertex/Foundry 暂不支持)。 |
| v2.1.276 | 09-18 | 修复 2.1.275 引入的回归 bug:当 ANTHROPIC_BASE_URL 指向代理/网关时所有请求返回 400。 |
| v2.1.275 | 09-17 | 网关登录时显示已登录账户,需确认后保存凭据,/status 可查看。 |
| v2.1.274 | 09-17 | 新增内存使用危急时的可见警告,附带释放内存或安全重启的步骤。 |
| 日期 | 人员 | 内容 |
|---|---|---|
| 09-19 | Tibo (thsottiaux) | 与 Romain Huet 和 Sam Altman 准备 keynote,称内容多到"有点夸张",下周先放部分内容。 |
| 09-16 | Sam Altman | "本周最想发布的东西改到下周,但值得等。" |
| 09-15 | Sam Altman | "本周大发货,然后 DevDay 继续大发货。" |
| 09-14 | Sam Altman | 阐述 AI 两大风险:失去对未来的控制权、权力过度集中,强调必须走窄路。 |
| 09-18 | Greg Brockman | 称 ChatGPT 多账户插件支持是"看似小但影响巨大的功能"。 |
| 09-17 | Greg Brockman | 介绍 Astra for Law 含 26 个合作伙伴插件和 47 个社区插件。 |
| 日期 | 内容 |
|---|---|
| 09-19 | Codex 内置 Images 2.5 — 可先用 imagegen 生成视觉素材再由 Sol/Astra 实现。 |
| 09-18 | ChatGPT 桌面端支持 Chrome 扩展 — 企业管理员可集中部署管理扩展。 |
| 09-18 | ChatGPT 多账户插件支持 — 多数插件可连接个人和工作账户到同一对话。 |
| 09-18 | GPT-6 Astra Challenge on Product Hunt — 超过 800 个产品参赛。 |
| 09-17 | Codex voice agent powered by GPT-Live-1 — 可从手机连接电脑的 Codex 语音代理。 |
| 09-11 | GPT-5.3-Codex-Spark 即将退役 — 使用量下降,让位给更好的模型。 |
| 日期 | 新闻 |
|---|---|
| 09-18 | New experts join Google's AI & Economy team |
| 09-18 | Co-creating the future of fashion with Google |
| 09-17 | Making global data easier to explore — UN System Data Commons 上线。 |
| 09-16 | DeepMind Institute 成立 — Shane Legg 称 AGI 已在地平线上,需要更深入理解其影响。同日 Demis Hassabis 转发并推荐 保留推理透明性 一文。 |
| 09-16 | Demis Hassabis 获 RSA Albert Medal |
| 09-15 | AI for Societal Impact |
| 09-15 | AI for everyone in every language |
| 日期 | 标题 | 热度 |
|---|---|---|
| 09-19 | AI-generated posters don't have to be horrible | 1344 pts |
| 09-19 | GPT-6 Astra Solves a WWI German Radio Cipher | 362 pts |
| 09-19 | I think you should almost never use AI to write | 203 pts |
| 09-17 | How to Write with an LLM | 620 pts |
| 日期 | 人员 | 内容 |
|---|---|---|
| 09-18 | Simon Willison | 转推 Ethan Mollick:LinkedIn 评论里 LLM 机器人开始互相回复,全是废话。 |
| 09-18 | swyx | 转推 ChatGPT 联合发明人 Diogo Almeida 发布新模型 Jev,称比传统模型快 20-200 倍。 |
| 09-19 | swyx | AI Engineer World's Fair 2026 推理工程赛道上线,含 vLLM 调试故事和 LLM benchmark 可靠性讨论。 |
aa / intelligence — 有变动
| 变动 | 模型 | 详情 |
|---|---|---|
| 新入榜 | Step 5 Preview | 以 43.7 分直接进入第 7 名 |
| 排名下降 | Grok 4.6 (medium) | 7→8,分 43.0→42.8 |
| 排名下降 | GLM 5.3 Flash | 8→9,分 41.9→41.8 |
| 排名下降 | Muse Spark 1.2 (xhigh) | 9→10,分 39.8→39.6 |
| 排名下降 | Claude Opus 5 (Low) | 10→11,分 39.8→39.4 |
| 排名下降 | GPT-5.5 (xhigh) | 11→12,分 38.6→38.4 |
| 排名下降 | Claude Sonnet 5 (Max) | 12→13,分 38.4→38.2 |
| 排名下降 | GPT-5.6 Luna (max) | 13→14,分 37.5→37.3 |
| 排名下降 | GPT-5.6 Sol (low) | 14→15,分 33.8→33.5 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive, Max, Default Fallback) | 53.4 |
| 2 | GPT-6 Astra (max) | 52.7 |
| 3 | GPT-6 Astra (xhigh) | 52.4 |
lmarena / overall — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1505.68 |
| 2 | claude-opus-4-6-high | 1504.56 |
| 3 | claude-opus-4-7-high | 1501.75 |
aa / agentic — 有变动
| 变动 | 模型 | 详情 |
|---|---|---|
| 排名上升 | GPT-5.5 (xhigh) | 13→12,分 37.3→36.4 |
| 排名下降 | Claude Opus 5 (Low) | 12→13,分 37.5→36.0 |
| 分数下降 | GPT-5.6 Sol (low) | 14→14,分 32.6→31.6 |
| 分数下降 | GPT-5.6 Terra (medium) | 15→15,分 31.4→30.4 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive, Max, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Adaptive, Xhigh) | 55.6 |
| 3 | GPT-6 Astra (max) | 51.0 |
aa / coding — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive, Max, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive, Medium, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Adaptive, Xhigh) | 77.0 |
swebench_pro_public / Public — 本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
swebench_verified / Verified — 有变动
| 变动 | 模型 | 详情 |
|---|---|---|
| 排名上升 | Claude 4 Sonnet + o4-mini | 10→9,分不变 74.4 |
| 排名下降 | GPT-5 | 9→10,分不变 74.4 |
| 排名上升 | Claude 3.5 Haiku | 34→33,分不变 40.6 |
| 排名下降 | LLama 3.1 70B Critic | 33→34,分不变 40.6 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Anthropic 与 Accenture 的 10 亿美元评估合作:Anthropic 承诺向第三方评估者提供永久员工级系统访问权限,Accenture 随即宣布双方各投至少 10 亿美元建设评估能力。这不是 vague 的"安全承诺"——嵌入式评估员有等同于内部员工的系统权限,意味着评估方可以独立验证安全措施执行情况、报告事件、在训练期间评估对齐,而非依赖 lab 自选的审计窗口。如果前沿实验室真的需要"放慢节奏"(Dario Amodei 原文),这种第三方驻场评估是最直接的验证手段。
OpenAI 发布模型失对齐报告框架并附带六份案例:该框架设定了公开披露的标准和时间线,包括"尚未完全解释或缓解"的情况也需披露。六份报告覆盖过去六个月训练和评估中观察到的失对齐行为。真正有信息量的是框架明确声明优先披露"揭示新失对齐机制、已知行为的重大变化、或挑战安全假设的发现"的案例——这比笼统说"我们重视安全"多了可审计的约束。
Step 5 Preview 新入 aa intelligence 第 7 名:一个此前不在榜单上的模型以 43.7 分直接插到 Grok 4.6 和 GLM 5.3 Flash 之间,导致后者各自下降一位。这说明榜单中段仍有新玩家进入的空间,而非头部固定不变。