← 返回列表
SILASCODING · AI 情报

AI 日报 2026-09-18

2026-09-18 08:42 CST
快速版 完整版

核心速览

【OpenAI】Introducing Astra for Law OpenAI 发布面向法律行业的产品 Astra for Law,基于 GPT-6 Astra,提供定制化律所工作流、法律数据源连接及法律级保密控制。配套 26 个合作伙伴插件和 47 个社区插件。法律行业高度依赖数据隐私和精确性,OpenAI 将保密控制作为核心功能而非附加项,直接对标传统法律科技厂商的护城河。

Introducing Astra for Law

【Anthropic】发布 AI 发展速度三项测量指标 Anthropic 发布三项内部指标衡量 AI 发展节奏:AI 研发中由 AI 完成的比例、AI agent 被监督的程度、算力分配方式。Anthropic 同时公布了自身数据的快照,并呼吁其他前沿实验室发布相同指标、允许第三方验证。

测量 AI 发展速度

【Anthropic】生命科学验证计划开放申请,首次开放 Mythos 模型 Anthropic 开放 Life Sciences Verification Program 申请,生命科学专业人员可首次使用 Mythos 模型进行生物学相关工作,配套新的安全防护机制。项目以 beta 形式向学术实验室、初创公司、药企等团队开放,后续将扩展至个人 Pro 和 Max 计划。

Life Sciences Verification Program

【OpenAI】发布模型失对齐报告框架 OpenAI 发布模型失对齐(model misalignment)追踪、调查和披露框架,设定公开披露的标准和时间线,同时公布过去六个月观察到的六起失对齐行为报告。框架明确:即使尚未完全解释或缓解,也将按时间线披露。

模型失对齐报告框架

【Anthropic】Claude Code Projects 功能上线 Claude Code 推出 Projects 功能:用户在一个对话中描述任务,Claude 自动拆分为并行线程,线程间传递上下文,关闭笔记本后继续运行。目前面向部分 Pro 和 Max 用户 beta 开放。Databricks 同步向约 3500 名工程师全面部署 GPT-6 Astra,反馈显示其在复杂系统设计任务上明显优于 Opus 5 和 Sol 5.6。

Claude Code Projects

重大 Benchmark 变化

本周 SWE-bench Verified 排名仅出现 1 位次小幅变动(Claude 4 Sonnet + o4-mini 由第 10 升至第 9,GPT-5 由第 9 降至第 10,分数均为 74.4% 未变),未达到排名变动≥5 或分数变动≥5% 的报告门槛,本周无重大 benchmark 变化。

快速预览

  • OpenAI 发布 Astra for Law,含 26 个合作方插件和 47 个社区插件,法律行业垂直化落地
  • Anthropic 公布三项 AI 发展节奏指标:AI 研发中 AI 参与度、Agent 监督水平、算力分配——呼吁全行业公开
  • Anthropic 开放生命科学验证计划(LSVP),首次向生物领域专业人士开放 Mythos 模型
  • Claude Code 上线 Projects 功能:一个对话自动拆分为并行云端线程,离开后继续执行
  • Sam Altman 本周原定发布推迟到下周,称"值得等待"

新闻

OpenAI

日期 标题 要点
09-17 Introducing Astra for Law 面向律所的垂直产品,基于 GPT-6 Astra,含法律级数据隐私控制
09-17 How Cooley is accelerating IPO work with ChatGPT Cooley 律所基于 ChatGPT Work 构建 GO Public 工具,用于 IPO 流程
09-16 Our framework for reporting model misalignment 发布模型失对齐报告框架,含 6 份过去半年训练/评估中观察到的异常行为报告
09-16 Reimagining advertising with AI 推出 Sponsored Agents、营销工具,集成 HubSpot 和 Shopify
09-16 How to connect AI usage to business value ChatGPT Work 和 Codex 分析帮助团队理解 AI 使用与支出
09-16 Helping older adults use AI in everyday life OpenAI 与 AARP 合作为 10 个城市 1,000 名老年人提供免费 ChatGPT 培训
09-16 How workers are unlocking new ways of working OpenAI 经济研究显示 AI 如何改变工人角色与新工作活动
09-14 How Fyxer built an AI executive assistant Fyxer 使用 OpenAI 模型、微调与记忆来管理收件箱和代写邮件
09-14 Perplexity trusts GPT-6 Astra with end-to-end systems Perplexity 用 Astra 写通讯、改代码、监控生产系统,检查频率大幅降低
09-11 Cognition helps Devin test its own work with GPT‑6 Astra GPT-6 Astra 提升 Devin 自测软件能力
09-11 Rapidly scaling online storage to serve over 1 billion ChatGPT users Habitat 从 Python 库演变为全球分布式存储平台,服务 10 亿用户、22M QPS
09-10 Introducing the Agents API 基于 Codex harness 的托管云 Agent 服务,支持长会话和工具调用
09-10 Build more natural voice experiences with GPT‑Live‑1 全双工语音对话 API,支持自定义声音和电话
09-10 Now everyone can put data to work ChatGPT Work 新增 Data agent,连接企业数据源生成仪表板
09-10 Introducing ChatGPT for Financial Services 内置金融数据 + GPT-6 Astra,面向研究、建模和客户材料
09-10 Expanding AI access for US governments 联邦/州/地方/部落政府 $0 许可费、50% 使用折扣
09-09 GPT-6 Astra: The next generation in intelligence for work OpenAI 最强企业模型,高级推理 + 计算机使用
09-09 Paul Christiano joins OpenAI Foundation Board 对齐研究专家加入基金会董事会和安全委员会
09-09 The AI policy window is open. We need to act. Chris Lehane 呼吁在政策窗口期建立安全标准和持久政策

OpenAI 社交媒体动态(09-17 ~ 09-14)

日期 来源 要点
09-17 OpenAI Devs: Codex 语音 Agent Codex 语音代理由 GPT-Live-1 驱动,可手机远程连接电脑
09-17 OpenAI Devs: Product Hunt Astra 挑战赛 截止 09-18 午夜 PT,前五名获 $10K API 额度 + ChatGPT Pro
09-17 gdb: Astra for Law 细节 含 26 个合作方插件和 47 个社区法律插件
09-16 gdb: Databricks 全员部署 Astra ~3500 工程师全面部署 Astra,复杂任务超越 Opus 5 和 Sol 5.6
09-16 gdb: Shopify 广告上线 Shopify 商户产品目录直接接入 ChatGPT 广告
09-16 Sam Altman: 延迟发布 本周原定发布推迟到下周
09-16 OpenAI Devs: Unity 官方 Codex 插件 Unity 首方集成 Codex,引擎专家维护
09-16 OpenAI: 模型失对齐框架 六份失对齐行为报告,建立公开披露标准
09-14 Sam Altman: AI 两大风险 失控与权力过度集中是需要避免的两种路径

Anthropic / Claude

日期 标题 要点
09-17 Anthropic: 衡量 AI 发展节奏 公布三项指标:AI R&D 中 AI 参与度、Agent 监督水平、算力分配;呼吁所有前沿实验室公开同样数据
09-17 Anthropic: 生命科学验证计划开放申请 生物领域专业人士可使用包括 Mythos 在内的模型,新增生物安全防护措施
09-17 Boris Cherny: Projects 上线 Claude Code 新增 Projects,一个对话自动拆分并行线程,关机后继续;beta 面向 Pro/Max
09-17 Mike Krieger: Projects 体验 协调型 Claude 快速响应,同时后台并行多线程工作
09-16 Mike Krieger: Claude Docs/Slides/Design 每个对话中可用文档、幻灯片和设计工具,基于改版 Artifacts 平台
09-16 Alex Albert: Cowork 与 Chat 合并 Claude Cowork 和 Chat 统一为一个 Claude,两到三周内推送给 Pro/Max
09-12 Anthropic: Dario 呼吁控制前沿节奏 Dario Amodei 发文,Anthropic 承诺向第三方评估者提供永久员工级系统访问
09-10 Anthropic: 威胁情报报告 最详细的威胁情报报告:网络攻击、影响力操作、监控、生物、武器,全部已阻止
09-04 Anthropic: Claude 完成费马大定理形式化证明 超过 1300 万行 Lean 代码,史上最大 Lean 证明

Claude Code 版本

版本 日期 要点
v2.1.275 09-17 Gateway 登录时显示已登录账户并需确认
v2.1.274 09-17 内存使用危急时显示可见警告及释放/重启步骤
v2.1.273 09-15 新增 5 个 LLM Gateway 请求头,CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 开启
v2.1.272 09-15 Bug 修复和可靠性改进
v2.1.271 09-14 Remote sessions 新增 fast 模式

Google / DeepMind

日期 标题 要点
09-17 Making global data easier to explore Google 推出联合国系统数据共享平台
09-16 Shane Legg: DeepMind Institute 创立 DeepMind Institute 研究 AGI 社会影响
09-16 Demis Hassabis: 保留推理可监控性 呼吁有意保留 Chain of Thought 透明性
09-15 AI for Societal Impact AI 社会影响力项目合集
09-15 New insights from Google's AI & Economy ATLAS AI 与经济 Atlas v1.0
09-15 AI for everyone in every language 多语言 AI 普惠
09-14 DevFest is back Google Developer Groups DevFest 2026

行业人士观点

日期 来源 要点
09-17 swyx: AI 自动化 80% GDP 的瓶颈 瓶颈在供给端(芯片和内存),而非需求
09-16 Simon Willison: 通用 Agent 竞赛 OpenAI 将 Codex 桌面端改名 ChatGPT,各家都在争做通用 Agent
09-12 Karpathy: 支持控制前沿节奏 支持 Dario Amodei 的三步走计划

Hacker News 热帖

日期 标题 要点
09-17 Bend – 通过证明阻止 AI 错误的语言 243 points
09-17 CCC 40C3 Model Citizens 328 points
09-17 Show HN: Share your AI Setup 175 points
09-17 Sex, AI, and the Apocalypse 133 points

Benchmark 快照

行业格局

Artificial Analysis / Intelligence

排名 模型 分数
1 Claude Fable 5.1 (Max Effort, Default Fallback) 53.4
2 GPT-6 Astra (max) 52.8
3 GPT-6 Astra (xhigh) 52.5

本期无变动。

LMArena / Overall

排名 模型 分数
1 claude-fable-5 1505.68
2 claude-opus-4-6-high 1504.56
3 claude-opus-4-7-high 1501.75

本期无变动。

干活选型

Artificial Analysis / Agentic

排名 模型 分数
1 Claude Fable 5.1 (Max Effort, Default Fallback) 58.0
2 Claude Opus 5 (Xhigh Effort) 55.5
3 GPT-6 Astra (max) 51.5

本期无变动。

Artificial Analysis / Coding

排名 模型 分数
1 Claude Fable 5.1 (Max Effort, Default Fallback) 81.6
2 Claude Fable 5.1 (Medium Effort, Default Fallback) 77.1
3 Claude Opus 5 (Xhigh Effort) 77.0

本期无变动。

SWE-bench Pro / Public

排名 模型 分数
1 Muse Spark 1.1* 61.5
2 gpt-5.4 (xHigh)* 59.1
3 Muse Spark* 55.0

本期无变动。

SWE-bench Verified

排名 模型 分数
1 Claude 4.5 Opus (scaffold: Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (scaffold: live-SWE-agent) 79.2
3 Doubao-Seed-Code (scaffold: TRAE) 78.8

本期变动(SWE-bench Verified):

模型 变化 原排名→现排名 分数
Claude 3.5 Haiku rank_change 34 → 33 40.6
Claude 4 Sonnet + o4-mini rank_change 10 → 9 74.4
GPT-5 rank_change 9 → 10 74.4
LLama 3.1 70B Critic rank_change 33 → 34 40.6

上述四个模型分数均未变化,排名变动由其他模型出入榜单导致的位移所致。Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位;Claude 3.5 Haiku 与 LLama 3.1 70B Critic 互换第 33/34 位。

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI 发布 Astra for Law,含 26 个合作方插件和 47 个社区插件,且数据隐私为核心特性——这是 OpenAI 首次针对单一行业推出如此深度的垂直产品线,法律领域的高度结构化和保密需求使其成为 AI 垂直化的试金石。

  2. Anthropic 公布 AI 发展节奏三项指标(AI 研发中 AI 参与度、Agent 监督水平、算力分配),并明确呼吁"任何前沿开发者都可以发布相同指标,第三方可验证"——这把透明度从自愿披露推向了行业施压,如果其他实验室不跟进,Anthropic 将在公众信任上获得不对称优势。

  3. Anthropic 生命科学验证计划首次开放 Mythos 模型——Mythos 此前从未对外提供生物领域访问,新增的防护措施表明 Anthropic 在高风险垂直领域采取"定制化安全层 + 受控准入"策略,而非简单开放或封闭。

来源 · 111 条