【OpenAI】Introducing Astra for Law OpenAI 发布面向法律行业的产品 Astra for Law,基于 GPT-6 Astra,提供定制化律所工作流、法律数据源连接及法律级保密控制。配套 26 个合作伙伴插件和 47 个社区插件。法律行业高度依赖数据隐私和精确性,OpenAI 将保密控制作为核心功能而非附加项,直接对标传统法律科技厂商的护城河。
【Anthropic】发布 AI 发展速度三项测量指标 Anthropic 发布三项内部指标衡量 AI 发展节奏:AI 研发中由 AI 完成的比例、AI agent 被监督的程度、算力分配方式。Anthropic 同时公布了自身数据的快照,并呼吁其他前沿实验室发布相同指标、允许第三方验证。
【Anthropic】生命科学验证计划开放申请,首次开放 Mythos 模型 Anthropic 开放 Life Sciences Verification Program 申请,生命科学专业人员可首次使用 Mythos 模型进行生物学相关工作,配套新的安全防护机制。项目以 beta 形式向学术实验室、初创公司、药企等团队开放,后续将扩展至个人 Pro 和 Max 计划。
Life Sciences Verification Program
【OpenAI】发布模型失对齐报告框架 OpenAI 发布模型失对齐(model misalignment)追踪、调查和披露框架,设定公开披露的标准和时间线,同时公布过去六个月观察到的六起失对齐行为报告。框架明确:即使尚未完全解释或缓解,也将按时间线披露。
【Anthropic】Claude Code Projects 功能上线 Claude Code 推出 Projects 功能:用户在一个对话中描述任务,Claude 自动拆分为并行线程,线程间传递上下文,关闭笔记本后继续运行。目前面向部分 Pro 和 Max 用户 beta 开放。Databricks 同步向约 3500 名工程师全面部署 GPT-6 Astra,反馈显示其在复杂系统设计任务上明显优于 Opus 5 和 Sol 5.6。
本周 SWE-bench Verified 排名仅出现 1 位次小幅变动(Claude 4 Sonnet + o4-mini 由第 10 升至第 9,GPT-5 由第 9 降至第 10,分数均为 74.4% 未变),未达到排名变动≥5 或分数变动≥5% 的报告门槛,本周无重大 benchmark 变化。
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-17 | Introducing Astra for Law | 面向律所的垂直产品,基于 GPT-6 Astra,含法律级数据隐私控制 |
| 09-17 | How Cooley is accelerating IPO work with ChatGPT | Cooley 律所基于 ChatGPT Work 构建 GO Public 工具,用于 IPO 流程 |
| 09-16 | Our framework for reporting model misalignment | 发布模型失对齐报告框架,含 6 份过去半年训练/评估中观察到的异常行为报告 |
| 09-16 | Reimagining advertising with AI | 推出 Sponsored Agents、营销工具,集成 HubSpot 和 Shopify |
| 09-16 | How to connect AI usage to business value | ChatGPT Work 和 Codex 分析帮助团队理解 AI 使用与支出 |
| 09-16 | Helping older adults use AI in everyday life | OpenAI 与 AARP 合作为 10 个城市 1,000 名老年人提供免费 ChatGPT 培训 |
| 09-16 | How workers are unlocking new ways of working | OpenAI 经济研究显示 AI 如何改变工人角色与新工作活动 |
| 09-14 | How Fyxer built an AI executive assistant | Fyxer 使用 OpenAI 模型、微调与记忆来管理收件箱和代写邮件 |
| 09-14 | Perplexity trusts GPT-6 Astra with end-to-end systems | Perplexity 用 Astra 写通讯、改代码、监控生产系统,检查频率大幅降低 |
| 09-11 | Cognition helps Devin test its own work with GPT‑6 Astra | GPT-6 Astra 提升 Devin 自测软件能力 |
| 09-11 | Rapidly scaling online storage to serve over 1 billion ChatGPT users | Habitat 从 Python 库演变为全球分布式存储平台,服务 10 亿用户、22M QPS |
| 09-10 | Introducing the Agents API | 基于 Codex harness 的托管云 Agent 服务,支持长会话和工具调用 |
| 09-10 | Build more natural voice experiences with GPT‑Live‑1 | 全双工语音对话 API,支持自定义声音和电话 |
| 09-10 | Now everyone can put data to work | ChatGPT Work 新增 Data agent,连接企业数据源生成仪表板 |
| 09-10 | Introducing ChatGPT for Financial Services | 内置金融数据 + GPT-6 Astra,面向研究、建模和客户材料 |
| 09-10 | Expanding AI access for US governments | 联邦/州/地方/部落政府 $0 许可费、50% 使用折扣 |
| 09-09 | GPT-6 Astra: The next generation in intelligence for work | OpenAI 最强企业模型,高级推理 + 计算机使用 |
| 09-09 | Paul Christiano joins OpenAI Foundation Board | 对齐研究专家加入基金会董事会和安全委员会 |
| 09-09 | The AI policy window is open. We need to act. | Chris Lehane 呼吁在政策窗口期建立安全标准和持久政策 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-17 | OpenAI Devs: Codex 语音 Agent | Codex 语音代理由 GPT-Live-1 驱动,可手机远程连接电脑 |
| 09-17 | OpenAI Devs: Product Hunt Astra 挑战赛 | 截止 09-18 午夜 PT,前五名获 $10K API 额度 + ChatGPT Pro |
| 09-17 | gdb: Astra for Law 细节 | 含 26 个合作方插件和 47 个社区法律插件 |
| 09-16 | gdb: Databricks 全员部署 Astra | ~3500 工程师全面部署 Astra,复杂任务超越 Opus 5 和 Sol 5.6 |
| 09-16 | gdb: Shopify 广告上线 | Shopify 商户产品目录直接接入 ChatGPT 广告 |
| 09-16 | Sam Altman: 延迟发布 | 本周原定发布推迟到下周 |
| 09-16 | OpenAI Devs: Unity 官方 Codex 插件 | Unity 首方集成 Codex,引擎专家维护 |
| 09-16 | OpenAI: 模型失对齐框架 | 六份失对齐行为报告,建立公开披露标准 |
| 09-14 | Sam Altman: AI 两大风险 | 失控与权力过度集中是需要避免的两种路径 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-17 | Anthropic: 衡量 AI 发展节奏 | 公布三项指标:AI R&D 中 AI 参与度、Agent 监督水平、算力分配;呼吁所有前沿实验室公开同样数据 |
| 09-17 | Anthropic: 生命科学验证计划开放申请 | 生物领域专业人士可使用包括 Mythos 在内的模型,新增生物安全防护措施 |
| 09-17 | Boris Cherny: Projects 上线 | Claude Code 新增 Projects,一个对话自动拆分并行线程,关机后继续;beta 面向 Pro/Max |
| 09-17 | Mike Krieger: Projects 体验 | 协调型 Claude 快速响应,同时后台并行多线程工作 |
| 09-16 | Mike Krieger: Claude Docs/Slides/Design | 每个对话中可用文档、幻灯片和设计工具,基于改版 Artifacts 平台 |
| 09-16 | Alex Albert: Cowork 与 Chat 合并 | Claude Cowork 和 Chat 统一为一个 Claude,两到三周内推送给 Pro/Max |
| 09-12 | Anthropic: Dario 呼吁控制前沿节奏 | Dario Amodei 发文,Anthropic 承诺向第三方评估者提供永久员工级系统访问 |
| 09-10 | Anthropic: 威胁情报报告 | 最详细的威胁情报报告:网络攻击、影响力操作、监控、生物、武器,全部已阻止 |
| 09-04 | Anthropic: Claude 完成费马大定理形式化证明 | 超过 1300 万行 Lean 代码,史上最大 Lean 证明 |
| 版本 | 日期 | 要点 |
|---|---|---|
| v2.1.275 | 09-17 | Gateway 登录时显示已登录账户并需确认 |
| v2.1.274 | 09-17 | 内存使用危急时显示可见警告及释放/重启步骤 |
| v2.1.273 | 09-15 | 新增 5 个 LLM Gateway 请求头,CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 开启 |
| v2.1.272 | 09-15 | Bug 修复和可靠性改进 |
| v2.1.271 | 09-14 | Remote sessions 新增 fast 模式 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-17 | Making global data easier to explore | Google 推出联合国系统数据共享平台 |
| 09-16 | Shane Legg: DeepMind Institute | 创立 DeepMind Institute 研究 AGI 社会影响 |
| 09-16 | Demis Hassabis: 保留推理可监控性 | 呼吁有意保留 Chain of Thought 透明性 |
| 09-15 | AI for Societal Impact | AI 社会影响力项目合集 |
| 09-15 | New insights from Google's AI & Economy ATLAS | AI 与经济 Atlas v1.0 |
| 09-15 | AI for everyone in every language | 多语言 AI 普惠 |
| 09-14 | DevFest is back | Google Developer Groups DevFest 2026 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 09-17 | swyx: AI 自动化 80% GDP 的瓶颈 | 瓶颈在供给端(芯片和内存),而非需求 |
| 09-16 | Simon Willison: 通用 Agent 竞赛 | OpenAI 将 Codex 桌面端改名 ChatGPT,各家都在争做通用 Agent |
| 09-12 | Karpathy: 支持控制前沿节奏 | 支持 Dario Amodei 的三步走计划 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-17 | Bend – 通过证明阻止 AI 错误的语言 | 243 points |
| 09-17 | CCC 40C3 Model Citizens | 328 points |
| 09-17 | Show HN: Share your AI Setup | 175 points |
| 09-17 | Sex, AI, and the Apocalypse | 133 points |
Artificial Analysis / Intelligence
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max Effort, Default Fallback) | 53.4 |
| 2 | GPT-6 Astra (max) | 52.8 |
| 3 | GPT-6 Astra (xhigh) | 52.5 |
本期无变动。
LMArena / Overall
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1505.68 |
| 2 | claude-opus-4-6-high | 1504.56 |
| 3 | claude-opus-4-7-high | 1501.75 |
本期无变动。
Artificial Analysis / Agentic
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max Effort, Default Fallback) | 58.0 |
| 2 | Claude Opus 5 (Xhigh Effort) | 55.5 |
| 3 | GPT-6 Astra (max) | 51.5 |
本期无变动。
Artificial Analysis / Coding
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max Effort, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Medium Effort, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Xhigh Effort) | 77.0 |
本期无变动。
SWE-bench Pro / Public
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Muse Spark 1.1* | 61.5 |
| 2 | gpt-5.4 (xHigh)* | 59.1 |
| 3 | Muse Spark* | 55.0 |
本期无变动。
SWE-bench Verified
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (scaffold: live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
本期变动(SWE-bench Verified):
| 模型 | 变化 | 原排名→现排名 | 分数 |
|---|---|---|---|
| Claude 3.5 Haiku | rank_change | 34 → 33 | 40.6 |
| Claude 4 Sonnet + o4-mini | rank_change | 10 → 9 | 74.4 |
| GPT-5 | rank_change | 9 → 10 | 74.4 |
| LLama 3.1 70B Critic | rank_change | 33 → 34 | 40.6 |
上述四个模型分数均未变化,排名变动由其他模型出入榜单导致的位移所致。Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位;Claude 3.5 Haiku 与 LLama 3.1 70B Critic 互换第 33/34 位。
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI 发布 Astra for Law,含 26 个合作方插件和 47 个社区插件,且数据隐私为核心特性——这是 OpenAI 首次针对单一行业推出如此深度的垂直产品线,法律领域的高度结构化和保密需求使其成为 AI 垂直化的试金石。
Anthropic 公布 AI 发展节奏三项指标(AI 研发中 AI 参与度、Agent 监督水平、算力分配),并明确呼吁"任何前沿开发者都可以发布相同指标,第三方可验证"——这把透明度从自愿披露推向了行业施压,如果其他实验室不跟进,Anthropic 将在公众信任上获得不对称优势。
Anthropic 生命科学验证计划首次开放 Mythos 模型——Mythos 此前从未对外提供生物领域访问,新增的防护措施表明 Anthropic 在高风险垂直领域采取"定制化安全层 + 受控准入"策略,而非简单开放或封闭。