【Reflection】Beam: 501B 开放权重模型发布
Reflection 发布 501B 参数的开放权重模型 Beam,是目前最大的开放权重模型之一。该项目由前 Google DeepMind 研究员发起,HN 热度 293 points。开放权重模型规模突破 500B 门槛,意味着中小团队可在自有基础设施上部署接近前沿水平的模型,降低对 API 的依赖。
🔗 Beam: Reflection's 501B open-weight model
【Anthropic】Claude Sonnet 5.5 发布
Sonnet 5.5 是 Claude 5.5 家族第二款模型,较 Sonnet 5 性能明显提升,运行速度提高 30% 以上,多数场景成本降低 30%。Opus 5.5 此前已于 9 月 22 日发布,性能对标 Fable 5.1 但成本比 Opus 5 低 40%。5.5 家族正在以更低价格逼近上代旗舰水平。
【OpenAI】DevDay 2026 回顾:GPT-6.1 Sol、dots 等 20+ 项发布
DevDay 2026 发布超过 20 项公告,包括 GPT-6.1 Sol(编码与专业工作模型,价格为 Astra 标准价的 1/5)、dots 主动式助手(跨应用保持上下文、协调 Codex 任务)、以及 Codex Security Cloud 升级(自动扫描 GitHub 仓库、持续审查 commit)。dots 的定位介于用户助手与 agent 编排器之间,与 Codex 形成协同工作流。
【Anthropic】Claude 向警方报告用户日记内容,当事人面临重罪指控
佛罗里达州一女性使用 Claude 撰写日记时表达了对他人的枪击意图,Anthropic 主动向警方报告该内容,当事人现面临重罪指控。HN 热度 517 points。这是 AI 公司主动触发安全报告机制并导致刑事起诉的已知首例,直接冲击"AI 对话隐私性"的用户预期。
🔗 Anthropic reported diary entry to police
【OpenAI】欧盟文本来源规则合规方案
OpenAI 公布其应对欧盟文本来源(text provenance)规则的水印方案,涵盖水印适用范围、检测机制及研究人员访问路径。合规从研究人员准入开始,为后续全面执行铺路。
🔗 Our approach to EU text provenance rules
本期 SWE-bench Verified 排名仅出现 1 个位次的小幅互换(Claude 4 Sonnet + o4-mini 与 GPT-5 互换第 9/10 位,分数均为 74.4 无变化),未达到排名变动≥5 或分数变动≥5% 的重大变动阈值,本期无重大 benchmark 变化需报告。
turn.step hook 新增 serverToolUses 字段| 日期 | 新闻 |
|---|---|
| 10-05 | Our approach to EU text provenance rules — OpenAI 阐述其 EU 文本水印方案:水印适用范围、检测机制,以及为何率先向研究者开放检测权限。 |
| 10-05 | Building advertising for the way people use AI — ChatGPT 推出新型视觉广告格式,扩展测量工具、归因合作与品牌安全功能。 |
| 10-02 | A model guide for the GPT-6 family — 面向初创团队的 GPT-6 选型指南:推理力度调节、提示优化、工具协调与生产部署。 |
| 10-02 | Chatham scales its capital markets expertise with OpenAI — Chatham Financial 使用 Codex 和 GPT-5.6,将交易验证从 30 分钟压缩至 4 分钟以内。 |
| 10-01 | The eternal complement — 探讨 AI 在突破性创意背后的常规执行工作中可能扮演的角色。 |
| 10-01 | How Albertsons Companies is reimagining retail — Albertsons 使用 ChatGPT Enterprise 和 OpenAI API 提升团队效率与购物体验。 |
| 10-01 | The Den frees up 10-15 hours a week — 社交俱乐部 The Den 用 ChatGPT Work 将补助金申请从 3 天缩至 2 小时。 |
| 09-30 | Disrupting a coordinated model-distillation campaign — OpenAI 粉碎了一轮针对受保护模型推理的对抗性蒸馏行动。 |
| 09-30 | Helping small businesses put AI to work — 与 America's SBDC 合作扩展小企业 AI 培训,发布小团队 AI 使用报告。 |
| 09-29 | DevDay 2026 Recap — 超过 20 项公告:GPT-6 Astra、ChatGPT、Codex、API、安全工具等。 |
| 09-29 | Introducing GPT-6.1 Sol — GPT-6.1 Sol:编码、计算机使用和专业工作接近 Astra 水平,API 价格为 Astra 的 1/5。 |
| 09-29 | Introducing dots — Dots 是跨复杂项目和日常任务的主动式助手。 |
| 09-28 | How we will do better for Australia — 就涉及澳大利亚政府网站的事件致歉并公布更强保障措施。 |
| 09-28 | Towards safety cases for frontier AI training — 前沿 AI 训练安全案例早期指南:技术保障、运营实践与对齐事故调查。 |
| 09-28 | The Lenfest Institute grows landmark program — 扩大 Lenfest AI 合作计划:500 万美元资金 + 最高 500 万美元软件额度与工程支持。 |
| 09-28 | Basis completes a tax workbook 2x faster with GPT-6 Astra — GPT-6 Astra 处理 50 标签页税务工作簿速度为 GPT-5.6 Sol 的两倍。 |
| 09-25 | Proaction boosts sales 60% — Proaction 用 Codex、GPT-Live-1 和 GPT-6 Astra 加速车队管理。 |
| 09-25 | Wayfair boosts catalog accuracy — Wayfair 用 OpenAI 模型自动化工单分流并增强数百万商品属性。 |
| 09-23 | Two years of OpenAI Academy — OpenAI Academy 两周年,扩展社区 AI 技能培训。 |
| 09-23 | OpenAI extends cyber access to Ukraine — 将 Daybreak 计划扩展至乌克兰政府,支持民用基础设施网络防御。 |
| 09-23 | Ringg's AI agents resolve up to 65% of customer calls — Ringg 用 GPT-5.6 实现多语言客服代理,成本较 GPT-4.1 降低 90%。 |
| 09-23 | Sam Altman's remarks at the UN Security Council — 讨论 AI 安全、人类控制与国际合作。 |
| 09-23 | Harvey turns legal context into stronger drafts with GPT-6 Astra — GPT-6 Astra 生成更具结构性和上下文感知的法律文书。 |
| 09-23 | invideo improves color grading 3x with GPT-6 Astra — 调色精度提升 3 倍,一天内产出 50 个自定义特效。 |
| 09-23 | Introducing MentalHealthBench — 针对心理健康对话场景的专家评测基准。 |
| 09-23 | ChatGPT Ads expands to Southeast Asia and Taiwan — ChatGPT 广告扩展至东南亚和台湾,覆盖超 60 个国家。 |
| 09-23 | Airbnb widens access to GPT-6 Astra — Airbnb 扩大 GPT-6 Astra 和前沿模型在工程团队中的使用。 |
| 09-23 | Grab and OpenAI bring practical AI skills to Southeast Asia — GO Forward with AI 计划帮助 3 万合作伙伴学习 AI 技能。 |
| 09-22 | Better prompt caching for GPT-6 — GPT-6 改进提示缓存:更高命中率、新诊断工具、显式断点和控制。 |
| 09-22 | Introducing GPT-6 Sol and Luna — GPT-6 Sol 和 Luna:不同能力与成本平衡的前沿模型。 |
| 09-22 | Parallel cuts research time and cost in half with GPT-6 Astra — Parallel 用 GPT-6 Astra 将劳动力市场研究时间和成本均减半。 |
| 日期 | 动态 |
|---|---|
| 10-05 | ChatGPT 移除开发者模式开关,所有用户可直接连接自定义 MCP 服务器 — 路径:plugins → add → create custom MCP server。 |
| 10-05 | 定时任务现可直接编辑模型和推理力度 |
| 10-05 | Tibo:未来 28 天每天 ship 一项面向 Codex/Work 用户的明确改进或完整重置 — 方向聚焦简化、效率和核心功能。 |
| 10-05 | Space 协作功能持续迭代 |
| 10-03 | Agents API 更新:Computer use 一行 API 调用启动浏览器+agent、Bedrock Managed Agents、GPT-6.1 Sol、环境复用、99.97% turn 可靠性 |
| 10-03 | Sam Altman:将宗教力量或人类判断权的让渡归于 AI 模型是真正的安全问题 |
| 10-02 | Sam Altman 确认与 Cerebras 深度合作,推进速度前沿 |
| 10-02 | dots 可跨应用保持上下文、协调 Codex 任务并标记需关注项 |
| 10-01 | dots demo 改进 WiFi 连接 |
| 09-29 | Codex Security Cloud 大升级:Daybreak Blue 默认包含网络能力模型,扫描整个 GitHub 仓库 |
| 09-29 | DevDay 2026 直播 |
| 日期 | 版本 | 变更 |
|---|---|---|
| 10-05 | v2.1.290 | mods 的 turn.step hook 结果新增 serverToolUses:API 自行运行的 advisor 工具调用,含 id、name、input、start/end |
| 10-03 | v2.1.289 | 修复复合 shell 命令嵌套部分的 deny/ask 规则无法覆盖用户安装 mod 审批的问题(受管机器) |
| 10-02 | v2.1.288 | 新增 $.ui.selection() for mods:返回全屏模式下最后选中文本,选中区域在单行内时返回该行 |
| 10-01 | v2.1.287 | Claude Mods 上线:插件可修改更深行为 |
| 09-30 | v2.1.286 | 权限请求堆叠时新增计数显示如 "2 of 5" |
| 日期 | 动态 |
|---|---|
| 10-04 | Demis Hassabis:回顾近期 AI 加速科学成果,含 AlphaGenome Atlas 绘制全基因组 90 亿单字母变异图谱 |
| 10-02 | 2026 年 9 月 Google AI 更新汇总(视频) |
| 10-01 | Project Suncatcher:与 Planet 合作将搭载 4 颗 TPU 的原型卫星送入轨道 |
| 09-30 | Gemini 4 Argon agents 已释放超 300 TiB 内存,C/C++→Rust 迁移达 80 万+行内核代码 — 视频解码器中 3.2 万行 SIMD 代码被安全 Rust 替换,速度提升 2.7 倍 |
| 09-28 | Future Vision XPRIZE 获奖预告片 The Gifted |
| 09-24 | Gemini 3.8 Live with Live Avatar 在 Gemini Enterprise 中全面可用 — 视频头像、流畅对话、工具调用 |
| 09-23 | Google Beam 扩展至新地区、新合作伙伴与客户 |
| 日期 | 动态 |
|---|---|
| 10-02 | DeepSeek Harness 桌面版发布:macOS 和 Windows 已有打包版,Linux 可通过 npm 安装 @deepseek-ai/dsh |
| 日期 | 新闻 |
|---|---|
| 10-05 | Anthropic 向警方报告用户日记内容,佛罗里达女子面临重罪指控 — HN 517 分 |
| 10-05 | Beam: Reflection 的 501B 开源权重模型 — HN 293 分 |
[AA / Intelligence]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Max, Default Fallback) | 57.6 |
| 2 | Claude Fable 5.1 (Max, Default Fallback) | 53.4 |
| 3 | GPT-6 Astra (Max) | 52.7 |
本期无变动。
[LMArena / Overall]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gemini-4-argon-high | 1525.2 |
| 2 | claude-opus-4-6-high | 1504.7 |
| 3 | claude-fable-5-high | 1504.3 |
本期无变动。
[AA / Agentic]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Xhigh) | 55.6 |
| 3 | GPT-6 Astra (Max) | 51.0 |
本期无变动。
[AA / Coding]
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Medium, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Xhigh) | 77.0 |
本期无变动。
[SWE-bench Verified]
| 排名 | 模型(脚手架) | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
本期变动:
| 模型 | 变化 | 前排名 | 现排名 | 分数 |
|---|---|---|---|---|
| Claude 4 Sonnet + o4-mini | ↑ 上升 | 10 | 9 | 74.4 |
| GPT-5 | ↓ 下降 | 9 | 10 | 74.4 |
| Claude 3.5 Haiku | ↑ 上升 | 34 | 33 | 40.6 |
| LLama 3.1 70B Critic | ↓ 下降 | 33 | 34 | 40.6 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
1. Reflection 发布 Beam 501B 开源权重模型 — 一个 501B 参数的开放权重模型在当前格局中属于稀缺事件;如果该模型在后续第三方评测中能接近 Claude Opus 5.5(AA Intelligence 57.6 分)或 GPT-6 Astra(52.7 分)的水平,将显著改变开源前沿的竞争态势。目前尚无独立 benchmark 数据佐证其能力,需观察。
2. Anthropic 向警方报告用户日记内容 — 用户在 Claude 中写入涉及射击的日记内容,Anthropic 主动向警方报告,导致该用户面临重罪指控。这一事件直接展示了 AI 平台内容审核与用户隐私之间的法律边界——Anthropic 选择在用户输入触发潜在暴力威胁时向执法机构披露信息,而这一行为是否在服务条款中有明确授权、以及法院是否采纳该证据,将成为后续类似案件的关键判例。
3. OpenAI 公布 EU 文本水印方案 — 根据欧盟法规要求,OpenAI 将对 AI 生成文本实施水印标记,检测权限率先开放给研究者而非一般公众。这一方案的实际效果取决于水印的鲁棒性(能否经受改写、翻译等变形)以及检测工具是否会向更广泛主体开放——如果仅限研究者使用,对实际内容溯源的覆盖面将有限。