【OpenAI】发布 GPT-6 Sol 和 Luna,API 价格永久降低 50% GPT-6 Sol 和 Luna 继承 GPT-6 Astra 的能力,定位为更快、更经济的模型。相比 5.6 系列前代,智能、编码、对齐全面提升,每 token 价格减半。Lovable 在 0-to-1 构建基准上测得 Sol 比 5.6 Sol 高 6-12%,意图对齐提升 10-15%。Sol 和 Luna 已上线 GitHub Copilot。 原文
【Anthropic】发布 Claude Opus 5.5,成本降低 40% Claude 5.5 系列首个模型,多数任务表现与 Fable 5.1 持平,运行成本比 Opus 5 低 40%,支持 1M 上下文,定价 $4/$20 per Mtok。Sonnet 5.5 和 Haiku 5.5 将在未来几周内推出。Pro/Max/Team 用户五小时用量限额提升,并获得一次性额度重置。 原文
【OpenAI】ChatGPT Voice 大更新:支持插件、接入 GPT-6 全系列 ChatGPT Voice 现可调用邮件、日历、Slack 等插件,由 GPT-6 Astra/Sol/Luna 驱动,并在 ChatGPT Work 网页端和移动端可用,支持语音创建文档、幻灯片、表格。全球同步推送。这意味着用户可通过纯语音完成多步骤办公任务,从调用工具到生成交付物全链路打通。 原文
【Anthropic】Claude 发现新型酶系统,结构类似 CRISPR Claude 在噬菌体 DNA 中发现此前未知的酶系统,其基因旁排列着类似 CRISPR 的重复 DNA 序列。该系统可能具备切割、复制、粘贴 DNA 的能力,但具体功能尚待验证。这是 AI 在基础生物学发现中的标志性案例。 原文
【Google】Gemini 3.8 Flash TTS 发布,登顶 Hume AI 语音基准 Gemini 3.8 Flash 和 Flash-Lite TTS 提供 2,000+ 生产级语音、100 语言支持、语音复制与混音功能,在 Hume AI 语音基准排名第一。 原文
本轮 SWE-bench Verified 排名仅有 1 位的小幅变动(GPT-5 与 Claude 4 Sonnet + o4-mini 互换第 9/10 位,分数不变 74.4),未达到排名变动≥5 或分数变动≥5% 的报告阈值,无重大变化。
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-23 | ChatGPT Voice 支持插件与 GPT-6 全系列 | Voice 可调用邮件/日历/Slack 插件,由 Astra/Sol/Luna 驱动,ChatGPT Work 网页与移动端可用,全球推送 |
| 09-23 | OpenAI Academy 两周年 | 回顾两年 AI 技能社区教育,扩展更多社区 |
| 09-23 | OpenAI 将 cyber 访问扩展至乌克兰 | Daybreak 项目向乌克兰政府开放,支持民用基础设施网络防御 |
| 09-23 | Sam Altman 在联合国安理会发言 | 讨论 AI 安全、人类控制权与国际合作 |
| 09-23 | Harvey 用 GPT-6 Astra 生成法律文书 | Astra 输出更结构化、上下文感知的法律文件 |
| 09-23 | invideo 用 GPT-6 Astra 将调色效率提升 3 倍 | 色彩校正与调色提升 3 倍,一天产出 50 个自定义特效 |
| 09-23 | Ringg AI 客服解决率最高 65% | 使用 GPT-5.6 多语言客服覆盖语音/聊天/WhatsApp/Web,成本比 GPT-4.1 低 90% |
| 09-23 | MentalHealthBench 发布 | 专家参与设计的心理健康对话 AI 评测基准 |
| 09-23 | Airbnb 扩大 GPT-6 Astra 使用范围 | 工程团队用于修 Bug、系统设计与加速交付 |
| 09-23 | Grab 与 OpenAI 在东南亚推广 AI 技能 | GO Forward with AI 计划帮助 3 万合作伙伴 |
| 09-22 | GPT-6 Prompt Caching 改进 | 更高缓存命中率、新诊断工具、显式断点与控制,降低延迟与成本 |
| 09-22 | GPT-6 Sol 和 Luna 发布 | 基于 Astra 能力的更快更便宜模型;API 价格比 5.6 系列降 50%;HN 1730 分热帖 |
| 09-22 | Parallel 用 GPT-6 Astra 研究成本与时间均减半 | 劳动力市场数据研究时间/成本较前代模型各降 50% |
| 09-22 | OpenAI 发布第三方评估优先事项与原则 | 为前沿模型与安全措施制定独立安全评估框架 |
| 09-21 | Higgsfield AI 用 Astra 一天内上线视频功能 | 降低小企业视频广告制作门槛 |
| 09-21 | 数学与 AI 顾问组成立 | 独立顾问组指导 AI 数学成果的评审与传播 |
| 09-21 | 构建下一代 AI 标准 | 呼吁全球协调评估、报告与治理 |
| 09-21 | OpenAI Academy 新学习路径 | 面向员工、开发者、领导者、教育者与学生的路径 |
开发者动态(x-openai-devs 摘要):
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-23 | Codex 构建 iOS 游戏 | Gavin Shapiro 用 Codex 将 threejs Web 体验转为原生 iOS 应用 |
| 09-22 | GitHub Copilot 接入 GPT-6 Sol 和 Luna | 两款模型在 Copilot 中 GA |
| 09-22 | Lovable 用 GPT-6 Sol 构建 | 0-to-1 构建基准比 5.6 Sol 高 6–12%,意图对齐提升 10–15% |
| 09-22 | Tesseract:为 AI 代理重建 AE/Premiere | Mirage 推出视频创作套件,代理可直接编辑/渲染 |
Sam Altman 发言(09-22):
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-23 | Claude 发现新型酶系统 | 在噬菌体 DNA 中发现未知酶系统,旁侧有类似 CRISPR 的重复 DNA 阵列;HN 457 分 |
| 09-23 | 刚果 Ebola 疫情中全球卫生组织使用 Claude | CEPI、WHO AFRO、INRB 用 Claude 加速应对异常 Ebola 变种 |
| 09-22 | Claude Opus 5.5 发布 | Claude 5.5 系列首发模型;多数任务对标 Fable 5.1,成本比 Opus 5 低 40% |
| 09-22 | Claude Code v2.1.280 | 内置 Claude Opus 5.5(claude-opus-5-5),1M 上下文,$4/$20 per Mtok,缓存读 $0.20/Mtok |
| 09-18 | 与 Accenture 合作独立前沿 AI 评估 | 双方各投入至少 $10 亿,五年内建设评估能力 |
| 09-17 | 发布 AI 发展速度三项指标 | AI 做 R&D 比例、代理监督程度、算力分配——Anthropic 内部快照 |
| 09-17 | 生命科学验证计划开放申请 | 生命科学专业人士首次可用 Mythos 模型,附新型生物安全防护 |
Claude Code 版本更新:
| 日期 | 版本 | 要点 |
|---|---|---|
| 09-23 | v2.1.281 | 支持 Claude Desktop 新版密钥的 desktop 策略块,含 blockReadsOutsideWorkingDirectories 和 disableBypassPermissionsMode |
| 09-22 | v2.1.280 | Opus 5.5 成为默认 Opus 模型 |
| 09-19 | v2.1.278 | auto mode 改用服务端分类器,不收取分类器费用;支持 Bedrock/Vertex/Foundry |
| 09-18 | v2.1.277 | 新增 AGENTS.md 支持(无 CLAUDE.md 时读取) |
| 09-18 | v2.1.276 | 修复代理/网关下 400 错误(2.1.275 回归) |
Claude 团队动态:
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-23 | claude.ai 两周内提速 3 倍的技术分享 | Boris Cherny 转发 ClaudeDevs 博客,含提示词与方法 |
| 09-22 | Alex Albert:Opus 5.5 体验如"一路绿灯" | 更聪明、更清晰、更快、更便宜 |
| 09-22 | Pro/Max/Team 五小时用量上限提升+重置额度 | Sonnet 5.5 和 Haiku 5.5 未来几周推出 |
| 09-17 | Mike Krieger 介绍 Claude Desktop Projects 功能 | 协调者 Claude 快速响应,并行启动多项工作 |
| 09-16 | Claude Docs/Slides/Design 全面上线 | 重构 Artifacts 平台,可编辑/下载 |
| 日期 | 标题 | 要点 |
|---|---|---|
| 09-23 | Gemini 3.8 Flash 和 Flash-Lite TTS | SOTA TTS 模型;2000+ 生产级语音、语音复制、100 种语言;Hume AI 语音榜 #1 |
| 09-23 | Google Beam 扩展新区域与合作伙伴 | Beam 技术推广至更多地区 |
| 09-18 | AI 与 Economy 研究团队引入新专家 | 扩充研究力量 |
| 09-17 | 让全球数据更易探索 | UN System Data Commons 平台 |
| 09-16 | DeepMind Institute 成立 | Shane Legg:AGI 已在地平线上,需深入理解其影响 |
| 09-16 | Anca Dragan:应保留 Chain of Thought 可监控性 | CoT 不会自然消失,有设计自主权 |
| 日期 | 标题 | 热度 |
|---|---|---|
| 09-22 | GPT-6 Sol and Luna | 1730 分 |
| 09-23 | Claude 发现新型酶系统 | 457 分 |
| 09-23 | Claude Code 仅在遥测开启时读取 AGENTS.md(已修复) | 443 分 |
| 09-23 | Gemini 3.8 text-to-speech | 247 分 |
| 09-23 | Stripe Knowledge AI Platform | 172 分 |
| 日期 | 人物 | 要点 |
|---|---|---|
| 09-24 | Simon Willison | 用 ChatGPT iPhone 语音功能通过 datasette-mcp 对话博客数据库 |
| 09-22 | Simon Willison | 撰文对比 Opus 5.5、GPT-6 Sol、Luna,含不同模型生成鹈鹕网格对比 |
| 09-22 | Tibo(OpenAI) | Sol/Luna 是全面显著提升,尤其写作质量;API 永久降价 50%;Plus/Pro/Business 用户额度重置 |
| 09-22 | gdb(OpenAI) | Sol/Luna 继承 Astra 的 SOTA 专业工作/事实性/编码/计算机操控能力 |
| 09-23 | swyx | 转发 TypeSafe CEO Diogo Almeida 观点:有十亿也不会预训练,而是拼接现有栈 |
aa / intelligence
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Adaptive Reasoning, Max Effort) | 57.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 53.4 |
| 3 | GPT-6 Astra (max) | 52.7 |
lmarena / overall
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1505.68 |
| 2 | claude-opus-4-6-high | 1504.56 |
| 3 | claude-opus-4-7-high | 1501.75 |
aa / agentic
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 57.9 |
| 2 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 55.6 |
| 3 | GPT-6 Astra (max) | 51.0 |
aa / coding
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Adaptive Reasoning, Max Effort) | 81.6 |
| 2 | Claude Fable 5.1 (Adaptive Reasoning, Medium Effort) | 77.1 |
| 3 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
swebench_verified / Verified
本期有变动:
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude 3.5 Haiku | ↑ | 34 → 33 | 40.6(不变) |
| Claude 4 Sonnet + o4-mini | ↑ | 10 → 9 | 74.4(不变) |
| GPT-5 | ↓ | 9 → 10 | 74.4(不变) |
| LLama 3.1 70B Critic | ↓ | 33 → 34 | 40.6(不变) |
当前 Top 3(swebench_verified Verified):
| 排名 | 模型(含 scaffold) | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
GPT-6 Sol 和 Luna 的定价策略正在改变 API 经济学。 OpenAI 将 Sol 和 Luna 的 API 价格比 5.6 系列永久下调 50%,同时 Tibo 称写作与整体质量"全面显著提升";Simon Willison 指出 Luna 单价已是 5.6 Luna 的一半——此前 5.6 Luna 已被他认为"便宜得惊人"。叠加 GPT-6 Prompt Caching 改进(更高命中率、显式断点),OpenAI 正在用价格+基础设施双管齐下扩大单用户调用量。Sam Altman 明确称"按 per-task 定价无可竞争",这直接对标 Anthropic Opus 5.5 的 $4/$20 per Mtok 定价。
Claude 发现新型酶系统标志着 AI 从辅助工具到科学发现者的角色转变。 该系统是在噬菌体 DNA 中由 Claude 自主发现的,旁侧带有类似 CRISPR 的重复 DNA 阵列——CRISPR 曾因可编程 DNA 剪切能力而革新医学。Anthropic 明确表示尚不理解该系统功能,但历史上此类发现(如 CRISPR)催生了基因药物。同一周内 Claude 还被用于刚果 Ebola 疫情响应,这表明 Anthropic 正系统性地展示 Claude 在前沿科学中的发现能力。
Claude Opus 5.5 以 57.6 分登顶 aa/intelligence,直接卡位 GPT-6 Astra(52.7 分)之上。 该模型多数任务对标 Fable 5.1(aa/intelligence 第二名 53.4 分),但成本比前代 Opus 5 低 40%,Claude Code v2.1.280 已将其设为默认 Opus 模型。结合五小时用量上限提升和额度重置,Anthropic 正在通过"旗舰性能 + 降本 + 放量"三连应对 OpenAI 同日的 Sol/Luna 发布。