【Mistral】Mistral Large 4 发布:1T 参数开源多模态模型
Mistral 发布 Large 4(代号 Le Chonk),1T 总参数、49B 活跃参数,原生多模态,在聚合基准上成为美国和欧洲最佳开源权重模型。在网络安全、制造和金融等关键场景达到 SOTA。HN 热度 1571 点,为近期开源模型发布中关注度最高的一次。
【OpenAI】公布数学领域 AI 进展,Sam Altman 称"进入发现新时代"
OpenAI 公布内部前沿模型在数学开放问题上的新结果,并同步发布 Lean 证明形式化及研究细节到 GitHub。Sam Altman 在 X 上转发并称"我们正在进入一个发现的新时代"。HN 讨论 311 点。
🔗 Sharing AI progress in mathematics
【OpenAI】Decisions API 公开测试,比 GPT-6 Luna 快 10 倍
Decisions API 现向所有开发者开放公测,让应用在近实时内选择正确的模型、工具或动作。该 API 决策速度比通过 Responses API 调用 GPT-6 Luna 快 10 倍,成本接近一个轻量分类器。测试中在页面变更分类任务上达到 88.8% AUPRC。这可能降低实时路由和分类场景的调用成本一个数量级。
【Anthropic】扩大网络安全验证计划,开放最强模型给安全从业者
Anthropic 扩展 Cyber Verification Program,经验证的安全专业人士可访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,含面向防御工作的安全保障。同时开放新层级以授权渗透测试和红队等进攻性工作。
【Google】Nano Banana 2.1 图像生成模型发布
Google 推出 Nano Banana 2.1,在视觉设计、蒙版编辑和主体一致性方面较前代显著提升,价格更低。已在 API、AI Studio 和 Gemini 应用中可用。
本期 SWE-bench Verified 排名变动均为 1 位(Claude 4 Sonnet + o4-mini 升至第 9、GPT-5 降至第 10),分数无变化,未达到"排名变动≥5 或分数变动≥5%"的报告阈值,本期无重大 benchmark 变化。
| 日期 | 新闻 | 要点 |
|---|---|---|
| 10-07 | We are entering a new era of discovery now | Sam Altman 转发 OpenAI 数学进展,称正在进入发现新时代 |
| 10-06 | Atlassian and OpenAI expand partnership | 将前沿模型接入企业知识,帮助团队规划、构建和交付工作 |
| 10-06 | How Jump Trading is scaling quant research with ChatGPT | Jump Trading 用 OpenAI 扩展量化研究,长时 AI 工作流结合多数据源与人工审核 |
| 10-06 | Sharing AI progress in mathematics | 内部前沿模型在开放数学问题上取得新结果,公开 Lean 证明形式化与研究细节 |
| 10-06 | Advancing computer use with Ironclad | OpenAI 与 Ironclad 在合同工作流上训练和评估 AI agent |
| 10-05 | Our approach to EU text provenance rules | OpenAI 阐述欧盟文本水印方案:水印适用范围、检测方式,研究者优先访问 |
| 10-05 | Building advertising for the way people use AI | ChatGPT 推出新视觉广告格式,扩展衡量工具和品牌适配 |
| 10-02 | A model guide for the GPT-6 family | 指导初创团队选择 GPT-6 模型、调整推理力度、优化 prompt |
| 10-02 | Chatham scales its capital markets expertise with OpenAI | Chatham Financial 用 Codex 和 GPT-5.6 将交易验证从 30 分钟压缩到 4 分钟以内 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 10-06 | Decisions API now in public beta | 开发者可用 Decisions API 近实时选择模型/工具/动作,比 GPT-6 Luna 快 10 倍;已有实测 88.8% AUPRC 页面变更分类 |
| 10-06 | Talk to Codex | Codex 支持语音交互 |
| 10-05 | Custom MCP servers without developer mode | ChatGPT 所有用户可直接在 Plugins → Add → Create Custom MCP Server 连接 MCP 服务器 |
| 10-05 | Edit model/reasoning effort of scheduled tasks | 计划任务可直接在 Edit Task 弹窗中修改模型和推理力度 |
| 10-03 | Agents API: Computer use with 1 API call | Agents API 新增 Computer use(1 次调用启动浏览器+agent)、Bedrock Managed Agents(GPT-6.1 Sol)、环境尺寸选择、环境跨会话复用等;99.97% 轮次可靠性 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 10-06 | Cyber Verification Program expanded | 安全专业人士可访问 Claude Mythos 5.1、Opus 5.5、Sonnet 5.5;新增授权进攻性工作层级(渗透测试、红队) |
| 10-06 | Claude now works inside Google Docs, Sheets, and Slides | Claude 在 Google Workspace 侧边栏读取并就地编辑文件,每次编辑可审批 |
| 10-06 | Claude Startups program expanding | 创始人可获一年 Claude Team、API credits、工具优惠及 Applied AI 团队 office hours |
| 10-06 | Claude Code cloud sessions field guide | 七种适合云会话的工作流及 GitHub 连接指南 |
| 10-06 | Claude Code v2.1.292 | claude plugin install 新增 --marketplace 参数 |
| 10-06 | Claude Code v2.1.291 | 修复 2.1.290 云会话权限提示丢失的回归 |
| 10-06 | Claude Code v2.1.290 | mod 的 turn.step hook 新增 serverToolUses 返回值 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 10-06 | Nano Banana 2.1 | 图像生成与编辑升级,质量提升、bug 修复、价格下调;API / AI Studio / Gemini 均可用 |
| 10-06 | Fleming Initiative: AI for antimicrobial resistance | Google DeepMind 支持的三年项目将开发评估 AI 抗菌耐药性的方法和标准 |
| 10-06 | Demis Hassabis on John Urschel | 前 NFL 球员 John Urschel 协助解决高斯消元法长期悬而猜想 |
| 10-02 | September AI updates recap | 9 月 AI 更新视频汇总 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 10-06 | Mistral Large 4 ("Le Chonk") | 1T 参数、49B 激活、原生多模态;号称欧美最佳开源权重模型;网络安全、制造、金融等关键负载达 SOTA;HN 1571 分 |
| 日期 | 新闻 | 要点 |
|---|---|---|
| 10-02 | DeepSeek Harness desktop | macOS / Windows 桌面版发布,Linux 可从 npm @deepseek-ai/dsh 获取 |
| 日期 | 来源 | 要点 |
|---|---|---|
| 10-07 | Simon Willison | 发布 LLM 插件支持 OpenAI Decisions API(基于 GPT-6 Luna 的 Jev-clone 决策模型) |
| 10-06 | Karpathy / swyx | swyx 在 AI:AM 讨论 Astra 作为"全能 AI 工程师"($6/小时)及 Cursor → SpaceX 等话题 |
| 10-02 | Karpathy | "Land or Water?" eval:给 LLM 经纬度文本,16,200 次查询绘制图像,模型确实"知道"地理 |
| 10-06 | HN: OpenTPU | 开源 AI 加速器,由 AI 设计;HN 218 分 |
| 10-06 | HN: EmbeddingGemma 2 | Google 开源轻量多模态嵌入模型;HN 207 分 |
AA Intelligence(综合智能)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5.5 (Max, Default Fallback) | 57.6 |
| 2 | Claude Fable 5.1 (Max, Default Fallback) | 53.4 |
| 3 | GPT-6 Astra (Max) | 52.7 |
LMArena Overall
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Gemini 4 Argon High | 1525.2 |
| 2 | Claude Opus 4-6 High | 1504.7 |
| 3 | Claude Fable 5 High | 1504.3 |
本期 LMArena 排名变动:Gemini 4 Argon High 居首,Claude 三款模型占据 2-4 位。
AA Agentic(Agent 能力)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 57.9 |
| 2 | Claude Opus 5 (Xhigh) | 55.6 |
| 3 | GPT-6 Astra (Max) | 51.0 |
AA Coding(编码能力)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5.1 (Max, Default Fallback) | 81.6 |
| 2 | Claude Fable 5.1 (Medium, Default Fallback) | 77.1 |
| 3 | Claude Opus 5 (Xhigh) | 77.0 |
SWE-bench Verified
| 排名 | 模型(脚手架) | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus (Sonar Foundation Agent) | 79.2 |
| 2 | Claude 4.5 Opus medium (live-SWE-agent) | 79.2 |
| 3 | Doubao-Seed-Code (TRAE) | 78.8 |
SWE-bench Verified 本期变化:
| 模型 | 变化 | 前排名 → 现排名 | 分数 |
|---|---|---|---|
| Claude 3.5 Haiku | rank_change | 34 → 33 | 40.6(不变) |
| Claude 4 Sonnet + o4-mini | rank_change | 10 → 9 | 74.4(不变) |
| GPT-5 | rank_change | 9 → 10 | 74.4(不变) |
| LLama 3.1 70B Critic | rank_change | 33 → 34 | 40.6(不变) |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
OpenAI Decisions API 公开测试 — 该 API 号称比 GPT-6 Luna 快 10 倍做出模型/工具/动作选择,而开发者 Ethan Kam 实测在页面变更分类上达到 88.8% AUPRC,说明其定位不是替代通用 LLM 推理,而是用极低成本替代"需要轻量分类器但又想用前沿智能"的场景。如果延迟和成本数据经独立验证属实,这会直接挤压传统小模型微调分类器的生存空间。
Mistral Large 4 以 1T 参数 + 开源权重入场 — 该模型 49B 激活、原生多模态,且声称在网络安全、制造、金融等负载上达 SOTA。结合 HN 1571 分的高热度,说明开源社区对"大参数 + 稀疏激活"路线仍有强烈兴趣;但材料中未提供独立 benchmark 分数,其 SOTA 声称尚需验证。
OpenAI 发布数学前沿结果 — OpenAI 公开了内部前沿模型在开放数学问题上的新结果并附带 Lean 证明形式化和 GitHub 研究细节,Sam Altman 同步发文称"进入发现新时代"。这是继 Anthropic 的 Claude 九圈计算之后,另一家头部实验室将 AI 推向前沿科研的具体信号,且 OpenAI 选择以可验证的形式(Lean 证明)公开,比纯博客宣称更具可信度。