← 返回列表
SILASCODING · AI 情报

AI 日报 2026-10-07

2026-10-07 08:48 CST
快速版 完整版

核心速览

【Mistral】Mistral Large 4 发布:1T 参数开源多模态模型

Mistral 发布 Large 4(代号 Le Chonk),1T 总参数、49B 活跃参数,原生多模态,在聚合基准上成为美国和欧洲最佳开源权重模型。在网络安全、制造和金融等关键场景达到 SOTA。HN 热度 1571 点,为近期开源模型发布中关注度最高的一次。

🔗 Mistral Large 4


【OpenAI】公布数学领域 AI 进展,Sam Altman 称"进入发现新时代"

OpenAI 公布内部前沿模型在数学开放问题上的新结果,并同步发布 Lean 证明形式化及研究细节到 GitHub。Sam Altman 在 X 上转发并称"我们正在进入一个发现的新时代"。HN 讨论 311 点。

🔗 Sharing AI progress in mathematics


【OpenAI】Decisions API 公开测试,比 GPT-6 Luna 快 10 倍

Decisions API 现向所有开发者开放公测,让应用在近实时内选择正确的模型、工具或动作。该 API 决策速度比通过 Responses API 调用 GPT-6 Luna 快 10 倍,成本接近一个轻量分类器。测试中在页面变更分类任务上达到 88.8% AUPRC。这可能降低实时路由和分类场景的调用成本一个数量级。

🔗 Decisions API 公告


【Anthropic】扩大网络安全验证计划,开放最强模型给安全从业者

Anthropic 扩展 Cyber Verification Program,经验证的安全专业人士可访问 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,含面向防御工作的安全保障。同时开放新层级以授权渗透测试和红队等进攻性工作。

🔗 Cyber Verification Program


【Google】Nano Banana 2.1 图像生成模型发布

Google 推出 Nano Banana 2.1,在视觉设计、蒙版编辑和主体一致性方面较前代显著提升,价格更低。已在 API、AI Studio 和 Gemini 应用中可用。

🔗 Nano Banana 2.1


重大 Benchmark 变化

本期 SWE-bench Verified 排名变动均为 1 位(Claude 4 Sonnet + o4-mini 升至第 9、GPT-5 降至第 10),分数无变化,未达到"排名变动≥5 或分数变动≥5%"的报告阈值,本期无重大 benchmark 变化。

快速预览

  • OpenAI Decisions API 进入公开测试,决策速度比 GPT-6 Luna 快 10 倍,已有开发者实测 88.8% AUPRC 页面变更分类
  • Mistral 发布 Large 4("Le Chonk"),1T 参数、49B 激活、原生多模态,HN 热度 1571 分
  • OpenAI 发布数学前沿模型新结果并公开 Lean 证明,Sam Altman 称"进入发现新时代"
  • Anthropic 扩展网络安全验证计划,开放 Claude Mythos 5.1 / Opus 5.5 / Sonnet 5.5 供安全专业人士使用
  • Google 发布 Nano Banana 2.1 图像生成模型,API、AI Studio、Gemini 均已可用

新闻

OpenAI

日期 新闻 要点
10-07 We are entering a new era of discovery now Sam Altman 转发 OpenAI 数学进展,称正在进入发现新时代
10-06 Atlassian and OpenAI expand partnership 将前沿模型接入企业知识,帮助团队规划、构建和交付工作
10-06 How Jump Trading is scaling quant research with ChatGPT Jump Trading 用 OpenAI 扩展量化研究,长时 AI 工作流结合多数据源与人工审核
10-06 Sharing AI progress in mathematics 内部前沿模型在开放数学问题上取得新结果,公开 Lean 证明形式化与研究细节
10-06 Advancing computer use with Ironclad OpenAI 与 Ironclad 在合同工作流上训练和评估 AI agent
10-05 Our approach to EU text provenance rules OpenAI 阐述欧盟文本水印方案:水印适用范围、检测方式,研究者优先访问
10-05 Building advertising for the way people use AI ChatGPT 推出新视觉广告格式,扩展衡量工具和品牌适配
10-02 A model guide for the GPT-6 family 指导初创团队选择 GPT-6 模型、调整推理力度、优化 prompt
10-02 Chatham scales its capital markets expertise with OpenAI Chatham Financial 用 Codex 和 GPT-5.6 将交易验证从 30 分钟压缩到 4 分钟以内

OpenAI Developers

日期 新闻 要点
10-06 Decisions API now in public beta 开发者可用 Decisions API 近实时选择模型/工具/动作,比 GPT-6 Luna 快 10 倍;已有实测 88.8% AUPRC 页面变更分类
10-06 Talk to Codex Codex 支持语音交互
10-05 Custom MCP servers without developer mode ChatGPT 所有用户可直接在 Plugins → Add → Create Custom MCP Server 连接 MCP 服务器
10-05 Edit model/reasoning effort of scheduled tasks 计划任务可直接在 Edit Task 弹窗中修改模型和推理力度
10-03 Agents API: Computer use with 1 API call Agents API 新增 Computer use(1 次调用启动浏览器+agent)、Bedrock Managed Agents(GPT-6.1 Sol)、环境尺寸选择、环境跨会话复用等;99.97% 轮次可靠性

Anthropic / Claude

日期 新闻 要点
10-06 Cyber Verification Program expanded 安全专业人士可访问 Claude Mythos 5.1、Opus 5.5、Sonnet 5.5;新增授权进攻性工作层级(渗透测试、红队)
10-06 Claude now works inside Google Docs, Sheets, and Slides Claude 在 Google Workspace 侧边栏读取并就地编辑文件,每次编辑可审批
10-06 Claude Startups program expanding 创始人可获一年 Claude Team、API credits、工具优惠及 Applied AI 团队 office hours
10-06 Claude Code cloud sessions field guide 七种适合云会话的工作流及 GitHub 连接指南
10-06 Claude Code v2.1.292 claude plugin install 新增 --marketplace 参数
10-06 Claude Code v2.1.291 修复 2.1.290 云会话权限提示丢失的回归
10-06 Claude Code v2.1.290 mod 的 turn.step hook 新增 serverToolUses 返回值

Google / DeepMind

日期 新闻 要点
10-06 Nano Banana 2.1 图像生成与编辑升级,质量提升、bug 修复、价格下调;API / AI Studio / Gemini 均可用
10-06 Fleming Initiative: AI for antimicrobial resistance Google DeepMind 支持的三年项目将开发评估 AI 抗菌耐药性的方法和标准
10-06 Demis Hassabis on John Urschel 前 NFL 球员 John Urschel 协助解决高斯消元法长期悬而猜想
10-02 September AI updates recap 9 月 AI 更新视频汇总

Mistral

日期 新闻 要点
10-06 Mistral Large 4 ("Le Chonk") 1T 参数、49B 激活、原生多模态;号称欧美最佳开源权重模型;网络安全、制造、金融等关键负载达 SOTA;HN 1571 分

DeepSeek

日期 新闻 要点
10-02 DeepSeek Harness desktop macOS / Windows 桌面版发布,Linux 可从 npm @deepseek-ai/dsh 获取

社区动态

日期 来源 要点
10-07 Simon Willison 发布 LLM 插件支持 OpenAI Decisions API(基于 GPT-6 Luna 的 Jev-clone 决策模型)
10-06 Karpathy / swyx swyx 在 AI:AM 讨论 Astra 作为"全能 AI 工程师"($6/小时)及 Cursor → SpaceX 等话题
10-02 Karpathy "Land or Water?" eval:给 LLM 经纬度文本,16,200 次查询绘制图像,模型确实"知道"地理
10-06 HN: OpenTPU 开源 AI 加速器,由 AI 设计;HN 218 分
10-06 HN: EmbeddingGemma 2 Google 开源轻量多模态嵌入模型;HN 207 分

Benchmark 快照

行业格局

AA Intelligence(综合智能)

排名 模型 分数
1 Claude Opus 5.5 (Max, Default Fallback) 57.6
2 Claude Fable 5.1 (Max, Default Fallback) 53.4
3 GPT-6 Astra (Max) 52.7

LMArena Overall

排名 模型 分数
1 Gemini 4 Argon High 1525.2
2 Claude Opus 4-6 High 1504.7
3 Claude Fable 5 High 1504.3

本期 LMArena 排名变动:Gemini 4 Argon High 居首,Claude 三款模型占据 2-4 位。

干活选型

AA Agentic(Agent 能力)

排名 模型 分数
1 Claude Fable 5.1 (Max, Default Fallback) 57.9
2 Claude Opus 5 (Xhigh) 55.6
3 GPT-6 Astra (Max) 51.0

AA Coding(编码能力)

排名 模型 分数
1 Claude Fable 5.1 (Max, Default Fallback) 81.6
2 Claude Fable 5.1 (Medium, Default Fallback) 77.1
3 Claude Opus 5 (Xhigh) 77.0

SWE-bench Verified

排名 模型(脚手架) 分数
1 Claude 4.5 Opus (Sonar Foundation Agent) 79.2
2 Claude 4.5 Opus medium (live-SWE-agent) 79.2
3 Doubao-Seed-Code (TRAE) 78.8

SWE-bench Verified 本期变化:

模型 变化 前排名 → 现排名 分数
Claude 3.5 Haiku rank_change 34 → 33 40.6(不变)
Claude 4 Sonnet + o4-mini rank_change 10 → 9 74.4(不变)
GPT-5 rank_change 9 → 10 74.4(不变)
LLama 3.1 70B Critic rank_change 33 → 34 40.6(不变)

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


编辑点评

  1. OpenAI Decisions API 公开测试 — 该 API 号称比 GPT-6 Luna 快 10 倍做出模型/工具/动作选择,而开发者 Ethan Kam 实测在页面变更分类上达到 88.8% AUPRC,说明其定位不是替代通用 LLM 推理,而是用极低成本替代"需要轻量分类器但又想用前沿智能"的场景。如果延迟和成本数据经独立验证属实,这会直接挤压传统小模型微调分类器的生存空间。

  2. Mistral Large 4 以 1T 参数 + 开源权重入场 — 该模型 49B 激活、原生多模态,且声称在网络安全、制造、金融等负载上达 SOTA。结合 HN 1571 分的高热度,说明开源社区对"大参数 + 稀疏激活"路线仍有强烈兴趣;但材料中未提供独立 benchmark 分数,其 SOTA 声称尚需验证。

  3. OpenAI 发布数学前沿结果 — OpenAI 公开了内部前沿模型在开放数学问题上的新结果并附带 Lean 证明形式化和 GitHub 研究细节,Sam Altman 同步发文称"进入发现新时代"。这是继 Anthropic 的 Claude 九圈计算之后,另一家头部实验室将 AI 推向前沿科研的具体信号,且 OpenAI 选择以可验证的形式(Lean 证明)公开,比纯博客宣称更具可信度。

来源 · 96 条