SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-06-13 09:47

查看完整版 →
2026-06-13 09:47 CST

核心速览

【Anthropic】美国政府出口管制令强制下架 Fable 5 和 Mythos 5

美国政府以国家安全为由,发布出口管制指令,要求暂停所有外国国籍人士(包括 Anthropic 员工)访问 Fable 5 和 Mythos 5 模型。Anthropic 被迫对所有用户关闭这两款模型以确保合规,其他 Claude 模型不受影响。Anthropic 表示认为此举系误解,正积极推动恢复访问。 原文


【OpenAI】收购 Ona,强化 Codex 云端 Agent 能力

OpenAI 宣布收购云执行技术公司 Ona,其安全持久化云环境技术将使 Codex 能够在笔记本关闭时持续运行长周期任务,并助力企业在生产环境中安全部署 Agent。Ona 团队将并入 OpenAI Codex 团队。这是 OpenAI 在 Agent 基础设施层面的关键投资。 原文


【OpenAI】机密 S-1 文件向 SEC 提交,IPO 进程启动

OpenAI 确认已向美国证券交易委员会(SEC)秘密提交 S-1 上市申请文件,但尚未确定后续时间表。这标志着 OpenAI 正式启动 IPO 前置流程,是其从非营利结构向商业化转型的重大里程碑。 原文


【Google DeepMind】Gemini Omni Flash 登顶视频生成榜

Google DeepMind 发布 Gemini Omni,主打"从任意输入生成任意内容",融合 Gemini 智能与生成媒体系统。Gemini Omni Flash 在 Video Arena 文本转视频和图像转视频双榜均排名第一,较 Veo 3.1 提升 158 分,领先第二名 61 分。 原文


【xAI】Grok Build 插件市场上线 Beta,Grok Voice 进入 Pareto 前沿

xAI 推出 Grok Build 插件市场(Beta),支持 MongoDB、Vercel、Sentry、Cloudflare、Chrome DevTools 等插件,可直接从终端调用。同期,Grok Voice Think Fast 1.0 在 EVA-Bench 语音 Agent 评测中进入 Pareto 前沿,在准确率与体验的权衡上无模型同时超越它。 原文


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 大幅上升:排名从第 103 升至第 76,分数从 52.2 提升至 60.4(+15.7%),是本周最显著的正向跃升。
  • Nemotron-CORTEXA 显著下滑:排名从第 50 跌至第 82,分数从 68.2 降至 58.2(-14.7%)。
  • devlo 明显下滑:排名从第 44 跌至第 83,分数从 70.2 降至 58.2(-17.1%)。
  • Warp 有所下滑:排名从第 11 跌至第 36,分数从 75.6 降至 71.0(-6.1%)。

Terminal Bench 2.0

  • LemonHarness / Multiple 强势跃升:排名从第 8 升至第 2,分数从 79.9 提升至 84.5(+5.8%)。
  • Warp / Multiple 明显下滑:排名从第 41 跌至第 65,分数从 61.2 降至 50.1(-18.1%)。

历史日报

邮件订阅

每天一封邮件,随时可退订