SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-06-06 08:33

查看完整版 →
2026-06-06 08:33 CST

核心速览

【Anthropic】Anthropic 秘密提交 IPO 注册文件 Anthropic 已向 SEC 机密提交 S-1 注册草案,保留启动 IPO 的选项,时间取决于 SEC 审查完成情况。此前公司刚完成 Series H 融资,估值达 9650 亿美元,IPO 动向将是 AI 行业今年最重要的资本事件之一。 原文


【Anthropic】Project Glasswing 扩大 Claude Mythos Preview 访问 Anthropic 将 Claude Mythos Preview 的访问权限扩展至约 150 个新增机构,覆盖超过 15 个国家。这是 Anthropic 在顶级模型商业化路径上的重要布局,表明其下一代旗舰模型正在加速推向企业市场。 原文


【Anthropic】Claude 化学能力突破:NMR 分析媲美专业软件 Anthropic 科学博客披露,Claude Opus 4.7 在核磁共振(NMR)谱图解析任务上已达到甚至超越专用 NMR 软件的表现。这标志着大模型在精密科学仪器分析领域开始具备实际替代价值,对药物研发和材料科学影响显著。 原文


【OpenAI】ChatGPT 推出"Dreaming"新记忆系统 OpenAI 为 ChatGPT 上线更强的跨会话记忆机制,能主动保持用户偏好和上下文的长期相关性,而非被动存储。更智能的记忆意味着更短的提示词、更高的每 token 使用效率,是 ChatGPT 产品体验的系统性升级。 原文


【OpenAI】GPT-Rosalind 重大更新,聚焦药物发现 OpenAI 为生命科学专用模型 GPT-Rosalind 带来重大升级,整合 GPT-5.5 的 agentic 编程与工具调用能力,强化药物设计、基因组学分析和实验流程规划。这是 OpenAI 在垂直行业模型竞争中的关键落子,直接对标医疗 AI 赛道。 原文


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 大幅上升:分数从 52.2 → 60.4(+8.2 分),排名从第 103 升至第 76,涨幅显著。
  • Nemotron-CORTEXA 明显下滑:分数从 68.2 → 58.2(-10.0 分),排名从第 50 跌至第 82,回落幅度较大。
  • devlo 大幅下滑:分数从 70.2 → 58.2(-12.0 分),排名从第 44 跌至第 83,竞争力显著削弱。
  • Warp 小幅下滑:分数从 75.6 → 71.0(-4.6 分),排名从第 11 跌至第 36,仍处于榜单前列但竞争压力增大。

Terminal Bench 2.0

  • LemonHarness / Multiple 强势跃升:分数从 79.9 → 84.5(+4.6 分),排名从第 10 升至第 4,跻身榜单前列。
  • Warp / Multiple 明显下滑:分数从 61.2 → 50.1(-11.1 分),排名从第 43 跌至第 67,在 Terminal Bench 与 SWE-bench 上同步走弱。

历史日报

邮件订阅

每天一封邮件,随时可退订