SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-06-25 00:40

查看完整版 →
2026-06-25 08:40 CST

核心速览

【OpenAI】发布首款自研AI芯片Jalapeño OpenAI与Broadcom联合推出专为LLM推理优化的定制芯片Jalapeño,旨在提升ChatGPT、Codex等产品的性能和效率。这标志着OpenAI正式进军芯片领域,减少对第三方硬件的依赖。 原文链接:https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【Anthropic】Claude Fable 5登顶LMArena榜单 Claude Fable 5以1507.59分首次登榜即位列第一,Claude Opus 4-6-thinking和Opus 4-7-thinking分列第二、第三。Claude系列模型包揽前三,展现强劲实力。但需注意Fable 5和Mythos 5因美国出口管制已被暂停访问。 原文链接:https://x.com/AnthropicAI/status/2065597531644743999

【Anthropic】推出Claude Tag团队协作功能 Claude Tag允许Claude作为团队成员加入Slack频道,访问指定的频道和工具。用户可直接@Claude并委派任务,实现更高效的团队协作。 原文链接:https://x.com/AnthropicAI/status/2069469669929386160

【xAI】Grok Build推出/goal自主执行功能 Grok Build新增/goal命令,支持多轮子代理自主执行长期任务,实现目标验证与实施的闭环。同时插件市场新增MongoDB、Firecrawl等官方插件。 原文链接:https://x.com/xai/status/2069095296987222287

【OpenAI】三星全球部署ChatGPT Enterprise和Codex 三星电子向韩国全体员工及DX部门全球员工部署ChatGPT Enterprise和Codex,这是OpenAI最大规模的企业级部署之一,标志着AI工具在大型企业中的普及加速。 原文链接:https://openai.com/index/samsung-electronics-chatgpt-codex-deployment


重大 Benchmark 变化

LMArena榜单重大变动

  • Claude Fable 5新上榜即位列第1(1507.59分)
  • Claude Opus 4-6-thinking位列第2(1503.69分)
  • Claude Opus 4-7-thinking位列第3(1502.38分)
  • Gemini 3.1 Pro Preview位列第7(1486.42分)
  • GPT-5.5-high位列第10(1481.22分)

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从103升至76,分数从52.2升至60.4(+8.2分,+15.7%)
  • Warp:排名从11降至36,分数从75.6降至71.0(-4.6分,-6.1%)
  • devlo:排名从44降至94,分数从70.2降至54.2(-16.0分,-22.8%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从8升至2,分数从79.9升至84.5(+4.6分,+5.8%)
  • Warp / Multiple:排名从41降至65,分数从61.2降至50.1(-11.1分,-18.1%)

历史日报

邮件订阅

每天一封邮件,随时可退订