← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-25 00:40

2026-06-25 08:40 CST
快速版 完整版

核心速览

【OpenAI】发布首款自研AI芯片Jalapeño OpenAI与Broadcom联合推出专为LLM推理优化的定制芯片Jalapeño,旨在提升ChatGPT、Codex等产品的性能和效率。这标志着OpenAI正式进军芯片领域,减少对第三方硬件的依赖。 原文链接:https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【Anthropic】Claude Fable 5登顶LMArena榜单 Claude Fable 5以1507.59分首次登榜即位列第一,Claude Opus 4-6-thinking和Opus 4-7-thinking分列第二、第三。Claude系列模型包揽前三,展现强劲实力。但需注意Fable 5和Mythos 5因美国出口管制已被暂停访问。 原文链接:https://x.com/AnthropicAI/status/2065597531644743999

【Anthropic】推出Claude Tag团队协作功能 Claude Tag允许Claude作为团队成员加入Slack频道,访问指定的频道和工具。用户可直接@Claude并委派任务,实现更高效的团队协作。 原文链接:https://x.com/AnthropicAI/status/2069469669929386160

【xAI】Grok Build推出/goal自主执行功能 Grok Build新增/goal命令,支持多轮子代理自主执行长期任务,实现目标验证与实施的闭环。同时插件市场新增MongoDB、Firecrawl等官方插件。 原文链接:https://x.com/xai/status/2069095296987222287

【OpenAI】三星全球部署ChatGPT Enterprise和Codex 三星电子向韩国全体员工及DX部门全球员工部署ChatGPT Enterprise和Codex,这是OpenAI最大规模的企业级部署之一,标志着AI工具在大型企业中的普及加速。 原文链接:https://openai.com/index/samsung-electronics-chatgpt-codex-deployment


重大 Benchmark 变化

LMArena榜单重大变动

  • Claude Fable 5新上榜即位列第1(1507.59分)
  • Claude Opus 4-6-thinking位列第2(1503.69分)
  • Claude Opus 4-7-thinking位列第3(1502.38分)
  • Gemini 3.1 Pro Preview位列第7(1486.42分)
  • GPT-5.5-high位列第10(1481.22分)

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从103升至76,分数从52.2升至60.4(+8.2分,+15.7%)
  • Warp:排名从11降至36,分数从75.6降至71.0(-4.6分,-6.1%)
  • devlo:排名从44降至94,分数从70.2降至54.2(-16.0分,-22.8%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从8升至2,分数从79.9升至84.5(+4.6分,+5.8%)
  • Warp / Multiple:排名从41降至65,分数从61.2降至50.1(-11.1分,-18.1%)

快速预览

  • OpenAI 发布首款自研 AI 芯片 Jalapeño,与 Broadcom 合作打造,专为 LLM 推理优化 (来源)
  • Claude Fable 5 登顶 LMArena 榜单,以 1507.6 分排名第一,Claude Opus 4-6-thinking 紧随其后 (榜单)
  • GPT-5.4 (xHigh) 领跑 SWE-Bench Pro,得分 59.1%,领先第二名 Muse Spark 4.1 个百分点 (榜单)
  • Anthropic 推出 Claude Tag,支持在 Slack 中将 Claude 作为团队成员使用 (来源)
  • Grok Build 持续扩展插件生态,新增 MongoDB、Firecrawl、Interactive Brokers 等集成

新闻动态

OpenAI

日期 新闻
06-24 发布首款自研 AI 芯片 Jalapeño,与 Broadcom 合作,专为 LLM 推理优化,服务于 ChatGPT、Codex 及未来 Agent 产品 (链接)
06-24 GPT-5.5 Instant 更新,改进对话体验,更好理解用户意图并适应复杂约束 (链接)
06-23 GPT-5 Pro 协助免疫学家解开 3 年 T 细胞行为谜题,或助力癌症与自身免疫疾病研究 (链接)
06-23 支持建立 AI 高级共享标准,通过 Appia Foundation 推动评估框架与安全实践 (链接)
06-22 推出 Daybreak 安全工具套件,包含 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现和修复漏洞 (链接)
06-22 启动 Patch the Planet 计划,帮助开源维护者用 AI 和专家审查修复安全漏洞 (链接)
06-21 三星电子部署 ChatGPT Enterprise 和 Codex,为全球员工提供,系 OpenAI 最大规模企业部署之一 (链接)
06-18 ChatGPT Enterprise 新增 使用量分析和支出控制 功能 (链接)
06-18 GPT-5.5 Instant 改进 健康智能响应,增强推理和上下文理解 (链接)
06-18 研究人员使用 OpenAI 推理模型帮助诊断 罕见儿童遗传病,在未解病例中发现 18 个新诊断 (链接)
06-17 发布 LifeSciBench,专家编写和评审的生命科学 AI 评估基准 (链接)
06-17 近自主 AI 化学家改进药物化学关键反应,使用 GPT-5.4 (链接)
06-14 推出 OpenAI Partner Network,投资 1.5 亿美元加速企业 AI 采用 (链接)

Codex 更新

  • 06-22: ChatGPT iOS 新增 per-host 个性设置(Friendly/Pragmatic)(链接)
  • 06-22: Codex CLI 0.142.0 支持 使用额度重置积分 (链接)
  • 06-18: Codex macOS 新增 Record & Replay 功能,将演示工作流转为可复用技能 (链接)

Anthropic

日期 新闻
06-24 Claude Code v2.1.191 发布,新增 /rewind 支持从 /clear 前恢复对话 (链接)
06-23 推出 Claude Tag,在 Slack 中将 Claude 作为团队成员,可访问指定频道和工具 (链接)
06-23 Claude Code v2.1.187 新增 sandbox.credentials 设置,阻止沙箱命令读取凭证文件 (链接)
06-22 Claude Code v2.1.186 新增 claude mcp login/logout 命令,支持 SSH 环境认证 MCP 服务器 (链接)
06-19 AlphaFold 核心贡献者 John Jumper 宣布离开 Google DeepMind 加入 Anthropic (链接)
06-18 Claude Code 新增 Artifacts 功能,可构建交互式页面并与团队共享 (链接)
06-13 美国政府出口管制指令暂停 Fable 5 和 Mythos 5 对所有用户的访问,Anthropic 正在争取恢复 (链接)
06-11 推出 Claude Corps 国家奖学金计划,资助 1000 人学习使用 Claude 服务美国非营利组织 (链接)

xAI (Grok)

日期 新闻
06-24 Grok Build 新增 MongoDB 官方插件,支持数据查询、索引优化和数据库管理 (链接)
06-23 Firecrawl 插件上线 Grok Build Plugin Marketplace,支持网页搜索和抓取 (链接)
06-22 Grok 连接 Interactive Brokers,支持投资组合研究和分析 (链接)
06-22 推出 /goal 命令,支持自主执行长时间任务,多轮子 Agent 实现和验证 (链接)
06-18 Grok TTS 在 Vapi 人性化指数盲测中排名第一,得分 96(真人 100)(链接)
06-18 Grok 模型上线 Databricks Agent Bricks (链接)
06-18 Grok Word 插件上线,支持文档起草、网页研究摘要和图表生成 (链接)
06-16 Grok PowerPoint 插件上线,支持从提示词生成演示文稿 (链接)
06-15 Grok Build 新增 Agent Dashboard,支持同时管理多个 Agent (链接)
06-11 Grok Build Plugin Marketplace 公测,首发 MongoDB、Vercel、Sentry、Cloudflare、Chrome DevTools 插件 (链接)

Google

日期 新闻
06-23 Project Genie 获戛纳国际创意节 AI Craft 大奖 (链接)
06-22 Google DeepMind 与 A24 建立研究合作伙伴关系,确保未来工具由创作者塑造 (链接)
06-17 AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级保健医生表现 (链接)
06-15 宣布 15 亿美元投资 扩建阿拉巴马州数据中心园区 (链接)

Benchmark 榜单

LMArena Overall

本期变化:大量新模型入榜,Claude Fable 5 新上榜即登顶

排名 模型 分数
1 claude-fable-5 🆕 1507.6
2 claude-opus-4-6-thinking 🆕 1503.7
3 claude-opus-4-7-thinking 🆕 1502.4
4 claude-opus-4-6 🆕 1498.8
5 claude-opus-4-7 🆕 1493.1
6 muse-spark 🆕 1486.9
7 gemini-3.1-pro-preview 🆕 1486.4
8 gemini-3-pro 🆕 1485.7
9 claude-opus-4-8-thinking 🆕 1483.5
10 gpt-5.5-high 🆕 1481.2

其他重要新入榜模型:gpt-5.4-high (#11, 1478.0)、gemini-3.5-flash (#13, 1476.3)、gpt-5.2-chat-latest (#14, 1475.4)、glm-5.1 (#15, 1475.3)、deepseek-v4-pro (#38, 1455.9)、qwen3.7-max-preview (#17, 1474.7)

来源:LMArena Leaderboard

SWE-Bench Pro (Public)

本期无变动

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1%
2 Muse Spark* 55.0%
3 claude-opus-4-6 (thinking)* 51.9%

来源:Scale Labs Leaderboard

SWE-Bench Verified

本期变化

模型 变化
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct ↑ 排名 103→76,分数 52.2→60.4
Warp ↓ 排名 11→36,分数 75.6→71.0
devlo ↓ 排名 44→83,分数 70.2→58.2
Nemotron-CORTEXA ↓ 排名 50→82,分数 68.2→58.2

当前 Top 3

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2%
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2%
3 TRAE + Doubao-Seed-Code 78.8%

来源:SWE-Bench Verified Leaderboard

Terminal Bench 2.0

本期变化

模型 变化
LemonHarness / Multiple ↑ 排名 8→2,分数 79.9→84.5
Gemini CLI / Gemini 3.1 Pro ↑ 排名 45→40,分数 59.4→61.4
Warp / Multiple ↓ 排名 41→65,分数 61.2→50.1

当前 Top 3

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7%
2 LemonHarness / Multiple 84.5%
3 Capy / GPT-5.5 83.1%

来源:Terminal Bench Leaderboard

来源 · 67 条