← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-26 00:34

2026-06-26 08:34 CST
快速版 完整版

核心速览

【OpenAI】OpenAI 与 Broadcom 发布自研 LLM 推理芯片 Jalapeño 这是 OpenAI 首款自研 AI 芯片,专为 LLM 推理工作负载设计,将提升 ChatGPT、Codex 等产品的性能和效率。此举标志着 OpenAI 正式进军芯片领域,减少对第三方硬件的依赖。 原文链接:https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【OpenAI】GPT-5 Pro 助力免疫学家破解三年难题 GPT-5 Pro 帮助解决了困扰免疫学界三年的 T 细胞行为谜题,为癌症和自身免疫疾病研究提供新思路。这展示了前沿模型在复杂科学研究中的实际应用价值。 原文链接:https://openai.com/index/gpt-5-immunology-mystery

【Anthropic】Claude Code 新增 Artifacts 功能与多项更新 Claude Code 推出 Artifacts 功能,可生成交互式页面如 PR 演示、项目仪表板,并通过私有链接分享。同时新增 /rewind 支持恢复 /clear 前的对话,以及 sandbox.credentials 设置保护凭证安全。 原文链接:https://github.com/anthropics/claude-code/releases/tag/v2.1.193

【xAI】Grok Build 持续扩展插件生态与功能 Grok Build 新增 /goal 命令支持自主执行长时任务,推出 MongoDB、Firecrawl、Interactive Brokers 等官方插件,并集成至 Warp、DigitalOcean、Word、PowerPoint 等平台。Grok TTS 在语音人性化测试中获 96 分,接近真人水平。 原文链接:https://x.com/xai/status/2069095296987222287

【Google】Gemma 4 下载量突破 2 亿次 Gemma 4 在发布仅 2.5 个月内下载量突破 2 亿次,超越 Gemma 3 发布时整个 Gemma 系列的 1 亿次总下载量。开源模型社区采用速度显著加快。 原文链接:https://x.com/demishassabis/status/2070246937719169530


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76(↑27),分数从 52.2 提升至 60.4(+15.7%)
  • Warp:排名从 11 跌至 36(↓25),分数从 75.6 降至 71.0(-6.1%)
  • devlo:排名从 44 跌至 94(↓50),分数从 70.2 降至 54.2(-22.8%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至 2(↑6),分数从 79.9 提升至 84.5(+5.8%)
  • Warp / Multiple:排名从 41 跌至 65(↓24),分数从 61.2 降至 50.1(-18.1%)

快速预览

  • OpenAI 发布 Jalapeño 芯片:与 Broadcom 合作推出 LLM 推理专用芯片,提升性能与效率 来源
  • Claude Code 连续更新:v2.1.193 新增 autoMode.classifyAllShell 设置,v2.1.191 支持 /rewind 恢复对话 来源
  • SWE-Bench Pro Public 榜单:GPT-5.4 (xHigh) 以 59.1 分领跑,Claude Opus 4-6 (thinking) 第三 (51.9) 来源
  • Terminal Bench 2 变化:LemonHarness/Multiple 从第 8 名跃升至第 2 名 (79.9→84.5) 来源
  • Anthropic 加入 RAISE US:作为创始合作伙伴参与美国劳动力 AI 转型计划 来源

新闻动态

OpenAI

日期 新闻
06-25 发布研究论文,展示 AI Agent 如何变革工作方式,支持更长、更复杂的任务 链接
06-25 Codex Remote 正式发布,可通过 ChatGPT 移动端远程操作 Mac/Windows 主机 链接
06-24 与 Broadcom 联合推出 Jalapeño 推理芯片,专为 LLM 工作负载优化 链接
06-24 GPT-5.5 Instant 更新,提升对话体验和复杂约束处理能力 链接
06-23 GPT-5 Pro 协助免疫学家解开 3 年 T 细胞行为之谜 链接
06-23 支持通过 Appia Foundation 建立高级 AI 共享标准 链接
06-22 发布 Daybreak 安全工具套件,包括 Codex Security 和 GPT-5.5-Cyber 链接
06-22 推出 Patch the Planet 计划,帮助开源维护者修复漏洞 链接
06-21 三星电子部署 ChatGPT Enterprise 和 Codex,为最大规模企业部署之一 链接
06-18 ChatGPT Enterprise 新增支出控制和使用分析功能 链接
06-17 发布 LifeSciBench,评估 AI 在生命科学任务中的表现 链接

Anthropic

日期 新闻
06-25 加入 RAISE US 作为创始合作伙伴,推动美国劳动力 AI 转型 链接
06-23 推出 Claude Tag,在 Slack 中以团队成员身份参与频道协作 链接
06-18 Claude Code 新增 Artifacts 功能,支持构建交互式页面和项目仪表板 链接
06-17 Claude Design 更新:支持设计系统一致性、画布直接编辑、与 Claude Code 同步 链接
06-13 美国政府出口管制指令暂停 Fable 5 和 Mythos 5 对所有用户的访问 链接

xAI

日期 新闻
06-25 SuperGrok 和 X 订阅现可在 T3code 中使用 链接
06-24 Grok Build 新增官方 MongoDB 插件 链接
06-23 Firecrawl 成为 Grok Build 官方插件,支持网页搜索和抓取 链接
06-22 Grok 可连接 Interactive Brokers 进行投资组合分析 链接
06-22 Grok Build 推出 /goal 命令,支持自主执行长时任务 链接
06-18 Grok TTS 在 Vapi 人性化指数盲测中获 96 分,接近真人水平 链接
06-18 Grok 模型登陆 Databricks Agent Bricks 链接

Google

日期 新闻
06-25 Gemma 4 发布 2.5 个月内下载量突破 2 亿次 链接
06-25 Google Finance 升级,推出新应用 链接
06-22 Google DeepMind 与 A24 建立研究合作伙伴关系 链接
06-17 AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级医生水平 链接

Benchmark 榜单

SWE-Bench Verified

本期无变动。当前 Top 3:

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

来源:GitHub

SWE-Bench Pro Public

本期无变动。当前 Top 3:

排名 模型 分数
1 GPT-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 Claude Opus 4-6 (thinking)* 51.9

来源:Scale Labs

Terminal Bench 2.0

有变化

模型 变化
LemonHarness / Multiple 第 8 名→第 2 名,分数 79.9→84.5 (+4.6)
Gemini CLI / Gemini 3.1 Pro 第 45 名→第 40 名,分数 59.4→61.4 (+2.0)
Warp / Multiple 第 41 名→第 65 名,分数 61.2→50.1 (-11.1)

当前 Top 3:

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

来源:TBench

LMArena Overall

本期无变动。当前 Top 3:

排名 模型 分数
1 Claude Fable 5 1507.6
2 Claude Opus 4-6 (thinking) 1503.7
3 Claude Opus 4-7 (thinking) 1502.4

来源:HuggingFace

来源 · 65 条