【OpenAI】OpenAI 与 Broadcom 发布自研 LLM 推理芯片 Jalapeño 这是 OpenAI 首款自研 AI 芯片,专为 LLM 推理工作负载设计,将提升 ChatGPT、Codex 等产品的性能和效率。此举标志着 OpenAI 正式进军芯片领域,减少对第三方硬件的依赖。 原文链接:https://openai.com/index/openai-broadcom-jalapeno-inference-chip
【OpenAI】GPT-5 Pro 助力免疫学家破解三年难题 GPT-5 Pro 帮助解决了困扰免疫学界三年的 T 细胞行为谜题,为癌症和自身免疫疾病研究提供新思路。这展示了前沿模型在复杂科学研究中的实际应用价值。 原文链接:https://openai.com/index/gpt-5-immunology-mystery
【Anthropic】Claude Code 新增 Artifacts 功能与多项更新
Claude Code 推出 Artifacts 功能,可生成交互式页面如 PR 演示、项目仪表板,并通过私有链接分享。同时新增 /rewind 支持恢复 /clear 前的对话,以及 sandbox.credentials 设置保护凭证安全。
原文链接:https://github.com/anthropics/claude-code/releases/tag/v2.1.193
【xAI】Grok Build 持续扩展插件生态与功能
Grok Build 新增 /goal 命令支持自主执行长时任务,推出 MongoDB、Firecrawl、Interactive Brokers 等官方插件,并集成至 Warp、DigitalOcean、Word、PowerPoint 等平台。Grok TTS 在语音人性化测试中获 96 分,接近真人水平。
原文链接:https://x.com/xai/status/2069095296987222287
【Google】Gemma 4 下载量突破 2 亿次 Gemma 4 在发布仅 2.5 个月内下载量突破 2 亿次,超越 Gemma 3 发布时整个 Gemma 系列的 1 亿次总下载量。开源模型社区采用速度显著加快。 原文链接:https://x.com/demishassabis/status/2070246937719169530
SWE-bench Verified
Terminal Bench 2.0
autoMode.classifyAllShell 设置,v2.1.191 支持 /rewind 恢复对话 来源| 日期 | 新闻 |
|---|---|
| 06-25 | 发布研究论文,展示 AI Agent 如何变革工作方式,支持更长、更复杂的任务 链接 |
| 06-25 | Codex Remote 正式发布,可通过 ChatGPT 移动端远程操作 Mac/Windows 主机 链接 |
| 06-24 | 与 Broadcom 联合推出 Jalapeño 推理芯片,专为 LLM 工作负载优化 链接 |
| 06-24 | GPT-5.5 Instant 更新,提升对话体验和复杂约束处理能力 链接 |
| 06-23 | GPT-5 Pro 协助免疫学家解开 3 年 T 细胞行为之谜 链接 |
| 06-23 | 支持通过 Appia Foundation 建立高级 AI 共享标准 链接 |
| 06-22 | 发布 Daybreak 安全工具套件,包括 Codex Security 和 GPT-5.5-Cyber 链接 |
| 06-22 | 推出 Patch the Planet 计划,帮助开源维护者修复漏洞 链接 |
| 06-21 | 三星电子部署 ChatGPT Enterprise 和 Codex,为最大规模企业部署之一 链接 |
| 06-18 | ChatGPT Enterprise 新增支出控制和使用分析功能 链接 |
| 06-17 | 发布 LifeSciBench,评估 AI 在生命科学任务中的表现 链接 |
| 日期 | 新闻 |
|---|---|
| 06-25 | 加入 RAISE US 作为创始合作伙伴,推动美国劳动力 AI 转型 链接 |
| 06-23 | 推出 Claude Tag,在 Slack 中以团队成员身份参与频道协作 链接 |
| 06-18 | Claude Code 新增 Artifacts 功能,支持构建交互式页面和项目仪表板 链接 |
| 06-17 | Claude Design 更新:支持设计系统一致性、画布直接编辑、与 Claude Code 同步 链接 |
| 06-13 | 美国政府出口管制指令暂停 Fable 5 和 Mythos 5 对所有用户的访问 链接 |
| 日期 | 新闻 |
|---|---|
| 06-25 | SuperGrok 和 X 订阅现可在 T3code 中使用 链接 |
| 06-24 | Grok Build 新增官方 MongoDB 插件 链接 |
| 06-23 | Firecrawl 成为 Grok Build 官方插件,支持网页搜索和抓取 链接 |
| 06-22 | Grok 可连接 Interactive Brokers 进行投资组合分析 链接 |
| 06-22 | Grok Build 推出 /goal 命令,支持自主执行长时任务 链接 |
| 06-18 | Grok TTS 在 Vapi 人性化指数盲测中获 96 分,接近真人水平 链接 |
| 06-18 | Grok 模型登陆 Databricks Agent Bricks 链接 |
| 日期 | 新闻 |
|---|---|
| 06-25 | Gemma 4 发布 2.5 个月内下载量突破 2 亿次 链接 |
| 06-25 | Google Finance 升级,推出新应用 链接 |
| 06-22 | Google DeepMind 与 A24 建立研究合作伙伴关系 链接 |
| 06-17 | AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级医生水平 链接 |
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
来源:GitHub
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | Claude Opus 4-6 (thinking)* | 51.9 |
来源:Scale Labs
有变化:
| 模型 | 变化 |
|---|---|
| LemonHarness / Multiple | 第 8 名→第 2 名,分数 79.9→84.5 (+4.6) |
| Gemini CLI / Gemini 3.1 Pro | 第 45 名→第 40 名,分数 59.4→61.4 (+2.0) |
| Warp / Multiple | 第 41 名→第 65 名,分数 61.2→50.1 (-11.1) |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
来源:TBench
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5 | 1507.6 |
| 2 | Claude Opus 4-6 (thinking) | 1503.7 |
| 3 | Claude Opus 4-7 (thinking) | 1502.4 |
来源:HuggingFace