【OpenAI】发布首款自研AI芯片Jalapeño OpenAI与Broadcom联合推出专为LLM推理优化的定制芯片Jalapeño,旨在提升ChatGPT、Codex等产品的性能和效率。这标志着OpenAI正式进军芯片领域,减少对第三方硬件的依赖。 原文链接:https://openai.com/index/openai-broadcom-jalapeno-inference-chip
【Anthropic】Claude Fable 5登顶LMArena榜单 Claude Fable 5以1507.59分首次登榜即位列第一,Claude Opus 4-6-thinking和Opus 4-7-thinking分列第二、第三。Claude系列模型包揽前三,展现强劲实力。但需注意Fable 5和Mythos 5因美国出口管制已被暂停访问。 原文链接:https://x.com/AnthropicAI/status/2065597531644743999
【Anthropic】推出Claude Tag团队协作功能 Claude Tag允许Claude作为团队成员加入Slack频道,访问指定的频道和工具。用户可直接@Claude并委派任务,实现更高效的团队协作。 原文链接:https://x.com/AnthropicAI/status/2069469669929386160
【xAI】Grok Build推出/goal自主执行功能 Grok Build新增/goal命令,支持多轮子代理自主执行长期任务,实现目标验证与实施的闭环。同时插件市场新增MongoDB、Firecrawl等官方插件。 原文链接:https://x.com/xai/status/2069095296987222287
【OpenAI】三星全球部署ChatGPT Enterprise和Codex 三星电子向韩国全体员工及DX部门全球员工部署ChatGPT Enterprise和Codex,这是OpenAI最大规模的企业级部署之一,标志着AI工具在大型企业中的普及加速。 原文链接:https://openai.com/index/samsung-electronics-chatgpt-codex-deployment
LMArena榜单重大变动
SWE-bench Verified
Terminal Bench 2.0
| 日期 | 新闻 |
|---|---|
| 06-24 | 发布首款自研 AI 芯片 Jalapeño,与 Broadcom 合作,专为 LLM 推理优化,服务于 ChatGPT、Codex 及未来 Agent 产品 (链接) |
| 06-24 | GPT-5.5 Instant 更新,改进对话体验,更好理解用户意图并适应复杂约束 (链接) |
| 06-23 | GPT-5 Pro 协助免疫学家解开 3 年 T 细胞行为谜题,或助力癌症与自身免疫疾病研究 (链接) |
| 06-23 | 支持建立 AI 高级共享标准,通过 Appia Foundation 推动评估框架与安全实践 (链接) |
| 06-22 | 推出 Daybreak 安全工具套件,包含 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现和修复漏洞 (链接) |
| 06-22 | 启动 Patch the Planet 计划,帮助开源维护者用 AI 和专家审查修复安全漏洞 (链接) |
| 06-21 | 三星电子部署 ChatGPT Enterprise 和 Codex,为全球员工提供,系 OpenAI 最大规模企业部署之一 (链接) |
| 06-18 | ChatGPT Enterprise 新增 使用量分析和支出控制 功能 (链接) |
| 06-18 | GPT-5.5 Instant 改进 健康智能响应,增强推理和上下文理解 (链接) |
| 06-18 | 研究人员使用 OpenAI 推理模型帮助诊断 罕见儿童遗传病,在未解病例中发现 18 个新诊断 (链接) |
| 06-17 | 发布 LifeSciBench,专家编写和评审的生命科学 AI 评估基准 (链接) |
| 06-17 | 近自主 AI 化学家改进药物化学关键反应,使用 GPT-5.4 (链接) |
| 06-14 | 推出 OpenAI Partner Network,投资 1.5 亿美元加速企业 AI 采用 (链接) |
Codex 更新:
| 日期 | 新闻 |
|---|---|
| 06-24 | Claude Code v2.1.191 发布,新增 /rewind 支持从 /clear 前恢复对话 (链接) |
| 06-23 | 推出 Claude Tag,在 Slack 中将 Claude 作为团队成员,可访问指定频道和工具 (链接) |
| 06-23 | Claude Code v2.1.187 新增 sandbox.credentials 设置,阻止沙箱命令读取凭证文件 (链接) |
| 06-22 | Claude Code v2.1.186 新增 claude mcp login/logout 命令,支持 SSH 环境认证 MCP 服务器 (链接) |
| 06-19 | AlphaFold 核心贡献者 John Jumper 宣布离开 Google DeepMind 加入 Anthropic (链接) |
| 06-18 | Claude Code 新增 Artifacts 功能,可构建交互式页面并与团队共享 (链接) |
| 06-13 | 美国政府出口管制指令暂停 Fable 5 和 Mythos 5 对所有用户的访问,Anthropic 正在争取恢复 (链接) |
| 06-11 | 推出 Claude Corps 国家奖学金计划,资助 1000 人学习使用 Claude 服务美国非营利组织 (链接) |
| 日期 | 新闻 |
|---|---|
| 06-24 | Grok Build 新增 MongoDB 官方插件,支持数据查询、索引优化和数据库管理 (链接) |
| 06-23 | Firecrawl 插件上线 Grok Build Plugin Marketplace,支持网页搜索和抓取 (链接) |
| 06-22 | Grok 连接 Interactive Brokers,支持投资组合研究和分析 (链接) |
| 06-22 | 推出 /goal 命令,支持自主执行长时间任务,多轮子 Agent 实现和验证 (链接) |
| 06-18 | Grok TTS 在 Vapi 人性化指数盲测中排名第一,得分 96(真人 100)(链接) |
| 06-18 | Grok 模型上线 Databricks Agent Bricks (链接) |
| 06-18 | Grok Word 插件上线,支持文档起草、网页研究摘要和图表生成 (链接) |
| 06-16 | Grok PowerPoint 插件上线,支持从提示词生成演示文稿 (链接) |
| 06-15 | Grok Build 新增 Agent Dashboard,支持同时管理多个 Agent (链接) |
| 06-11 | Grok Build Plugin Marketplace 公测,首发 MongoDB、Vercel、Sentry、Cloudflare、Chrome DevTools 插件 (链接) |
| 日期 | 新闻 |
|---|---|
| 06-23 | Project Genie 获戛纳国际创意节 AI Craft 大奖 (链接) |
| 06-22 | Google DeepMind 与 A24 建立研究合作伙伴关系,确保未来工具由创作者塑造 (链接) |
| 06-17 | AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级保健医生表现 (链接) |
| 06-15 | 宣布 15 亿美元投资 扩建阿拉巴马州数据中心园区 (链接) |
本期变化:大量新模型入榜,Claude Fable 5 新上榜即登顶。
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 🆕 | 1507.6 |
| 2 | claude-opus-4-6-thinking 🆕 | 1503.7 |
| 3 | claude-opus-4-7-thinking 🆕 | 1502.4 |
| 4 | claude-opus-4-6 🆕 | 1498.8 |
| 5 | claude-opus-4-7 🆕 | 1493.1 |
| 6 | muse-spark 🆕 | 1486.9 |
| 7 | gemini-3.1-pro-preview 🆕 | 1486.4 |
| 8 | gemini-3-pro 🆕 | 1485.7 |
| 9 | claude-opus-4-8-thinking 🆕 | 1483.5 |
| 10 | gpt-5.5-high 🆕 | 1481.2 |
其他重要新入榜模型:gpt-5.4-high (#11, 1478.0)、gemini-3.5-flash (#13, 1476.3)、gpt-5.2-chat-latest (#14, 1475.4)、glm-5.1 (#15, 1475.3)、deepseek-v4-pro (#38, 1455.9)、qwen3.7-max-preview (#17, 1474.7)
本期无变动。
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1% |
| 2 | Muse Spark* | 55.0% |
| 3 | claude-opus-4-6 (thinking)* | 51.9% |
本期变化:
| 模型 | 变化 |
|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct | ↑ 排名 103→76,分数 52.2→60.4 |
| Warp | ↓ 排名 11→36,分数 75.6→71.0 |
| devlo | ↓ 排名 44→83,分数 70.2→58.2 |
| Nemotron-CORTEXA | ↓ 排名 50→82,分数 68.2→58.2 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2% |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2% |
| 3 | TRAE + Doubao-Seed-Code | 78.8% |
来源:SWE-Bench Verified Leaderboard
本期变化:
| 模型 | 变化 |
|---|---|
| LemonHarness / Multiple | ↑ 排名 8→2,分数 79.9→84.5 |
| Gemini CLI / Gemini 3.1 Pro | ↑ 排名 45→40,分数 59.4→61.4 |
| Warp / Multiple | ↓ 排名 41→65,分数 61.2→50.1 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7% |
| 2 | LemonHarness / Multiple | 84.5% |
| 3 | Capy / GPT-5.5 | 83.1% |