【OpenAI】预览 GPT-5.6 Sol 下一代模型 OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,配备最先进的安全技术栈。这标志着 OpenAI 模型能力的又一次重大跃升。 https://openai.com/index/previewing-gpt-5-6-sol
【OpenAI】与 Broadcom 推出 LLM 优化推理芯片 Jalapeño OpenAI 与 Broadcom 联合发布定制 AI 芯片 Jalapeño,专为 LLM 推理设计,旨在提升 AI 系统的性能、效率和规模。这是 OpenAI 在硬件领域的重要布局。 https://openai.com/index/openai-broadcom-jalapeno-inference-chip
【Anthropic】Claude Mythos 5 恢复部分访问权限 Anthropic 宣布,经与美国政府合作,Claude Mythos 5 网络安全模型已恢复对运营关键基础设施的美国组织的访问。Fable 5 的全面开放仍在推进中。 https://x.com/AnthropicAI/status/2070665903440871779
【OpenAI】推出 Daybreak 安全工具套件 OpenAI 发布 Daybreak 安全工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞。同时推出 Patch the Planet 计划支持开源维护者。 https://openai.com/index/daybreak-securing-the-world
【xAI】Grok TTS 在人类语音测试中领先 xAI 的 Grok TTS 模型在 Vapi 人类语音指数盲测中获得 96 分,仅比真实人类语音低 4 分,位居所有模型之首。 https://x.com/xai/status/2067654108123910495
LMArena Overall
SWE-bench Verified
Terminal Bench 2.0
| 日期 | 新闻 |
|---|---|
| 06-26 | 预览 GPT-5.6 Sol,新一代模型强化编程、科学和网络安全能力 链接 |
| 06-26 | Codex 用户获得用量重置,团队调查用量消耗过快问题并已应用缓解措施 链接 |
| 06-25 | 发布研究论文,展示 AI Agent 如何变革工作方式,处理更复杂、长周期的任务 链接 |
| 06-25 | Codex Remote 正式发布,可通过 ChatGPT 移动端远程操作 Mac/Windows 主机 链接 |
| 06-24 | 与 Broadcom 联合发布 Jalapeño LLM 推理芯片,优化 AI 系统性能与效率 链接 |
| 06-24 | GPT-5.5 Instant 更新,改进对话体验和复杂约束处理 链接 |
| 06-23 | GPT-5 Pro 助力免疫学家解开 3 年 T 细胞行为谜题,或助力癌症和自身免疫研究 链接 |
| 06-23 | 通过 Appia Foundation 推动高级 AI 共享标准建设 链接 |
| 06-22 | 发布 Daybreak 安全工具套件,包括 Codex Security 和 GPT-5.5-Cyber 链接 |
| 06-22 | 推出 Patch the Planet 计划,帮助开源维护者发现和修复漏洞 链接 |
| 06-21 | 三星电子全球部署 ChatGPT Enterprise 和 Codex,为最大规模企业 AI 部署之一 链接 |
| 06-18 | ChatGPT Enterprise 新增用量分析和支出控制功能 链接 |
| 06-18 | GPT-5.5 Instant 改进健康智能响应,增强推理和上下文理解 链接 |
| 06-17 | 发布 LifeSciBench,专家编写和评审的生命科学 AI 评估基准 链接 |
| 06-14 | 推出 OpenAI 合作伙伴网络,投资 1.5 亿美元加速企业 AI 采用 链接 |
| 日期 | 新闻 |
|---|---|
| 06-27 | 美国政府部分解除限制,Mythos 5 可重新部署给关键基础设施运营方,Fable 5 仍待恢复 链接 |
| 06-25 | 加入 RAISE US 创始合作伙伴,推动美国劳动力 AI 转型培训 链接 |
| 06-23 | 推出 Claude Tag,Slack 中以团队成员身份参与频道协作 链接 |
| 06-18 | Claude Code 新增 Artifacts 功能,可构建交互式页面和项目仪表板 链接 |
| 06-17 | Claude Design 更新:跨项目保持设计系统一致性,画布直接编辑,与 Claude Code 同步 链接 |
| 06-13 | 美国政府以国家安全为由发布出口管制令,暂停所有用户对 Fable 5 和 Mythos 5 的访问 链接 |
Claude Code 更新:
CLAUDE_CODE_DISABLE_MOUSE_CLICKS 设置 链接autoMode.classifyAllShell 设置 链接/rewind 支持,可恢复 /clear 前的对话 链接sandbox.credentials 设置保护凭证文件 链接| 日期 | 新闻 |
|---|---|
| 06-25 | SuperGrok 和 X 订阅可在 T3code 中使用 链接 |
| 06-24 | Grok Build 新增 MongoDB 官方插件 链接 |
| 06-23 | Firecrawl 插件上线 Grok Build 插件市场 链接 |
| 06-22 | Grok 可连接 Interactive Brokers 查看投资组合 链接 |
| 06-22 | Grok Build 新增 /goal 命令,支持多轮子 Agent 自主执行长任务 链接 |
| 06-18 | Grok TTS 在 Vapi 人性化指数盲测中以 96 分领先 链接 |
| 06-18 | Grok 模型上线 Databricks Agent Bricks 链接 |
| 06-18 | Grok Word 插件上线,支持文档起草和图表生成 链接 |
| 06-17 | DigitalOcean 一键部署预装 Grok Build 的虚拟机 链接 |
| 06-16 | Grok PowerPoint 插件上线 链接 |
| 06-15 | Warp 终端支持 SuperGrok/X Premium 订阅 链接 |
| 06-15 | Agent Dashboard 上线,可同时管理多个 Agent 链接 |
| 日期 | 新闻 |
|---|---|
| 06-25 | Gemma 4 下载量 2.5 个月突破 2 亿次 链接 |
| 06-25 | Google Finance 升级,推出新应用 链接 |
| 06-23 | Project Genie 获戛纳创意节 AI 工艺类大奖 链接 |
| 06-22 | Google DeepMind 与 A24 建立研究合作伙伴关系 链接 |
| 06-17 | AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理上匹敌初级保健医生 链接 |
| 06-15 | 宣布 15 亿美元投资扩建阿拉巴马州数据中心园区 链接 |
本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
来源:GitHub
本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | Claude Opus 4-6 (thinking)* | 51.9 |
来源:Scale Labs
本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
来源:TBench
本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5 | 1508.2 |
| 2 | Claude Opus 4-6-thinking | 1503.1 |
| 3 | Claude Opus 4-7-thinking | 1502.3 |
来源:HuggingFace
显著变化:
| 模型 | 变化 | 前排名 | 现排名 | 前分数 | 现分数 |
|---|---|---|---|---|---|
| grok-4.20-beta-0309-reasoning | ↑ | 18 | 15 | 1474.4 | 1475.5 |
| glm-5.1 | ↓ | 15 | 19 | 1475.3 | 1473.4 |
| nvidia-nemotron-3-ultra-550b | ↑ | 97 | 90 | 1416.0 | 1420.5 |
| claude-opus-4-8 | ↑ | 12 | 11 | 1477.9 | 1479.1 |
| gpt-5.4-high | ↓ | 11 | 12 | 1478.0 | 1477.8 |
| deepseek-v4-flash | ↑ | 67 | 66 | 1433.9 | 1435.1 |
| grok-4.3 | ↓ | 56 | 59 | 1444.0 | 1442.9 |
| deepseek-v4-pro-thinking | ↓ | 36 | 38 | 1457.7 | 1456.7 |
新上榜:qwen3.7-plus(第 32 名,1463.8 分)
显著变化:
| 模型 | 变化 | 前排名 | 现排名 | 前分数 | 现分数 |
|---|---|---|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B | ↑ | 103 | 76 | 52.2 | 60.4 |
| Warp | ↓ | 11 | 36 | 75.6 | 71.0 |
| Nemotron-CORTEXA | ↓ | 50 | 82 | 68.2 | 58.2 |
| devlo | ↓ | 44 | 94 | 70.2 | 54.2 |
| EPAM AI/Run + GPT4o | ↓ | 156 | 162 | 27.0 | 24.0 |
显著变化:
| 模型 | 变化 | 前排名 | 现排名 | 前分数 | 现分数 |
|---|---|---|---|---|---|
| LemonHarness / Multiple | ↑ | 8 | 2 | 79.9 | 84.5 |
| Gemini CLI / Gemini 3.1 Pro | ↑ | 45 | 40 | 59.4 | 61.4 |
| Warp / Multiple | ↓ | 41 | 65 | 61.2 | 50.1 |
| little-coder / Qwen3.6-35B | ↑ | 121 | 116 | 23.0 | 24.6 |