【OpenAI】预览 GPT-5.6 Sol 下一代模型
OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,并配备最先进的安全技术栈。这标志着 OpenAI 模型能力的又一次重大提升。 https://openai.com/index/previewing-gpt-5-6-sol
【Anthropic】Claude Mythos 5 恢复部分访问权限
因美国政府审查,Claude Mythos 5 和 Fable 5 自 6 月 12 日起被暂停访问。现 Mythos 5 已获准重新部署给运营和防御关键基础设施的美国组织,Fable 5 的全面恢复仍在推进中。 https://x.com/AnthropicAI/status/2070665903440871779
【OpenAI】与 Broadcom 推出 LLM 专用推理芯片 Jalapeño
OpenAI 与 Broadcom 联合发布定制 AI 芯片 Jalapeño,专为 LLM 推理优化,旨在提升 AI 系统的性能、效率和规模。这是 OpenAI 在硬件领域的重要布局。 https://openai.com/index/openai-broadcom-jalapeno-inference-chip
【Google】Gemma 4 下载量突破 2 亿
Gemma 4 在仅 2.5 个月内下载量突破 2 亿,而 Gemma 全系列模型在 Gemma 3 发布时总下载量仅为 1 亿。社区采用速度呈现显著加速态势。 https://x.com/demishassabis/status/2070246937719169530
【xAI】Grok TTS 在语音自然度测试中领先
在 Vapi 的 Humanness Index 盲测中,xAI 的 Grok TTS 获得 96 分,仅比真人语音(100 分)低 4 分,在所有主流语音模型中排名第一。 https://x.com/xai/status/2067654108123910495
SWE-bench Verified
Terminal Bench 2.0
/rewind、沙盒凭证保护等功能 更新日志| 日期 | 新闻 |
|---|---|
| 06-26 | 预览 GPT-5.6 Sol:下一代模型,在编程、科学和网络安全领域能力更强,配备最先进的安全栈 链接 |
| 06-25 | 研究:AI Agent 如何改变工作:新研究论文展示 AI Agent 如何处理更长、更复杂的任务 链接 |
| 06-25 | Codex Remote 正式发布:可通过 ChatGPT 移动应用在连接的 Mac/Windows 主机上启动或继续工作 链接 |
| 06-24 | 与 Broadcom 推出 LLM 推理芯片 Jalapeño:定制 AI 芯片,提升推理性能和效率 链接 |
| 06-23 | GPT-5 Pro 助力免疫学家解开 3 年谜题:为 T 细胞行为研究提供突破性见解 链接 |
| 06-23 | 帮助建立高级 AI 共享标准:通过 Appia Foundation 支持评估框架和安全实践 链接 |
| 06-22 | Daybreak 安全工具发布:包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现和修复漏洞 链接 |
| 06-22 | Patch the Planet 计划:帮助开源维护者用 AI 发现、验证和修复漏洞 链接 |
| 06-21 | 三星部署 ChatGPT Enterprise 和 Codex:全球员工规模部署,OpenAI 最大企业级部署之一 链接 |
| 06-18 | ChatGPT Enterprise 新增支出控制和分析:帮助组织管理成本 链接 |
| 06-18 | GPT-5.5 Instant 改善健康智能:更强的推理和上下文理解能力 链接 |
| 06-18 | AI 辅助诊断罕见儿童遗传病:在既往未解病例中识别出 18 个新诊断 链接 |
| 06-17 | 近自主 AI 化学家改进药物反应:GPT-5.4 改进关键药物合成反应 链接 |
| 06-17 | 发布 LifeSciBench:专家编写和评审的生命科学基准测试 链接 |
| 06-16 | 部署模拟方法:在发布前预测模型行为 链接 |
| 06-14 | 推出 OpenAI 合作伙伴网络:投资 1.5 亿美元加速企业 AI 采用 链接 |
Codex 更新动态:
| 日期 | 新闻 |
|---|---|
| 06-27 | 恢复 Mythos 5 访问:美国政府批准向关键基础设施组织重新部署 Mythos 5 网络安全模型,继续推动 Fable 5 恢复通用访问 链接 |
| 06-25 | 加入 RAISE US 创始合作伙伴:非营利联盟,通过雇主主导的行动和 AI 培训加强美国劳动力 链接 |
| 06-23 | 推出 Claude Tag:Claude 可作为 Slack 团队成员加入,访问指定频道和工具 链接 |
| 06-18 | Claude Code 新增 Artifacts:交互式页面功能,支持 PR 演示和项目仪表板,Team 和 Enterprise 计划可用 链接 |
| 06-17 | Claude Design 更新:保持设计系统品牌一致性,支持画布直接编辑,与 Claude Code 同步 链接 |
Claude Code 发布:
| 版本 | 日期 | 更新内容 |
|---|---|---|
| v2.1.195 | 06-26 | 新增 CLAUDE_CODE_DISABLE_MOUSE_CLICKS 设置,全屏模式下禁用鼠标点击/拖拽/悬停 |
| v2.1.193 | 06-25 | 新增 autoMode.classifyAllShell 设置,所有 Bash/PowerShell 命令通过自动模式分类器 |
| v2.1.191 | 06-24 | 新增 /rewind 支持,可从 /clear 之前恢复对话 |
| v2.1.190 | 06-24 | Bug 修复和可靠性改进 |
| v2.1.187 | 06-23 | 新增 sandbox.credentials 设置,阻止沙盒命令读取凭证文件和密钥环境变量 |
| 日期 | 新闻 |
|---|---|
| 06-25 | Gemma 4 下载量突破 2 亿:仅 2.5 个月达成,Gemma 系列总下载量在 Gemma 3 发布时为 1 亿 链接 |
| 06-25 | Google Finance 升级:包括新应用 链接 |
| 06-23 | Project Genie 获戛纳创意节 AI Craft 大奖 链接 |
| 06-22 | 与 A24 建立研究合作伙伴关系:确保未来工具由创作者塑造 链接 |
| 06-17 | AMIE 医疗 AI 研究:发表于 Nature,对话式 AI 系统在复杂疾病管理中匹配初级保健医生 链接 |
| 06-15 | 阿拉巴马州投资 15 亿美元:扩建杰克逊县数据中心园区 链接 |
| 日期 | 新闻 |
|---|---|
| 06-25 | SuperGrok 和 X 订阅可在 T3code 中使用 链接 |
| 06-24 | MongoDB 官方插件上线 Grok Build:查询数据、优化索引、管理数据库 链接 |
| 06-23 | Firecrawl 插件上线 Grok Build 插件市场:支持网页搜索、抓取和交互 链接 |
| 06-22 | Grok 连接 Interactive Brokers:获取投资组合高质量实时信息 链接 |
| 06-22 | Grok Build 新增 /goal 命令:执行长时间自主任务,多轮子 Agent 实现和验证单一目标 链接 |
| 06-18 | Grok TTS 人性化评分 96:Vapi 盲测中接近真人语音(100 分)链接 |
| 06-18 | Grok 模型上线 Databricks Agent Bricks:企业数据驱动的 AI Agent 链接 |
| 06-18 | Grok Word 插件上线:起草文档、总结研究、生成图表 链接 |
| 06-17 | DigitalOcean 一键部署 Grok Build 预装 VM 链接 |
| 06-16 | Grok PowerPoint 插件上线:从提示词到演示文稿,支持实时数据和 MCP 连接 链接 |
| 06-15 | SuperGrok/X Premium 订阅可在 Warp 终端使用 链接 |
| 06-15 | Agent Dashboard 上线:同时管理多个 Agent,查看状态、回复和派发任务 链接 |
| 06-14 | Grok Build 支持终端内渲染数学公式和 LaTeX 链接 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
本期变化:
| 模型 | 变化 | 原排名 → 新排名 | 原分数 → 新分数 |
|---|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct | ↑ | 103 → 76 | 52.2 → 60.4 |
| Warp | ↓ | 11 → 36 | 75.6 → 71.0 |
| devlo | ↓ | 44 → 83/94 | 70.2 → 58.2/54.2 |
| Nemotron-CORTEXA | ↓ | 50 → 82 | 68.2 → 58.2 |
| EPAM AI/Run Developer Agent + GPT4o | ↓ | 156 → 162 | 27.0 → 24.0 |
| Solver (2024-09-12) | ↓ | 120 → 126 | 45.4 → 43.6 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
本期无变动。
来源:Scale Labs Leaderboard(快照时间:2026-06-28)
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
本期变化:
| 模型 | 变化 | 原排名 → 新排名 | 原分数 → 新分数 |
|---|---|---|---|
| LemonHarness / Multiple | ↑↑ | 8 → 2 | 79.9 → 84.5 |
| Gemini CLI / Gemini 3.1 Pro | ↑ | 45 → 40 | 59.4 → 61.4 |
| Warp / Multiple | ↓ | 41 → 47/65 | 61.2 → 59.1/50.1 |
| little-coder / Qwen3.6-35B-A3B | ↑ | 121 → 116 | 23.0 → 24.6 |
当前 Top 3:
| 排名 | 模型 | Elo 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1508.16 |
| 2 | claude-opus-4-6-thinking | 1503.09 |
| 3 | claude-opus-4-7-thinking | 1502.31 |
本期无变动。
来源:HuggingFace Leaderboard Dataset(快照时间:2026-06-25)