← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-27 00:37

2026-06-27 08:37 CST
快速版 完整版

核心速览

【OpenAI】预览 GPT-5.6 Sol 下一代模型 OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,配备最先进的安全技术栈。这标志着 OpenAI 模型能力的又一次重大跃升。 https://openai.com/index/previewing-gpt-5-6-sol

【OpenAI】与 Broadcom 推出 LLM 优化推理芯片 Jalapeño OpenAI 与 Broadcom 联合发布定制 AI 芯片 Jalapeño,专为 LLM 推理设计,旨在提升 AI 系统的性能、效率和规模。这是 OpenAI 在硬件领域的重要布局。 https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【Anthropic】Claude Mythos 5 恢复部分访问权限 Anthropic 宣布,经与美国政府合作,Claude Mythos 5 网络安全模型已恢复对运营关键基础设施的美国组织的访问。Fable 5 的全面开放仍在推进中。 https://x.com/AnthropicAI/status/2070665903440871779

【OpenAI】推出 Daybreak 安全工具套件 OpenAI 发布 Daybreak 安全工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞。同时推出 Patch the Planet 计划支持开源维护者。 https://openai.com/index/daybreak-securing-the-world

【xAI】Grok TTS 在人类语音测试中领先 xAI 的 Grok TTS 模型在 Vapi 人类语音指数盲测中获得 96 分,仅比真实人类语音低 4 分,位居所有模型之首。 https://x.com/xai/status/2067654108123910495


重大 Benchmark 变化

LMArena Overall

  • glm-5.1:排名从第 15 位降至第 19 位(下降 4 位),分数从 1475.26 降至 1473.42
  • grok-4.20-beta-0309-reasoning:排名从第 18 位升至第 15 位(上升 3 位),分数从 1474.41 升至 1475.50
  • grok-4.3:排名从第 56 位降至第 59 位(下降 3 位),分数从 1444.02 降至 1442.89
  • nvidia-nemotron-3-ultra-550b-a55b-nvfp4:排名从第 97 位升至第 90 位(上升 7 位),分数从 1416.03 升至 1420.46
  • qwen3.7-plus:新上榜,排名第 32 位,分数 1463.83

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从第 103 位升至第 76 位(上升 27 位),分数从 52.2% 升至 60.4%
  • Nemotron-CORTEXA:排名从第 50 位降至第 82 位(下降 32 位),分数从 68.2% 降至 58.2%
  • Warp:排名从第 11 位降至第 36 位(下降 25 位),分数从 75.6% 降至 71.0%
  • devlo:排名从第 44 位降至第 94 位(下降 50 位),分数从 70.2% 降至 54.2%

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从第 8 位升至第 2 位(上升 6 位),分数从 79.9% 升至 84.5%
  • Warp / Multiple:排名从第 41 位降至第 65 位(下降 24 位),分数从 61.2% 降至 50.1%

快速预览

  • OpenAI 预览 GPT-5.6 Sol:新一代模型,强化编程、科学和网络安全能力,配套最先进安全框架 链接
  • Anthropic 恢复 Mythos 5 部分访问:美国政府解除部分限制,关键基础设施运营方可使用 Mythos 5,Fable 5 仍待恢复 链接
  • SWE-Bench Pro 榜单更新:GPT-5.4 (xHigh) 以 59.1 分领跑,Muse Spark 55.0 分居次,Claude Opus 4.6 (thinking) 51.9 分第三
  • LM Arena 榜首稳定:Claude Fable 5 以 1508 分继续领跑,Claude Opus 4-6-thinking 1503 分第二
  • Terminal Bench 2.0 大幅变动:LemonHarness 从第 8 名跃升至第 2 名,分数从 79.9 升至 84.5

新闻动态

OpenAI

日期 新闻
06-26 预览 GPT-5.6 Sol,新一代模型强化编程、科学和网络安全能力 链接
06-26 Codex 用户获得用量重置,团队调查用量消耗过快问题并已应用缓解措施 链接
06-25 发布研究论文,展示 AI Agent 如何变革工作方式,处理更复杂、长周期的任务 链接
06-25 Codex Remote 正式发布,可通过 ChatGPT 移动端远程操作 Mac/Windows 主机 链接
06-24 与 Broadcom 联合发布 Jalapeño LLM 推理芯片,优化 AI 系统性能与效率 链接
06-24 GPT-5.5 Instant 更新,改进对话体验和复杂约束处理 链接
06-23 GPT-5 Pro 助力免疫学家解开 3 年 T 细胞行为谜题,或助力癌症和自身免疫研究 链接
06-23 通过 Appia Foundation 推动高级 AI 共享标准建设 链接
06-22 发布 Daybreak 安全工具套件,包括 Codex Security 和 GPT-5.5-Cyber 链接
06-22 推出 Patch the Planet 计划,帮助开源维护者发现和修复漏洞 链接
06-21 三星电子全球部署 ChatGPT Enterprise 和 Codex,为最大规模企业 AI 部署之一 链接
06-18 ChatGPT Enterprise 新增用量分析和支出控制功能 链接
06-18 GPT-5.5 Instant 改进健康智能响应,增强推理和上下文理解 链接
06-17 发布 LifeSciBench,专家编写和评审的生命科学 AI 评估基准 链接
06-14 推出 OpenAI 合作伙伴网络,投资 1.5 亿美元加速企业 AI 采用 链接

Anthropic

日期 新闻
06-27 美国政府部分解除限制,Mythos 5 可重新部署给关键基础设施运营方,Fable 5 仍待恢复 链接
06-25 加入 RAISE US 创始合作伙伴,推动美国劳动力 AI 转型培训 链接
06-23 推出 Claude Tag,Slack 中以团队成员身份参与频道协作 链接
06-18 Claude Code 新增 Artifacts 功能,可构建交互式页面和项目仪表板 链接
06-17 Claude Design 更新:跨项目保持设计系统一致性,画布直接编辑,与 Claude Code 同步 链接
06-13 美国政府以国家安全为由发布出口管制令,暂停所有用户对 Fable 5 和 Mythos 5 的访问 链接

Claude Code 更新

  • v2.1.195 (06-26):新增 CLAUDE_CODE_DISABLE_MOUSE_CLICKS 设置 链接
  • v2.1.193 (06-25):新增 autoMode.classifyAllShell 设置 链接
  • v2.1.191 (06-24):新增 /rewind 支持,可恢复 /clear 前的对话 链接
  • v2.1.187 (06-23):新增 sandbox.credentials 设置保护凭证文件 链接

xAI

日期 新闻
06-25 SuperGrok 和 X 订阅可在 T3code 中使用 链接
06-24 Grok Build 新增 MongoDB 官方插件 链接
06-23 Firecrawl 插件上线 Grok Build 插件市场 链接
06-22 Grok 可连接 Interactive Brokers 查看投资组合 链接
06-22 Grok Build 新增 /goal 命令,支持多轮子 Agent 自主执行长任务 链接
06-18 Grok TTS 在 Vapi 人性化指数盲测中以 96 分领先 链接
06-18 Grok 模型上线 Databricks Agent Bricks 链接
06-18 Grok Word 插件上线,支持文档起草和图表生成 链接
06-17 DigitalOcean 一键部署预装 Grok Build 的虚拟机 链接
06-16 Grok PowerPoint 插件上线 链接
06-15 Warp 终端支持 SuperGrok/X Premium 订阅 链接
06-15 Agent Dashboard 上线,可同时管理多个 Agent 链接

Google

日期 新闻
06-25 Gemma 4 下载量 2.5 个月突破 2 亿次 链接
06-25 Google Finance 升级,推出新应用 链接
06-23 Project Genie 获戛纳创意节 AI 工艺类大奖 链接
06-22 Google DeepMind 与 A24 建立研究合作伙伴关系 链接
06-17 AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理上匹敌初级保健医生 链接
06-15 宣布 15 亿美元投资扩建阿拉巴马州数据中心园区 链接

Benchmark 快照

SWE-Bench Verified

本期无变动

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

来源:GitHub

SWE-Bench Pro Public

本期无变动

排名 模型 分数
1 GPT-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 Claude Opus 4-6 (thinking)* 51.9

来源:Scale Labs

Terminal Bench 2.0

本期无变动

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

来源:TBench

LM Arena Overall

本期无变动

排名 模型 分数
1 Claude Fable 5 1508.2
2 Claude Opus 4-6-thinking 1503.1
3 Claude Opus 4-7-thinking 1502.3

来源:HuggingFace


榜单变化

LM Arena Overall

显著变化

模型 变化 前排名 现排名 前分数 现分数
grok-4.20-beta-0309-reasoning 18 15 1474.4 1475.5
glm-5.1 15 19 1475.3 1473.4
nvidia-nemotron-3-ultra-550b 97 90 1416.0 1420.5
claude-opus-4-8 12 11 1477.9 1479.1
gpt-5.4-high 11 12 1478.0 1477.8
deepseek-v4-flash 67 66 1433.9 1435.1
grok-4.3 56 59 1444.0 1442.9
deepseek-v4-pro-thinking 36 38 1457.7 1456.7

新上榜:qwen3.7-plus(第 32 名,1463.8 分)

SWE-Bench Verified

显著变化

模型 变化 前排名 现排名 前分数 现分数
EntroPO + R2E + Qwen3-Coder-30B 103 76 52.2 60.4
Warp 11 36 75.6 71.0
Nemotron-CORTEXA 50 82 68.2 58.2
devlo 44 94 70.2 54.2
EPAM AI/Run + GPT4o 156 162 27.0 24.0

Terminal Bench 2.0

显著变化

模型 变化 前排名 现排名 前分数 现分数
LemonHarness / Multiple 8 2 79.9 84.5
Gemini CLI / Gemini 3.1 Pro 45 40 59.4 61.4
Warp / Multiple 41 65 61.2 50.1
little-coder / Qwen3.6-35B 121 116 23.0 24.6
来源 · 66 条