← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-28 00:46

2026-06-28 08:46 CST
快速版 完整版

核心速览

【OpenAI】预览 GPT-5.6 Sol 下一代模型

OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,并配备最先进的安全技术栈。这标志着 OpenAI 模型能力的又一次重大提升。 https://openai.com/index/previewing-gpt-5-6-sol

【Anthropic】Claude Mythos 5 恢复部分访问权限

因美国政府审查,Claude Mythos 5 和 Fable 5 自 6 月 12 日起被暂停访问。现 Mythos 5 已获准重新部署给运营和防御关键基础设施的美国组织,Fable 5 的全面恢复仍在推进中。 https://x.com/AnthropicAI/status/2070665903440871779

【OpenAI】与 Broadcom 推出 LLM 专用推理芯片 Jalapeño

OpenAI 与 Broadcom 联合发布定制 AI 芯片 Jalapeño,专为 LLM 推理优化,旨在提升 AI 系统的性能、效率和规模。这是 OpenAI 在硬件领域的重要布局。 https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【Google】Gemma 4 下载量突破 2 亿

Gemma 4 在仅 2.5 个月内下载量突破 2 亿,而 Gemma 全系列模型在 Gemma 3 发布时总下载量仅为 1 亿。社区采用速度呈现显著加速态势。 https://x.com/demishassabis/status/2070246937719169530

【xAI】Grok TTS 在语音自然度测试中领先

在 Vapi 的 Humanness Index 盲测中,xAI 的 Grok TTS 获得 96 分,仅比真人语音(100 分)低 4 分,在所有主流语音模型中排名第一。 https://x.com/xai/status/2067654108123910495

重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 提升至 60.4(+15.7%)
  • Warp:排名从 11 降至 36,分数从 75.6 降至 71.0(-6.1%)
  • devlo:排名从 44 降至 83,分数从 70.2 降至 58.2(-17.1%)
  • Nemotron-CORTEXA:排名从 50 降至 82,分数从 68.2 降至 58.2(-14.7%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至第 2,分数从 79.9 提升至 84.5(+5.8%)
  • Warp / Multiple:排名从 41 降至 65,分数从 61.2 降至 50.1(-18.1%)

快速预览

  • OpenAI 预览 GPT-5.6 Sol:下一代模型,强化编程、科学和网络安全能力 来源
  • Anthropic 恢复 Mythos 5 访问:美国政府批准向关键基础设施组织重新部署网络安全模型 来源
  • SWE-Bench Pro 榜单:GPT-5.4 (xHigh) 以 59.1 分领跑,Claude Opus 4-6 (thinking) 51.9 分居第三 榜单
  • Terminal Bench 2.0 变化:LemonHarness 从第 8 名跃升至第 2 名(79.9→84.5 分)榜单
  • Claude Code 持续更新:本周发布 5 个版本,新增 /rewind、沙盒凭证保护等功能 更新日志

新闻

OpenAI

日期 新闻
06-26 预览 GPT-5.6 Sol:下一代模型,在编程、科学和网络安全领域能力更强,配备最先进的安全栈 链接
06-25 研究:AI Agent 如何改变工作:新研究论文展示 AI Agent 如何处理更长、更复杂的任务 链接
06-25 Codex Remote 正式发布:可通过 ChatGPT 移动应用在连接的 Mac/Windows 主机上启动或继续工作 链接
06-24 与 Broadcom 推出 LLM 推理芯片 Jalapeño:定制 AI 芯片,提升推理性能和效率 链接
06-23 GPT-5 Pro 助力免疫学家解开 3 年谜题:为 T 细胞行为研究提供突破性见解 链接
06-23 帮助建立高级 AI 共享标准:通过 Appia Foundation 支持评估框架和安全实践 链接
06-22 Daybreak 安全工具发布:包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现和修复漏洞 链接
06-22 Patch the Planet 计划:帮助开源维护者用 AI 发现、验证和修复漏洞 链接
06-21 三星部署 ChatGPT Enterprise 和 Codex:全球员工规模部署,OpenAI 最大企业级部署之一 链接
06-18 ChatGPT Enterprise 新增支出控制和分析:帮助组织管理成本 链接
06-18 GPT-5.5 Instant 改善健康智能:更强的推理和上下文理解能力 链接
06-18 AI 辅助诊断罕见儿童遗传病:在既往未解病例中识别出 18 个新诊断 链接
06-17 近自主 AI 化学家改进药物反应:GPT-5.4 改进关键药物合成反应 链接
06-17 发布 LifeSciBench:专家编写和评审的生命科学基准测试 链接
06-16 部署模拟方法:在发布前预测模型行为 链接
06-14 推出 OpenAI 合作伙伴网络:投资 1.5 亿美元加速企业 AI 采用 链接

Codex 更新动态

  • 06-26:Codex 团队调查用量异常消耗问题,为所有用户重置用量 来源
  • 06-22:iOS 版新增主机个性设置(Friendly/Pragmatic 选项)链接
  • 06-18:macOS 新增 Record & Replay 功能,将演示工作流转为可复用技能 链接
  • 06-16:Codex 应用功能扩展至 EEA、英国和瑞士 链接
  • 06-15:iOS 新增工作区文件浏览器 链接

Anthropic

日期 新闻
06-27 恢复 Mythos 5 访问:美国政府批准向关键基础设施组织重新部署 Mythos 5 网络安全模型,继续推动 Fable 5 恢复通用访问 链接
06-25 加入 RAISE US 创始合作伙伴:非营利联盟,通过雇主主导的行动和 AI 培训加强美国劳动力 链接
06-23 推出 Claude Tag:Claude 可作为 Slack 团队成员加入,访问指定频道和工具 链接
06-18 Claude Code 新增 Artifacts:交互式页面功能,支持 PR 演示和项目仪表板,Team 和 Enterprise 计划可用 链接
06-17 Claude Design 更新:保持设计系统品牌一致性,支持画布直接编辑,与 Claude Code 同步 链接

Claude Code 发布

版本 日期 更新内容
v2.1.195 06-26 新增 CLAUDE_CODE_DISABLE_MOUSE_CLICKS 设置,全屏模式下禁用鼠标点击/拖拽/悬停
v2.1.193 06-25 新增 autoMode.classifyAllShell 设置,所有 Bash/PowerShell 命令通过自动模式分类器
v2.1.191 06-24 新增 /rewind 支持,可从 /clear 之前恢复对话
v2.1.190 06-24 Bug 修复和可靠性改进
v2.1.187 06-23 新增 sandbox.credentials 设置,阻止沙盒命令读取凭证文件和密钥环境变量

Google

日期 新闻
06-25 Gemma 4 下载量突破 2 亿:仅 2.5 个月达成,Gemma 系列总下载量在 Gemma 3 发布时为 1 亿 链接
06-25 Google Finance 升级:包括新应用 链接
06-23 Project Genie 获戛纳创意节 AI Craft 大奖 链接
06-22 与 A24 建立研究合作伙伴关系:确保未来工具由创作者塑造 链接
06-17 AMIE 医疗 AI 研究:发表于 Nature,对话式 AI 系统在复杂疾病管理中匹配初级保健医生 链接
06-15 阿拉巴马州投资 15 亿美元:扩建杰克逊县数据中心园区 链接

xAI

日期 新闻
06-25 SuperGrok 和 X 订阅可在 T3code 中使用 链接
06-24 MongoDB 官方插件上线 Grok Build:查询数据、优化索引、管理数据库 链接
06-23 Firecrawl 插件上线 Grok Build 插件市场:支持网页搜索、抓取和交互 链接
06-22 Grok 连接 Interactive Brokers:获取投资组合高质量实时信息 链接
06-22 Grok Build 新增 /goal 命令:执行长时间自主任务,多轮子 Agent 实现和验证单一目标 链接
06-18 Grok TTS 人性化评分 96:Vapi 盲测中接近真人语音(100 分)链接
06-18 Grok 模型上线 Databricks Agent Bricks:企业数据驱动的 AI Agent 链接
06-18 Grok Word 插件上线:起草文档、总结研究、生成图表 链接
06-17 DigitalOcean 一键部署 Grok Build 预装 VM 链接
06-16 Grok PowerPoint 插件上线:从提示词到演示文稿,支持实时数据和 MCP 连接 链接
06-15 SuperGrok/X Premium 订阅可在 Warp 终端使用 链接
06-15 Agent Dashboard 上线:同时管理多个 Agent,查看状态、回复和派发任务 链接
06-14 Grok Build 支持终端内渲染数学公式和 LaTeX 链接

Benchmark 快照与变化

SWE-Bench Verified

当前 Top 3

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

本期变化

模型 变化 原排名 → 新排名 原分数 → 新分数
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 103 → 76 52.2 → 60.4
Warp 11 → 36 75.6 → 71.0
devlo 44 → 83/94 70.2 → 58.2/54.2
Nemotron-CORTEXA 50 → 82 68.2 → 58.2
EPAM AI/Run Developer Agent + GPT4o 156 → 162 27.0 → 24.0
Solver (2024-09-12) 120 → 126 45.4 → 43.6

来源:GitHub - live-swe-agent


SWE-Bench Pro (Public)

当前 Top 3

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 claude-opus-4-6 (thinking)* 51.9

本期无变动

来源:Scale Labs Leaderboard(快照时间:2026-06-28)


Terminal Bench 2.0

当前 Top 3

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

本期变化

模型 变化 原排名 → 新排名 原分数 → 新分数
LemonHarness / Multiple ↑↑ 8 → 2 79.9 → 84.5
Gemini CLI / Gemini 3.1 Pro 45 → 40 59.4 → 61.4
Warp / Multiple 41 → 47/65 61.2 → 59.1/50.1
little-coder / Qwen3.6-35B-A3B 121 → 116 23.0 → 24.6

来源:TBench Leaderboard


LMArena (Overall)

当前 Top 3

排名 模型 Elo 分数
1 claude-fable-5 1508.16
2 claude-opus-4-6-thinking 1503.09
3 claude-opus-4-7-thinking 1502.31

本期无变动

来源:HuggingFace Leaderboard Dataset(快照时间:2026-06-25)

来源 · 65 条