← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-29 01:01

2026-06-29 09:01 CST
快速版 完整版

核心速览

【OpenAI】预览 GPT-5.6 Sol 下一代模型

OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,配备最先进的安全技术栈。这是 OpenAI 最新一代模型的重要里程碑。原文链接:https://openai.com/index/previewing-gpt-5-6-sol

【OpenAI & Broadcom】联合发布 LLM 推理芯片 Jalapeño

OpenAI 与 Broadcom 合作推出定制 AI 芯片 Jalapeño,专为 LLM 推理优化,旨在提升性能、效率和规模化能力。标志着 OpenAI 正式进军自研芯片领域。原文链接:https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【Anthropic】Claude Mythos 5 恢复部分访问权限

自 6 月 12 日起被美国政府限制后,Anthropic 最强网络安全模型 Mythos 5 现已恢复对美国关键基础设施运营机构的访问。Fable 5 仍待进一步解禁。原文链接:https://x.com/AnthropicAI/status/2070665903440871779

【Samsung】全球部署 ChatGPT Enterprise 和 Codex

三星电子在全球范围内部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 最大规模的企业级 AI 部署之一,标志着企业 AI 采用的重要进展。原文链接:https://openai.com/index/samsung-electronics-chatgpt-codex-deployment

【Google】Gemma 4 下载量突破 2 亿

Gemma 4 在 2.5 个月内下载量突破 2 亿次,而 Gemma 全系列此前总下载量为 1 亿次。社区采用速度显著加快。原文链接:https://x.com/demishassabis/status/2070246937719169530

重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 提升至 60.4(+8.2 分,上升 27 名)
  • Warp:排名从 11 跌至 36,分数从 75.6 降至 71.0(-4.6 分,下降 25 名)
  • devlo:排名从 44 跌至 94,分数从 70.2 降至 54.2(-16.0 分,下降 50 名)
  • Nemotron-CORTEXA:排名从 50 跌至 82,分数从 68.2 降至 58.2(-10.0 分,下降 32 名)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至 2,分数从 79.9 提升至 84.5(+4.6 分,上升 6 名)
  • Warp / Multiple:排名从 41 跌至 65,分数从 61.2 降至 50.1(-11.1 分,下降 24 名)

快速预览

  • OpenAI 预览 GPT-5.6 Sol:下一代模型,强化编程、科学和网络安全能力,配备最先进安全栈 (来源)
  • Anthropic 恢复 Claude Mythos 5 访问:美国政府批准向关键基础设施运营方重新部署该网络安全模型 (来源)
  • SWE-Bench Pro Public 榜单:GPT-5.4 (xHigh) 以 59.1 分领跑,Claude Opus 4.6 (thinking) 51.9 分居第三 (榜单)
  • Terminal Bench 2.0 变化:LemonHarness 从第 8 名跃升至第 2 名,分数从 79.9 升至 84.5 (榜单)
  • xAI Grok 生态扩展:新增 MongoDB 插件、Firecrawl 插件、Interactive Brokers 集成、Word/PowerPoint 插件等

新闻

OpenAI

日期 新闻
06-28 HP 与 OpenAI 扩大 Frontier 战略合作,在客户体验、软件开发和企业运营中部署 AI
06-26 预览 GPT-5.6 Sol,下一代模型,编程、科学和网络安全能力更强
06-25 发布研究论文:AI Agent 如何变革工作方式
06-25 Codex Remote 正式发布,可通过 ChatGPT 移动端远程操作 Mac/Windows
06-24 与 Broadcom 发布 Jalapeño 芯片,专为 LLM 推理优化的定制 AI 芯片
06-23 GPT-5 Pro 助力免疫学家解开 3 年 T 细胞行为谜题,或助力癌症和自身免疫研究
06-23 支持 Appia Foundation 建立高级 AI 共享标准
06-22 发布 Daybreak 安全工具套件,含 Codex Security 和 GPT-5.5-Cyber
06-22 Patch the Planet 计划:帮助开源维护者发现和修复漏洞
06-21 三星向全球员工部署 ChatGPT Enterprise 和 Codex,规模最大的企业 AI 部署之一
06-18 ChatGPT Enterprise 新增支出控制和使用分析
06-18 GPT-5.5 Instant 改进健康智能响应
06-18 AI 辅助诊断罕见儿童遗传病,在未解病例中新增 18 例诊断
06-17 发布 LifeSciBench:专家编写和评审的生命科学基准测试
06-17 近自主 AI 化学家改进药物合成关键反应
06-16 发布 Deployment Simulation 方法,在发布前预测模型行为

Codex 更新06-22 iOS 新增主机个性设置 | 06-18 macOS 新增 Record & Replay 功能 | 06-16 EEA/UK/瑞士功能扩展

Anthropic

日期 新闻
06-27 美国政府批准恢复 Claude Mythos 5 访问,向关键基础设施运营方重新部署;Fable 5 仍在协调中
06-25 加入 RAISE US 创始合作伙伴,推动 AI 时代劳动力转型
06-23 推出 Claude Tag:Claude 以团队成员身份加入 Slack 频道

Claude Code 发布v2.1.195 新增禁用鼠标点击选项 | v2.1.193 新增 autoMode.classifyAllShell 设置 | v2.1.191 /rewind 支持从 /clear 前恢复对话 | v2.1.187 新增沙箱凭证保护设置

xAI

日期 新闻
06-25 SuperGrok 和 X 订阅现可在 T3code 中使用
06-24 MongoDB 官方插件上线 Grok Build
06-23 Firecrawl 插件上线 Grok Build 插件市场
06-22 Grok 连接 Interactive Brokers,支持投资组合分析
06-22 Grok Build 新增 /goal 命令,执行长时间自主任务
06-18 Grok TTS 在 Vapi 人性化指数盲测中以 96 分领先
06-18 Grok 模型上线 Databricks Agent Bricks
06-18 Grok Word 插件上线
06-17 DigitalOcean 一键部署预装 Grok Build 的 VM
06-16 Grok PowerPoint 插件上线
06-15 SuperGrok/X Premium 订阅现可在 Warp 终端使用
06-15 Agent Dashboard 上线,管理多个 Agent

Google

日期 新闻
06-25 Gemma 4 下载量突破 2 亿,仅用 2.5 个月
06-25 Google Finance 升级,推出新 App
06-23 Project Genie 获戛纳创意节 AI 工艺大奖
06-22 Google DeepMind 与 A24 建立研究合作
06-17 AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级医生水平
06-15 宣布 15 亿美元投资阿拉巴马州数据中心

Benchmark 快照与变化

SWE-Bench Verified

当前 Top 3

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

本期变化

模型 变化
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 排名 103→76,分数 52.2→60.4 (+8.2)
Warp 排名 11→36,分数 75.6→71.0 (-4.6)
Nemotron-CORTEXA 排名 50→82,分数 68.2→58.2 (-10.0)
devlo 排名 44→83/94,分数 70.2→58.2/54.2
EPAM AI/Run Developer Agent + GPT4o 排名 156→162,分数 27.0→24.0

来源:GitHub

SWE-Bench Pro Public

当前 Top 3

排名 模型 分数
1 GPT-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 Claude Opus 4.6 (thinking)* 51.9

本期无变动

来源:Scale Labs

Terminal Bench 2.0

当前 Top 3

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

本期变化

模型 变化
LemonHarness / Multiple 排名 8→2,分数 79.9→84.5 (+4.6)
Gemini CLI / Gemini 3.1 Pro 排名 45→40,分数 59.4→61.4 (+2.0)
Warp / Multiple 排名 41→47/65,分数 61.2→59.1/50.1
little-coder / Qwen3.6-35B-A3B 排名 121→116,分数 23.0→24.6 (+1.6)

来源:TBench

LMArena Leaderboard

当前 Top 3

排名 模型 分数
1 Claude Fable 5 1508.16
2 Claude Opus 4.6 (thinking) 1503.09
3 Claude Opus 4.7 (thinking) 1502.31

本期无变动

来源:HuggingFace

来源 · 63 条