← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-22 10:17

2026-06-22 18:17 CST
快速版 完整版

核心速览

【OpenAI】三星全球部署 ChatGPT Enterprise 和 Codex 三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 最大规模的企业级 AI 部署之一。标志着 AI 编程助手在大型企业中的主流化应用。 原文链接:https://openai.com/index/samsung-electronics-chatgpt-codex-deployment

【OpenAI】Codex 新增 Record & Replay 功能 用户可演示一次工作流程,Codex 将其转化为可复用的技能。支持将录制的工作流转化为可检查、可编辑的技能,降低重复任务的操作成本。 原文链接:https://x.com/gdb/status/2067700691062464887

【Anthropic】Claude Code 新增 Artifacts 功能 Claude Code 支持在会话中构建交互式页面,如 PR 演示或项目仪表板,可通过私有链接与团队共享。目前处于 Beta 阶段,面向 Team 和 Enterprise 计划用户开放。 原文链接:https://x.com/mikeyk/status/2067674333502427620

【Google DeepMind】AlphaFold 核心人物 John Jumper 加入 Anthropic John Jumper 在 Google DeepMind 近 9 年后离职,将加入 Anthropic。他曾领导 AlphaFold 团队,该成果改变了 AI 在科学和医学领域的应用方向。 原文链接:https://x.com/demishassabis/status/2068002732250640603

【xAI】Grok TTS 在语音人性化评测中领先 Grok TTS 在 Vapi 的 Humanness Index 盲测中获得 96 分,仅比真人语音低 4 分,在所有语音模型中排名第一。 原文链接:https://x.com/xai/status/2067654108123910495


重大 Benchmark 变化

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从第 8 升至第 2,分数从 79.9 提升至 84.5(+5.8%)
  • Warp / Multiple:排名从第 41 跌至第 65,分数从 61.2 降至 50.1(-18.1%)

SWE-bench Verified

  • devlo:排名从第 44 跌至第 94,分数从 70.2 降至 54.2(-22.8%)
  • Warp:排名从第 11 跌至第 36,分数从 75.6 降至 71.0(-6.1%)
  • Nemotron-CORTEXA:排名从第 50 跌至第 82,分数从 68.2 降至 58.2(-14.7%)
  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从第 103 升至第 76,分数从 52.2 提升至 60.4(+15.7%)

快速预览

  • OpenAI: 三星电子部署 ChatGPT Enterprise 和 Codex,为最大规模企业 AI 部署之一;Codex 新增远程/本地会话切换功能
  • Anthropic: Claude Code 新增 Artifacts 功能,支持生成交互式页面;AlphaFold 核心人物 John Jumper 加入 Anthropic
  • xAI: Grok TTS 在 Vapi 人性化指数测试中获 96 分,接近真人水平;Grok 登陆 Databricks、Word、PowerPoint
  • Benchmark: SWE-Bench Pro Public 本期无变动,GPT-5.4 以 59.1 分领跑;Terminal Bench 2 中 LemonHarness 排名从第 8 升至第 2
  • 医疗 AI: OpenAI o3 助力罕见遗传病诊断;Google AMIE 研究发表于 Nature

新闻详情

OpenAI

日期 新闻 来源
06-21 三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,为 OpenAI 最大规模企业部署之一 链接
06-21 Tibo 征求 Codex App 改进建议 链接
06-20 Tibo 表示 Codex App 使用时间已超过 Mac 上所有其他应用总和 链接
06-19 Codex 支持远程/本地会话切换,可在笔记本和远程主机间无缝交接任务 链接
06-19 企业管理后台新增信用使用分析和支出控制功能 链接
06-18 Codex App 新增 Record & Replay 功能,可将演示工作流转为可复用技能(欧洲经济区暂不可用) 链接
06-18 GPT-5.5 Instant 在健康问答方面已达到前沿 Thinking 模型水平 链接
06-18 研究人员使用 o3 帮助诊断罕见儿童遗传病,在既往未解决病例中发现 18 个新诊断 链接
06-17 发布 LifeSciBench,用于评估 AI 系统处理生命科学研究任务的能力 链接
06-17 GPT-5.4 辅助药物化学研究,改进了一种广泛使用的药物发现反应 链接
06-17 Codex 功能(Computer Use、Chrome 扩展、个性化记忆、Chronicle)向欧洲扩展 链接

Anthropic

日期 新闻 来源
06-20 Claude Code v2.1.185 发布,优化流停滞提示,触发时间从 10s 延长至 20s 链接
06-19 Claude Code v2.1.183 发布,增强自动模式安全性,阻止未授权的破坏性 git 命令和基础设施销毁操作 链接
06-19 AlphaFold 核心人物 John Jumper 离开 Google DeepMind 加入 Anthropic 链接
06-18 Claude Code 新增 Artifacts 功能,可生成交互式页面(如 PR 演示、项目仪表板),Team 和 Enterprise 用户可用 链接
06-18 Boris Cherny 分享使用 Claude Code 破译 3500 年前的线形文字 A 链接
06-17 Claude Code v2.1.181 发布,新增 /config key=value 语法设置参数 链接
06-17 Claude Design 更新:支持设计系统一致性、画布直接编辑、与 Claude Code 同步 链接

xAI

日期 新闻 来源
06-18 Grok TTS 在 Vapi 人性化指数测试中获 96 分,仅比真人低 4 分 链接
06-18 Grok 模型登陆 Databricks Agent Bricks,支持企业数据构建 AI 代理 链接
06-18 Grok Word 插件上线,支持文档起草、网络研究摘要、图表生成 链接
06-17 Grok Build 登陆 DigitalOcean Marketplace,一键部署预装 VM 链接
06-16 Grok PowerPoint 插件上线,支持从提示词生成演示文稿 链接

Google

日期 新闻 来源
06-19 Demis Hassabis 感谢 John Jumper 九年合作,AlphaFold 改变了世界 链接
06-17 AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理方面达到初级保健医生水平 链接

Benchmark 快照

SWE-Bench Pro Public

本期无变动

排名 模型 分数
1 GPT-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 Claude-Opus-4-6 (thinking)* 51.9

来源: Scale Labs

Terminal Bench 2

有变化

模型 变化 前分数 现分数 前排名 现排名
LemonHarness / Multiple 79.9 84.5 8 2
Gemini CLI / Gemini 3.1 Pro 59.4 61.4 45 40
little-coder / Qwen3.6-35B-A3B 23.0 24.6 121 116
Warp / Multiple 61.2 50.1-59.1 41 47-65

来源: Terminal Bench

SWE-Bench Verified

有变化

模型 变化 前分数 现分数 前排名 现排名
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 52.2 60.4 103 76
Warp 75.6 71.0 11 36
devlo 70.2 54.2-58.2 44 83-94
Nemotron-CORTEXA 68.2 58.2 50 82
Solver (2024-09-12) 45.4 43.6 120 126
EPAM AI/Run Developer Agent + GPT4o 27.0 24.0 156 162

来源: SWE-Bench Verified

来源 · 50 条