← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-23 00:53

2026-06-23 08:53 CST
快速版 完整版

核心速览

【OpenAI】发布 Daybreak 安全工具套件,推出 Codex Security 和 GPT-5.5-Cyber

OpenAI 推出 Daybreak 系列安全工具,包括 Codex Security 插件和 GPT-5.5-Cyber 模型,帮助组织大规模发现、验证和修补漏洞。同时启动 Patch the Planet 计划,与安全研究人员合作保护关键开源项目。这标志着 AI 在网络安全领域的重要布局。 原文链接:https://openai.com/index/daybreak-securing-the-world

【Anthropic】Fable 5 和 Mythos 5 被美国政府暂停访问

美国政府以国家安全为由发布出口管制指令,要求暂停所有外国用户对 Fable 5 和 Mythos 5 的访问。Anthropic 表示这是误解,正在努力恢复访问权限。其他 Claude 模型不受影响。 原文链接:https://x.com/AnthropicAI/status/2065597531644743999

【xAI】Grok Build 推出 /goal 命令,支持长时间自主任务执行

Grok Build 新增 /goal 命令,允许 AI 自主执行多轮子任务并验证单一目标。同时 Grok TTS 在 Vapi 人性化指数测试中获得 96 分,接近真人语音水平(100 分),领先其他语音模型。 原文链接:https://x.com/xai/status/2069095296987222287

【Google】AMIE 医疗 AI 研究登上 Nature,疾病管理能力匹敌初级保健医生

Google 的对话式 AI 系统 AMIE 在复杂疾病管理任务中表现与初级保健医生相当,研究成果发表在《Nature》期刊。这展示了 AI 在医疗诊断和管理领域的重大进展。 原文链接:https://blog.google/innovation-and-ai/models-and-research/google-research/amie-for-disease-management-in-nature/

【Anthropic】Claude Code 新增 MCP 登录命令和自动模式安全改进

Claude Code v2.1.186 新增 claude mcp login/logout 命令支持 SSH 环境认证。v2.1.183 增强自动模式安全性,阻止未授权的破坏性 git 命令和基础设施销毁操作。 原文链接:https://github.com/anthropics/claude-code/releases/tag/v2.1.186


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76(+27),分数从 52.2 升至 60.4(+15.7%)
  • Warp:排名从 11 降至 36(-25),分数从 75.6 降至 71.0(-6.1%)
  • devlo:排名从 44 降至 83(-39),分数从 70.2 降至 58.2(-17.1%)
  • Nemotron-CORTEXA:排名从 50 降至 82(-32),分数从 68.2 降至 58.2(-14.7%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至 2(+6),分数从 79.9 升至 84.5(+5.8%)
  • Warp / Multiple:排名从 41 降至 65(-24),分数从 61.2 降至 50.1(-18.1%)

快速预览

  • OpenAI 发布 Daybreak 安全工具套件,推出 Codex Security 和 GPT-5.5-Cyber,并启动 Patch the Planet 计划帮助开源维护者修复漏洞 (来源)
  • SWE-Bench Pro Public 榜单:GPT-5.4 (xHigh) 以 59.1 分领跑,Claude Opus 4.6 (thinking) 位列第三 (51.9 分) (榜单)
  • Terminal Bench 2.0 榜单:LemonHarness/Multiple 从第 8 名跃升至第 2 名,分数从 79.9 升至 84.5 (榜单)
  • Claude Code 持续更新:v2.1.186 新增 MCP 服务器 CLI 登录命令,v2.1.183 增强自动模式安全防护 (更新日志)
  • 注意:lmarena-leaderboard 本期采集失败,无数据

新闻动态

OpenAI

日期 新闻
06-22 发布 Daybreak 安全工具套件,包含 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞 链接
06-22 启动 Patch the Planet 计划,帮助开源维护者使用 AI 和专家审查修复安全漏洞 链接
06-22 发布 Codex 长时任务最佳实践指南 链接
06-21 三星电子部署 ChatGPT Enterprise 和 Codex,成为 OpenAI 最大规模企业部署之一 链接
06-18 ChatGPT Enterprise 新增使用分析和支出控制功能 链接
06-18 GPT-5.5 Instant 改进 ChatGPT 健康与医疗响应能力 链接
06-18 研究人员使用 OpenAI 推理模型帮助诊断罕见儿童遗传病,在既往未解病例中新增 18 例诊断 链接
06-17 与 Molecule.one 合作展示近自主 AI 化学家改进药物合成反应 链接
06-17 发布 LifeSciBench,面向生命科学研究任务的专家评测基准 链接
06-16 推出 Deployment Simulation 方法,在发布前预测模型行为 链接
06-14 推出 OpenAI Partner Network,投资 1.5 亿美元加速企业 AI 采用 链接
06-11 计划收购 Ona 以扩展 Codex 云环境能力 链接

Codex 更新:06-18 新增 Record & Replay 功能(macOS,暂不支持 EEA/UK/瑞士);06-16 Codex App 功能扩展至 EEA/UK/瑞士地区。

Anthropic

日期 新闻
06-22 Claude Code v2.1.186 发布,新增 claude mcp login/logout CLI 命令 链接
06-20 v2.1.185 优化流式响应等待提示,触发时间从 10s 延长至 20s 链接
06-19 v2.1.183 增强自动模式安全:阻止未授权的破坏性 git 命令和 destroy 操作 链接
06-18 Claude Code 新增 Artifacts 功能,可构建交互式页面并分享给团队 链接
06-17 Claude Design 更新:支持设计系统一致性、画布直接编辑、与 Claude Code 同步 链接
06-13 美国政府以国家安全为由暂停 Fable 5 和 Mythos 5 对所有用户的访问,Anthropic 正在争取恢复 链接
06-11 推出 Claude Corps 国家奖学金计划,资助 1000 人使用 AI 服务非营利组织 链接
06-09 发布 Claude Fable 5,为 Mythos 级模型中首个开放通用使用的版本 链接

人事动态:AlphaFold 负责人 John Jumper 离开 Google DeepMind 加入 Anthropic (来源)。

Google

日期 新闻
06-22 Google DeepMind 与 A24 建立研究合作伙伴关系 链接
06-17 AMIE 医疗 AI 研究发表于《Nature》,在复杂疾病管理中匹配初级保健医生水平 链接
06-15 宣布 15 亿美元投资扩建阿拉巴马州数据中心园区 链接
06-11 Gemini Omni Flash 登顶 Video Arena 榜单(Text-to-Video 和 Image-to-Video 双第一)链接

xAI

日期 新闻
06-22 Grok Build 新增 /goal 命令,支持多轮子代理自主执行长时任务 链接
06-22 Grok 与 Interactive Brokers 集成,支持投资组合分析 链接
06-18 Grok TTS 在 Vapi Humanness Index 中获 96 分(接近真人 100 分)链接
06-18 Grok 模型登陆 Databricks Agent Bricks 链接
06-18 Grok Word 插件上线 链接
06-17 Grok Build 预装 VM 登陆 DigitalOcean Marketplace 链接
06-16 Grok PowerPoint 插件上线 链接
06-15 Grok Build 新增 Agent Dashboard,支持同时管理多个代理 链接
06-15 Grok 集成至 Warp 终端 链接
06-11 Grok Build Plugin Marketplace 公测,支持 MongoDB、Vercel、Sentry、Cloudflare 等插件 链接

Benchmark 快照

SWE-Bench Verified

本期有变动,Top 10 如下:

排名 模型/系统 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8
4 live-SWE-agent + Gemini 3 Pro Preview 77.4
5 Atlassian Rovo Dev 76.8
6 EPAM AI/Run + Claude 4 Sonnet 76.8
7 mini-SWE-agent + Claude 4.5 Opus (high) 76.8
8 ACoder 76.4
9 mini-SWE-agent + Gemini 3 Flash (high) 75.8
10 mini-SWE-agent + MiniMax M2.5 (high) 75.8

主要变化

  • Warp:第 11 → 36 名,分数 75.6 → 71.0
  • EntroPO + R2E + Qwen3-Coder:第 103 → 76 名,分数 52.2 → 60.4(+8.2)
  • Nemotron-CORTEXA:第 50 → 82 名,分数 68.2 → 58.2(-10.0)
  • devlo:第 44 → 83/94 名,分数 70.2 → 58.2/54.2

来源:GitHub - OpenAutoCoder

SWE-Bench Pro Public

本期无变动,Top 3:

排名 模型 分数
1 GPT-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 Claude Opus 4.6 (thinking)* 51.9

来源:Scale Labs Leaderboard

Terminal Bench 2.0

本期有变动,Top 10:

排名 模型/系统 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1
4 Codex CLI / GPT-5.5 82.2
5 Polaris / Multiple 82.2
6 WOZCODE / Claude Opus 4.7 80.2
7 TongAgents / Gemini 3.1 Pro 80.2
8 LemonHarness / Multiple 79.9
9 SageAgent / GPT-5.3-Codex 78.4
10 Droid / GPT-5.3-Codex 77.3

主要变化

  • LemonHarness / Multiple:第 8 → 2 名,分数 79.9 → 84.5(+4.6)
  • Gemini CLI / Gemini 3.1 Pro:第 45 → 40 名,分数 59.4 → 61.4(+2.0)
  • Warp / Multiple:第 41 → 47/65 名,分数 61.2 → 59.1/50.1

来源:TBench Leaderboard


采集状态

来源 状态
lmarena-leaderboard ❌ 采集失败
来源 · 71 条