← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-24 00:44

2026-06-24 08:44 CST
快速版 完整版

核心速览

【OpenAI】GPT-5 Pro 助力解决 3 年免疫学难题

GPT-5 Pro 帮助免疫学家 Derya Unutmaz 解决了一个困扰 3 年的 T 细胞行为谜题,为癌症和自身免疫疾病研究提供新见解。这展示了前沿 AI 模型在加速科学发现方面的潜力。 原文链接

【OpenAI】推出 Daybreak 安全工具套件

OpenAI 发布 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞。同时推出 Patch the Planet 计划,支持开源维护者修复关键漏洞。 原文链接

【Samsung】三星全球部署 ChatGPT Enterprise 和 Codex

三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 最大的企业级 AI 部署之一。此举标志着大型企业对 AI 工具的规模化采用进入新阶段。 原文链接

【Anthropic】推出 Claude Tag,Slack 团队协作新方式

Claude Tag 允许 Claude 作为团队成员加入 Slack 频道,访问指定的频道和工具。用户可直接在 Slack 中 @Claude 并委派任务,提升团队协作效率。 原文链接

【xAI】Grok Build 推出 /goal 自主执行长任务

Grok Build 新增 /goal 功能,支持自主执行长时任务,通过多轮子代理实现和验证单一目标。同时 Grok TTS 在语音人性化测试中获得 96 分,接近真人水平。 原文链接


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 提升至 60.4(+15.7%)
  • Warp:排名从 11 跌至 36,分数从 75.6 降至 71.0(-6.1%)
  • devlo:排名从 44 跌至 83,分数从 70.2 降至 58.2(-17.1%)
  • Nemotron-CORTEXA:排名从 50 跌至 82,分数从 68.2 降至 58.2(-14.7%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至第 2,分数从 79.9 提升至 84.5(+5.8%)
  • Warp / Multiple:排名从 41 跌至 65,分数从 61.2 降至 50.1(-18.1%)

快速预览

  • OpenAI: GPT-5 Pro 助力免疫学家解开 3 年 T 细胞行为之谜;发布 Daybreak 安全工具套件含 Codex Security 和 GPT-5.5-Cyber;三星全球部署 ChatGPT Enterprise 和 Codex。
  • Anthropic: 推出 Claude Tag,让 Claude 作为团队成员加入 Slack 频道;Claude Code 新增 Artifacts 功能;美国出口管制导致 Fable 5 和 Mythos 5 暂停服务。
  • xAI: Grok Build 新增 /goal 长时任务执行、Agent Dashboard、PowerPoint 插件;Grok TTS 在人声指数测试中获 96 分。
  • Benchmark: SWE-Bench Pro Public 榜首 gpt-5.4 (xHigh) 59.1 分;Terminal Bench 2.0 榜首 NexAU-AHE/GPT-5.5 84.7 分;LMArena 排行榜采集失败。
  • Google: AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级保健医生水平;AlphaFold 核心成员 John Jumper 离职加入 Anthropic。

新闻详情

OpenAI

日期 新闻
06-23 GPT-5 Pro 助力免疫学家解开 3 年 T 细胞行为之谜,有望支持癌症和自身免疫疾病研究
06-23 OpenAI 通过 Appia Foundation 支持构建高级 AI 共享标准,推动评估框架、安全实践和全球合作
06-23 Omio 使用 OpenAI 打造对话式旅行体验,加速产品开发并向 AI 原生公司转型
06-22 发布 Patch the Planet 计划,帮助开源维护者用 AI 发现、验证和修复漏洞
06-22 发布 Daybreak 安全工具套件,包含 Codex Security 和 GPT-5.5-Cyber
06-22 Codex 长时任务最佳实践:如何保持上下文、管理复杂项目
06-21 三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,为 OpenAI 最大规模企业部署之一
06-18 ChatGPT Enterprise 新增支出控制和使用分析功能
06-18 GPT-5.5 Instant 提升 ChatGPT 健康智能响应,增强推理、上下文和沟通能力
06-18 AI 辅助诊断罕见儿童遗传病,在未解病例中识别出 18 个新诊断
06-17 近自主 AI 化学家改进药物关键反应,与 Molecule.one 合作使用 GPT-5.4
06-17 发布 LifeSciBench 基准,评估 AI 处理生命科学研究任务的能力
06-16 发布 Deployment Simulation 方法,在发布前预测模型行为
06-14 推出 OpenAI 合作伙伴网络,投资 1.5 亿美元加速企业 AI 采用
06-12 OpenAI Academy 推出三门新课程,帮助构建实用 AI 技能
06-11 OpenAI 收购 Ona,扩展 Codex 的安全持久云环境能力
06-11 BBVA 向 10 万员工推广 ChatGPT Enterprise
06-11 支持欧盟 AI 内容透明度行为准则
06-10 OpenAI 模型和 Codex 登陆 Oracle Cloud
06-10 报告披露中国关联影响力操作针对美国 AI 辩论

Codex 更新

Anthropic

日期 新闻
06-23 推出 Claude Tag:Claude 作为团队成员加入 Slack 频道,可标记并委派任务
06-13 美国出口管制暂停 Fable 5 和 Mythos 5 服务,其他 Claude 模型不受影响
06-11 启动 Claude Corps 国家奖学金计划,培训 1000 人使用 AI 服务非营利组织

Claude Code 更新

  • 06-23: v2.1.187 新增 sandbox.credentials 设置阻止沙箱命令读取凭证
  • 06-22: v2.1.186 新增 claude mcp login/logout 命令支持 SSH 认证
  • 06-20: v2.1.185 优化流停滞提示,触发时间从 10s 改为 20s
  • 06-19: v2.1.183 增强自动模式安全:阻止破坏性 git 命令和 terraform destroy
  • 06-17: v2.1.181 新增 /config key=value 语法设置任意配置

xAI

日期 新闻
06-23 Firecrawl 插件上线 Grok Build 插件市场,支持网页搜索和抓取
06-22 Grok 连接 Interactive Brokers,提供投资组合分析
06-22 推出 /goal 命令,支持多轮子代理自主执行长时任务
06-18 Grok Word 插件上线,支持文档起草、网页研究摘要、图表生成
06-18 Grok TTS 在人声指数测试中获 96 分,仅比真人低 4 分
06-18 Grok 模型登陆 Databricks Agent Bricks
06-17 DigitalOcean Marketplace 一键部署预装 Grok Build 的 VM
06-16 Grok PowerPoint 插件上线,支持从提示词生成演示文稿
06-15 SuperGrok/X Premium 订阅可在 Warp 终端使用
06-15 推出 Agent Dashboard,管理多个代理任务
06-14 Grok Build 支持终端内渲染数学公式和 LaTeX
06-11 Grok Build 插件市场公测,含 MongoDB、Vercel、Sentry、Cloudflare、Chrome DevTools 插件

Google

日期 新闻
06-17 AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级保健医生水平
06-15 宣布 15 亿美元投资扩建阿拉巴马州数据中心
06-11 弗吉尼亚州社区投资支持本地就业和能源可负担性

人事动态


Benchmark 快照

SWE-Bench Verified

本期变动

模型 变化
EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct 排名 103→76,分数 52.2→60.4 (+8.2)
Warp 排名 11→36,分数 75.6→71.0 (-4.6)
Nemotron-CORTEXA 排名 50→82,分数 68.2→58.2 (-10.0)
devlo 排名 44→83/94,分数 70.2→58.2/54.2
EPAM AI/Run Developer Agent + GPT4o 排名 156→162,分数 27.0→24.0
Solver (2024-09-12) 排名 120→126,分数 45.4→43.6

当前 Top 3

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

来源:SWE-Bench Verified Leaderboard

SWE-Bench Pro Public

本期无变动

当前 Top 3

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 claude-opus-4-6 (thinking)* 51.9

来源:Scale Labs SWE-Bench Pro Public(采集时间:2026-06-24)

Terminal Bench 2.0

本期变动

模型 变化
LemonHarness / Multiple 排名 8→2,分数 79.9→84.5 (+4.6)
Gemini CLI / Gemini 3.1 Pro 排名 45→40,分数 59.4→61.4 (+2.0)
Warp / Multiple 排名 41→47/65,分数 61.2→59.1/50.1
little-coder / Qwen3.6-35B-A3B 排名 121→116,分数 23.0→24.6

当前 Top 3

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

来源:Terminal Bench 2.0 Leaderboard


采集状态

来源 状态
LMArena Leaderboard 采集失败
来源 · 72 条