【OpenAI】GPT-5 Pro 助力解决 3 年免疫学难题
GPT-5 Pro 帮助免疫学家 Derya Unutmaz 解决了一个困扰 3 年的 T 细胞行为谜题,为癌症和自身免疫疾病研究提供新见解。这展示了前沿 AI 模型在加速科学发现方面的潜力。 原文链接
【OpenAI】推出 Daybreak 安全工具套件
OpenAI 发布 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞。同时推出 Patch the Planet 计划,支持开源维护者修复关键漏洞。 原文链接
【Samsung】三星全球部署 ChatGPT Enterprise 和 Codex
三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 最大的企业级 AI 部署之一。此举标志着大型企业对 AI 工具的规模化采用进入新阶段。 原文链接
【Anthropic】推出 Claude Tag,Slack 团队协作新方式
Claude Tag 允许 Claude 作为团队成员加入 Slack 频道,访问指定的频道和工具。用户可直接在 Slack 中 @Claude 并委派任务,提升团队协作效率。 原文链接
【xAI】Grok Build 推出 /goal 自主执行长任务
Grok Build 新增 /goal 功能,支持自主执行长时任务,通过多轮子代理实现和验证单一目标。同时 Grok TTS 在语音人性化测试中获得 96 分,接近真人水平。 原文链接
SWE-bench Verified
Terminal Bench 2.0
/goal 长时任务执行、Agent Dashboard、PowerPoint 插件;Grok TTS 在人声指数测试中获 96 分。| 日期 | 新闻 |
|---|---|
| 06-23 | GPT-5 Pro 助力免疫学家解开 3 年 T 细胞行为之谜,有望支持癌症和自身免疫疾病研究 |
| 06-23 | OpenAI 通过 Appia Foundation 支持构建高级 AI 共享标准,推动评估框架、安全实践和全球合作 |
| 06-23 | Omio 使用 OpenAI 打造对话式旅行体验,加速产品开发并向 AI 原生公司转型 |
| 06-22 | 发布 Patch the Planet 计划,帮助开源维护者用 AI 发现、验证和修复漏洞 |
| 06-22 | 发布 Daybreak 安全工具套件,包含 Codex Security 和 GPT-5.5-Cyber |
| 06-22 | Codex 长时任务最佳实践:如何保持上下文、管理复杂项目 |
| 06-21 | 三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,为 OpenAI 最大规模企业部署之一 |
| 06-18 | ChatGPT Enterprise 新增支出控制和使用分析功能 |
| 06-18 | GPT-5.5 Instant 提升 ChatGPT 健康智能响应,增强推理、上下文和沟通能力 |
| 06-18 | AI 辅助诊断罕见儿童遗传病,在未解病例中识别出 18 个新诊断 |
| 06-17 | 近自主 AI 化学家改进药物关键反应,与 Molecule.one 合作使用 GPT-5.4 |
| 06-17 | 发布 LifeSciBench 基准,评估 AI 处理生命科学研究任务的能力 |
| 06-16 | 发布 Deployment Simulation 方法,在发布前预测模型行为 |
| 06-14 | 推出 OpenAI 合作伙伴网络,投资 1.5 亿美元加速企业 AI 采用 |
| 06-12 | OpenAI Academy 推出三门新课程,帮助构建实用 AI 技能 |
| 06-11 | OpenAI 收购 Ona,扩展 Codex 的安全持久云环境能力 |
| 06-11 | BBVA 向 10 万员工推广 ChatGPT Enterprise |
| 06-11 | 支持欧盟 AI 内容透明度行为准则 |
| 06-10 | OpenAI 模型和 Codex 登陆 Oracle Cloud |
| 06-10 | 报告披露中国关联影响力操作针对美国 AI 辩论 |
Codex 更新:
| 日期 | 新闻 |
|---|---|
| 06-23 | 推出 Claude Tag:Claude 作为团队成员加入 Slack 频道,可标记并委派任务 |
| 06-13 | 美国出口管制暂停 Fable 5 和 Mythos 5 服务,其他 Claude 模型不受影响 |
| 06-11 | 启动 Claude Corps 国家奖学金计划,培训 1000 人使用 AI 服务非营利组织 |
Claude Code 更新:
sandbox.credentials 设置阻止沙箱命令读取凭证claude mcp login/logout 命令支持 SSH 认证/config key=value 语法设置任意配置| 日期 | 新闻 |
|---|---|
| 06-23 | Firecrawl 插件上线 Grok Build 插件市场,支持网页搜索和抓取 |
| 06-22 | Grok 连接 Interactive Brokers,提供投资组合分析 |
| 06-22 | 推出 /goal 命令,支持多轮子代理自主执行长时任务 |
| 06-18 | Grok Word 插件上线,支持文档起草、网页研究摘要、图表生成 |
| 06-18 | Grok TTS 在人声指数测试中获 96 分,仅比真人低 4 分 |
| 06-18 | Grok 模型登陆 Databricks Agent Bricks |
| 06-17 | DigitalOcean Marketplace 一键部署预装 Grok Build 的 VM |
| 06-16 | Grok PowerPoint 插件上线,支持从提示词生成演示文稿 |
| 06-15 | SuperGrok/X Premium 订阅可在 Warp 终端使用 |
| 06-15 | 推出 Agent Dashboard,管理多个代理任务 |
| 06-14 | Grok Build 支持终端内渲染数学公式和 LaTeX |
| 06-11 | Grok Build 插件市场公测,含 MongoDB、Vercel、Sentry、Cloudflare、Chrome DevTools 插件 |
| 日期 | 新闻 |
|---|---|
| 06-17 | AMIE 医疗 AI 研究发表于 Nature,在复杂疾病管理中匹配初级保健医生水平 |
| 06-15 | 宣布 15 亿美元投资扩建阿拉巴马州数据中心 |
| 06-11 | 弗吉尼亚州社区投资支持本地就业和能源可负担性 |
人事动态:
本期变动:
| 模型 | 变化 |
|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct | 排名 103→76,分数 52.2→60.4 (+8.2) |
| Warp | 排名 11→36,分数 75.6→71.0 (-4.6) |
| Nemotron-CORTEXA | 排名 50→82,分数 68.2→58.2 (-10.0) |
| devlo | 排名 44→83/94,分数 70.2→58.2/54.2 |
| EPAM AI/Run Developer Agent + GPT4o | 排名 156→162,分数 27.0→24.0 |
| Solver (2024-09-12) | 排名 120→126,分数 45.4→43.6 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
来源:SWE-Bench Verified Leaderboard
本期无变动
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
来源:Scale Labs SWE-Bench Pro Public(采集时间:2026-06-24)
本期变动:
| 模型 | 变化 |
|---|---|
| LemonHarness / Multiple | 排名 8→2,分数 79.9→84.5 (+4.6) |
| Gemini CLI / Gemini 3.1 Pro | 排名 45→40,分数 59.4→61.4 (+2.0) |
| Warp / Multiple | 排名 41→47/65,分数 61.2→59.1/50.1 |
| little-coder / Qwen3.6-35B-A3B | 排名 121→116,分数 23.0→24.6 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
来源:Terminal Bench 2.0 Leaderboard
| 来源 | 状态 |
|---|---|
| LMArena Leaderboard | 采集失败 |