【OpenAI】发布 Daybreak 安全工具套件,推出 Codex Security 和 GPT-5.5-Cyber
OpenAI 推出 Daybreak 系列安全工具,包括 Codex Security 插件和 GPT-5.5-Cyber 模型,帮助组织大规模发现、验证和修补漏洞。同时启动 Patch the Planet 计划,与安全研究人员合作保护关键开源项目。这标志着 AI 在网络安全领域的重要布局。 原文链接:https://openai.com/index/daybreak-securing-the-world
【Anthropic】Fable 5 和 Mythos 5 被美国政府暂停访问
美国政府以国家安全为由发布出口管制指令,要求暂停所有外国用户对 Fable 5 和 Mythos 5 的访问。Anthropic 表示这是误解,正在努力恢复访问权限。其他 Claude 模型不受影响。 原文链接:https://x.com/AnthropicAI/status/2065597531644743999
【xAI】Grok Build 推出 /goal 命令,支持长时间自主任务执行
Grok Build 新增 /goal 命令,允许 AI 自主执行多轮子任务并验证单一目标。同时 Grok TTS 在 Vapi 人性化指数测试中获得 96 分,接近真人语音水平(100 分),领先其他语音模型。 原文链接:https://x.com/xai/status/2069095296987222287
【Google】AMIE 医疗 AI 研究登上 Nature,疾病管理能力匹敌初级保健医生
Google 的对话式 AI 系统 AMIE 在复杂疾病管理任务中表现与初级保健医生相当,研究成果发表在《Nature》期刊。这展示了 AI 在医疗诊断和管理领域的重大进展。 原文链接:https://blog.google/innovation-and-ai/models-and-research/google-research/amie-for-disease-management-in-nature/
【Anthropic】Claude Code 新增 MCP 登录命令和自动模式安全改进
Claude Code v2.1.186 新增 claude mcp login/logout 命令支持 SSH 环境认证。v2.1.183 增强自动模式安全性,阻止未授权的破坏性 git 命令和基础设施销毁操作。
原文链接:https://github.com/anthropics/claude-code/releases/tag/v2.1.186
SWE-bench Verified
Terminal Bench 2.0
| 日期 | 新闻 |
|---|---|
| 06-22 | 发布 Daybreak 安全工具套件,包含 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞 链接 |
| 06-22 | 启动 Patch the Planet 计划,帮助开源维护者使用 AI 和专家审查修复安全漏洞 链接 |
| 06-22 | 发布 Codex 长时任务最佳实践指南 链接 |
| 06-21 | 三星电子部署 ChatGPT Enterprise 和 Codex,成为 OpenAI 最大规模企业部署之一 链接 |
| 06-18 | ChatGPT Enterprise 新增使用分析和支出控制功能 链接 |
| 06-18 | GPT-5.5 Instant 改进 ChatGPT 健康与医疗响应能力 链接 |
| 06-18 | 研究人员使用 OpenAI 推理模型帮助诊断罕见儿童遗传病,在既往未解病例中新增 18 例诊断 链接 |
| 06-17 | 与 Molecule.one 合作展示近自主 AI 化学家改进药物合成反应 链接 |
| 06-17 | 发布 LifeSciBench,面向生命科学研究任务的专家评测基准 链接 |
| 06-16 | 推出 Deployment Simulation 方法,在发布前预测模型行为 链接 |
| 06-14 | 推出 OpenAI Partner Network,投资 1.5 亿美元加速企业 AI 采用 链接 |
| 06-11 | 计划收购 Ona 以扩展 Codex 云环境能力 链接 |
Codex 更新:06-18 新增 Record & Replay 功能(macOS,暂不支持 EEA/UK/瑞士);06-16 Codex App 功能扩展至 EEA/UK/瑞士地区。
| 日期 | 新闻 |
|---|---|
| 06-22 | Claude Code v2.1.186 发布,新增 claude mcp login/logout CLI 命令 链接 |
| 06-20 | v2.1.185 优化流式响应等待提示,触发时间从 10s 延长至 20s 链接 |
| 06-19 | v2.1.183 增强自动模式安全:阻止未授权的破坏性 git 命令和 destroy 操作 链接 |
| 06-18 | Claude Code 新增 Artifacts 功能,可构建交互式页面并分享给团队 链接 |
| 06-17 | Claude Design 更新:支持设计系统一致性、画布直接编辑、与 Claude Code 同步 链接 |
| 06-13 | 美国政府以国家安全为由暂停 Fable 5 和 Mythos 5 对所有用户的访问,Anthropic 正在争取恢复 链接 |
| 06-11 | 推出 Claude Corps 国家奖学金计划,资助 1000 人使用 AI 服务非营利组织 链接 |
| 06-09 | 发布 Claude Fable 5,为 Mythos 级模型中首个开放通用使用的版本 链接 |
人事动态:AlphaFold 负责人 John Jumper 离开 Google DeepMind 加入 Anthropic (来源)。
| 日期 | 新闻 |
|---|---|
| 06-22 | Google DeepMind 与 A24 建立研究合作伙伴关系 链接 |
| 06-17 | AMIE 医疗 AI 研究发表于《Nature》,在复杂疾病管理中匹配初级保健医生水平 链接 |
| 06-15 | 宣布 15 亿美元投资扩建阿拉巴马州数据中心园区 链接 |
| 06-11 | Gemini Omni Flash 登顶 Video Arena 榜单(Text-to-Video 和 Image-to-Video 双第一)链接 |
| 日期 | 新闻 |
|---|---|
| 06-22 | Grok Build 新增 /goal 命令,支持多轮子代理自主执行长时任务 链接 |
| 06-22 | Grok 与 Interactive Brokers 集成,支持投资组合分析 链接 |
| 06-18 | Grok TTS 在 Vapi Humanness Index 中获 96 分(接近真人 100 分)链接 |
| 06-18 | Grok 模型登陆 Databricks Agent Bricks 链接 |
| 06-18 | Grok Word 插件上线 链接 |
| 06-17 | Grok Build 预装 VM 登陆 DigitalOcean Marketplace 链接 |
| 06-16 | Grok PowerPoint 插件上线 链接 |
| 06-15 | Grok Build 新增 Agent Dashboard,支持同时管理多个代理 链接 |
| 06-15 | Grok 集成至 Warp 终端 链接 |
| 06-11 | Grok Build Plugin Marketplace 公测,支持 MongoDB、Vercel、Sentry、Cloudflare 等插件 链接 |
本期有变动,Top 10 如下:
| 排名 | 模型/系统 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
| 4 | live-SWE-agent + Gemini 3 Pro Preview | 77.4 |
| 5 | Atlassian Rovo Dev | 76.8 |
| 6 | EPAM AI/Run + Claude 4 Sonnet | 76.8 |
| 7 | mini-SWE-agent + Claude 4.5 Opus (high) | 76.8 |
| 8 | ACoder | 76.4 |
| 9 | mini-SWE-agent + Gemini 3 Flash (high) | 75.8 |
| 10 | mini-SWE-agent + MiniMax M2.5 (high) | 75.8 |
主要变化:
本期无变动,Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | Claude Opus 4.6 (thinking)* | 51.9 |
本期有变动,Top 10:
| 排名 | 模型/系统 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
| 4 | Codex CLI / GPT-5.5 | 82.2 |
| 5 | Polaris / Multiple | 82.2 |
| 6 | WOZCODE / Claude Opus 4.7 | 80.2 |
| 7 | TongAgents / Gemini 3.1 Pro | 80.2 |
| 8 | LemonHarness / Multiple | 79.9 |
| 9 | SageAgent / GPT-5.3-Codex | 78.4 |
| 10 | Droid / GPT-5.3-Codex | 77.3 |
主要变化:
| 来源 | 状态 |
|---|---|
| lmarena-leaderboard | ❌ 采集失败 |