【Anthropic】Claude Code 新增 Artifacts 功能 Claude Code 推出 Artifacts 功能(Beta),可将会话内容生成可交互页面(如 PR 走查、项目看板),并通过私密链接与团队共享。目前向 Team 和 Enterprise 计划用户开放,标志着 Claude Code 从代码工具向团队协作平台延伸。 原文
【Anthropic】美国政府对 Fable 5 和 Mythos 5 实施出口管制 美国政府以国家安全为由,下令暂停所有外国公民访问 Anthropic 的 Fable 5 和 Mythos 5 模型,包括 Anthropic 内部的外籍员工。Anthropic 表示认为此举存在误解并正积极沟通恢复访问,其余 Claude 模型不受影响。事件揭示 AI 顶级模型正面临日益增加的地缘政治监管风险。 原文
【OpenAI】AI 辅助诊断罕见儿童遗传病取得突破 研究人员使用 OpenAI 推理模型在此前无法确诊的病例中新增识别出 18 例罕见遗传病诊断。这是 AI 推理能力在真实临床场景中的重要验证,展示了 AI 在高难度医学诊断中的实际价值。 原文
【Google DeepMind】AMIE 医疗 AI 登上 Nature,复杂病管理达到初级医师水平 Google 发表于《Nature》的研究显示,对话式医疗 AI AMIE 在复杂疾病管理场景中的表现与初级保健医师相当。这是顶级学术期刊对大模型医疗能力的正式认可,意义重大。 原文
【xAI】Grok 全面融入微软 Office 生态 Grok 插件相继上线 Microsoft Word 和 PowerPoint,支持联网搜索、X 平台数据获取、图表生成及幻灯片内图像创作。同期 Grok TTS 在 Vapi Humanness Index 以 96 分(满分 100)位列语音模型第一。xAI 正快速建立企业级多模态产品矩阵。 原文(Word) | 原文(PowerPoint)
SWE-bench Verified
| 模型 | 排名变化 | 分数变化 |
|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B | 103 → 76 ↑ | 52.2 → 60.4 (+15.7%) |
| Nemotron-CORTEXA | 50 → 82 ↓ | 68.2 → 58.2 (-14.7%) |
| devlo | 44 → 83 ↓ | 70.2 → 58.2 (-17.1%) |
| Warp | 11 → 36 ↓ | 75.6 → 71.0 (-6.1%) |
Qwen3-Coder 方案强势上升;Nemotron-CORTEXA 和 devlo 出现显著下滑,可能与测试集更新或评估口径变化有关。
Terminal Bench 2.0
| 模型 | 排名变化 | 分数变化 |
|---|---|---|
| LemonHarness / Multiple | 8 → 2 ↑ | 79.9 → 84.5 (+5.8%) |
| Warp / Multiple | 41 → 65 ↓ | 61.2 → 50.1 (-18.2%) |
LemonHarness 跻身榜眼;Warp 在两个 Benchmark 中同时大幅下滑,值得关注。
本期重点新闻(2026-06-18 倒序)
| 日期 | 事件 |
|---|---|
| 06-18 | GPT-5.5 Instant 健康问答能力提升,联合全球 60 国、26 个专科数百名医生评测,现已与前沿 Thinking 模型持平 (来源) |
| 06-18 | ChatGPT Enterprise 新增支出管控与用量分析工具 (来源) |
| 06-18 | 推理模型辅助儿科罕见病诊断研究,在既往未解决病例中新增 18 例诊断 (来源) |
| 06-18 | Codex App 26.616 上线 Record & Replay:将演示工作流转为可复用技能(暂不含 EEA/UK/瑞士)(来源) |
| 06-18 | Codex CLI 0.141.0:远程执行器改用端到端加密 Noise relay 通道 (来源) |
| 06-17 | GPT-5.4 驱动近自主 AI 化学家,与 Molecule.one 合作改进药物合成关键反应 (来源) |
| 06-17 | 发布 LifeSciBench,专家撰写、专家评审的生命科学研究任务基准 (来源) |
| 06-16 | 提出 Deployment Simulation 方法,用真实对话数据预测模型上线后行为 (来源) |
| 06-14 | 推出 OpenAI Partner Network,投入 1.5 亿美元助力全球合作伙伴加速企业 AI 落地 (来源) |
| 06-10 | OpenAI 模型及 Codex 可通过 Oracle Cloud 已有承诺额度调用 (来源) |
| 06-10 | 发布报告:PRC 关联影响行动正在利用 AI 干预美国 AI 政策讨论 (来源) |
| 06-11 | 收购 Ona,为 Codex 增加安全持久云环境,支持长时任务 Agent (来源) |
| 06-08 | 向 SEC 机密提交 S-1 草案 (来源) |
模型事件
Claude Fable 5(Mythos 级)于 2026-06-09 发布,定位为迄今对外开放能力最强模型。然而 06-13,美国政府依据国家安全权限发出出口管制指令,要求暂停所有外籍人员(含 Anthropic 内部员工)对 Fable 5 和 Mythos 5 的访问。Anthropic 认为存在误解,正积极寻求恢复。其余所有 Claude 模型不受影响。(来源)
Claude Code 近期更新
| 版本 | 日期 | 变更 |
|---|---|---|
| v2.1.181 | 06-17 | 新增 /config key=value 提示符内设置语法,支持交互/-p/远程控制模式 (来源) |
| v2.1.179 | 06-16 | 修复中途断连问题:保留已有部分响应,spinner 不再卡死 (来源) |
| v2.1.178 | 06-15 | 权限规则新增 Tool(param:value) 语法,支持通配符匹配;Agent Teams 简化:移除 TeamCreate/TeamDelete,直接通过 Agent 工具的 name 参数生成队友 (来源) |
| v2.1.176 | 06-12 | 会话标题自动以对话语言生成 (来源) |
Claude Code Artifacts(06-18):Team 和 Enterprise 计划 Beta 上线,可从会话生成可共享的互动页面(PR 概览、项目看板等),支持私有链接分发。(来源)
Claude Design 更新(06-17):跨项目保持设计系统风格,支持画布直接编辑,并与 Claude Code 同步。(来源)
研究动态:Anthropic 发布 Claude Code 用户画像研究,发现领域专家成功率更高,但中级与专家用户间差距较小,提示领域熟悉度即可有效使用 AI 编程。(来源) 另发布科学博客:分析 AI 在生物领域进展慢于编程的原因——生物数据库接口设计不适合 Agent 使用。(来源)
Claude Corps(06-11):国家奖学金计划,培训 1000 名早期职业人员在美国非营利机构使用 Claude。(来源)
| 日期 | 事件 |
|---|---|
| 06-17 | AMIE 医疗对话 AI 研究发表于《Nature》,在复杂病症管理中达到初级保健医生水平 (来源) |
| 06-15 | 宣布 2026-2027 年向阿拉巴马州数据中心投入 15 亿美元 (来源) |
| 06-11 | Gemini Omni 发布:首个"从任意输入生成任意内容"多模态模型,Text-to-Video 在 Video Arena 排名第一,较 Veo 3.1 提升 +158 分 (来源) |
| 06-11 | DiffusionGemma 发布:基于文本扩散方式,同时生成完整文本块,速度为 Gemma 4 同类模型的 4 倍,Apache 2.0 协议开源 (来源) |
| 06-11 | Gemini Notebooks 功能扩展至 EEA、英国和瑞士 |
xAI 本期以生态集成为主线,密集落地多个平台:
本期无新增 Top 变动,当前 Top 3:
| 排名 | 系统 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
本期榜单变化(分数下滑为主):
| 模型 | 分数变化 | 排名变化 |
|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct | 52.2 → 60.4 ↑ | 103 → 76 ↑ |
| EPAM AI/Run Developer Agent + GPT4o | 27.0 → 24.0 ↓ | 156 → 162 ↓ |
| Nemotron-CORTEXA | 68.2 → 58.2 ↓ | 50 → 82 ↓ |
| Warp | 75.6 → 71.0 ↓ | 11 → 36 ↓ |
| devlo | 70.2 → 54.2~58.2 ↓ | 44 → 83~94 ↓ |
| Solver (2024-09-12) | 45.4 → 43.6 ↓ | 120 → 126 ↓ |
来源:Scale AI Leaderboard(快照于 2026-06-19)
当前 Top 5(* 表示未公开系统实现细节):
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
| 4 | gemini-3.1-pro (thinking)* | 46.1 |
| 5 | claude-opus-4-5-20251101 | 45.89 |
本期无变化记录,为本期首次纳入快照。
来源:tbench.ai
当前 Top 3:
| 排名 | 系统 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
本期榜单变化:
| 系统 | 分数变化 | 排名变化 |
|---|---|---|
| LemonHarness / Multiple | 79.9 → 84.5 ↑ | 8 → 2 ↑ |
| Gemini CLI / Gemini 3.1 Pro | 59.4 → 61.4 ↑ | 45 → 40 ↑ |
| little-coder / Qwen3.6-35B-A3B | 23.0 → 24.6 ↑ | 121 → 116 ↑ |
| Warp / Multiple | 61.2 → 50.1~59.1 ↓ | 41 → 47~65 ↓ |
本期采集失败,无数据可呈现。