【Anthropic】Claude Code 新增 Artifacts 功能 Claude Code 推出 Artifacts 功能(Beta),可将会话内容生成可交互页面(如 PR 走查、项目看板),并通过私密链接与团队共享。目前向 Team 和 Enterprise 计划用户开放,标志着 Claude Code 从代码工具向团队协作平台延伸。 原文
【Anthropic】美国政府对 Fable 5 和 Mythos 5 实施出口管制 美国政府以国家安全为由,下令暂停所有外国公民访问 Anthropic 的 Fable 5 和 Mythos 5 模型,包括 Anthropic 内部的外籍员工。Anthropic 表示认为此举存在误解并正积极沟通恢复访问,其余 Claude 模型不受影响。事件揭示 AI 顶级模型正面临日益增加的地缘政治监管风险。 原文
【OpenAI】AI 辅助诊断罕见儿童遗传病取得突破 研究人员使用 OpenAI 推理模型在此前无法确诊的病例中新增识别出 18 例罕见遗传病诊断。这是 AI 推理能力在真实临床场景中的重要验证,展示了 AI 在高难度医学诊断中的实际价值。 原文
【Google DeepMind】AMIE 医疗 AI 登上 Nature,复杂病管理达到初级医师水平 Google 发表于《Nature》的研究显示,对话式医疗 AI AMIE 在复杂疾病管理场景中的表现与初级保健医师相当。这是顶级学术期刊对大模型医疗能力的正式认可,意义重大。 原文
【xAI】Grok 全面融入微软 Office 生态 Grok 插件相继上线 Microsoft Word 和 PowerPoint,支持联网搜索、X 平台数据获取、图表生成及幻灯片内图像创作。同期 Grok TTS 在 Vapi Humanness Index 以 96 分(满分 100)位列语音模型第一。xAI 正快速建立企业级多模态产品矩阵。 原文(Word) | 原文(PowerPoint)
SWE-bench Verified
| 模型 | 排名变化 | 分数变化 |
|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B | 103 → 76 ↑ | 52.2 → 60.4 (+15.7%) |
| Nemotron-CORTEXA | 50 → 82 ↓ | 68.2 → 58.2 (-14.7%) |
| devlo | 44 → 83 ↓ | 70.2 → 58.2 (-17.1%) |
| Warp | 11 → 36 ↓ | 75.6 → 71.0 (-6.1%) |
Qwen3-Coder 方案强势上升;Nemotron-CORTEXA 和 devlo 出现显著下滑,可能与测试集更新或评估口径变化有关。
Terminal Bench 2.0
| 模型 | 排名变化 | 分数变化 |
|---|---|---|
| LemonHarness / Multiple | 8 → 2 ↑ | 79.9 → 84.5 (+5.8%) |
| Warp / Multiple | 41 → 65 ↓ | 61.2 → 50.1 (-18.2%) |
LemonHarness 跻身榜眼;Warp 在两个 Benchmark 中同时大幅下滑,值得关注。