【Anthropic】Claude Fable 5 恢复全球上线
美国商务部解除出口管制,Claude Fable 5 和 Mythos 5 重新部署。Fable 5 新增分类器阻止网络安全任务,部分编码调试任务将回退至 Opus 4.8。Anthropic 与亚马逊、微软、谷歌等合作制定 AI 越狱评估框架。此次事件标志着 AI 安全监管的重要进展。 https://x.com/AnthropicAI/status/2072163884430229756
【Anthropic】Claude Sonnet 5 发布,成为 Claude Code 默认模型
Claude Sonnet 5 具备原生 100 万 token 上下文窗口,支持自主规划、浏览器和终端工具调用。即日起成为 Claude Code 默认模型,促销定价 $2/$10 每百万 token(至 8 月 31 日)。Claude Desktop 现已支持 Linux(Ubuntu 和 Debian)。 https://github.com/anthropics/claude-code/releases/tag/v2.1.197
【OpenAI】发布 GeneBench-Pro 基因组学基准测试
GeneBench-Pro 是面向基因组学、生物学和科研领域的 AI 基准测试,使用真实复杂数据集评估 AI 在判断密集型分析中的表现。单个问题需人类专家 20-40 小时完成,GPT-5.6 Sol 在此基准上取得显著进步。 https://openai.com/index/introducing-genebench-pro
【OpenAI】预览 GPT-5.6 Sol 下一代模型
GPT-5.6 Sol 在编程、科学和网络安全领域能力更强,配备最先进的安全技术栈。该模型在 GeneBench-Pro 基准测试中展现出显著进步。 https://openai.com/index/previewing-gpt-5-6-sol
【xAI】Grok TTS 获评最拟人语音模型
在 Vapi 的 Humanness Index 盲测投票中,Grok TTS 以 96 分位居榜首,仅比真实人声(100 分)低 4 分。Grok 语音 API 现已集成 Vercel AI Gateway。 https://x.com/xai/status/2067654108123910495
SWE-bench Verified
Terminal Bench 2.0
| 日期 | 新闻 |
|---|---|
| 07-01 | Codex CLI 0.142.5 发布,阻止完整 WebSocket 请求写入日志 |
| 06-30 | ChatGPT 全球采用扩展报告:用户使用量增长、探索更多功能、跨区域跨语言增长 |
| 06-30 | GeneBench-Pro 发布:测试 AI 在基因组学、生物学和科研中的表现,任务需人类专家 20-40 小时完成 |
| 06-30 | Core dump 流行病学:修复 18 年老 bug:大规模 core dump 分析发现硬件故障和长期软件 bug |
| 06-29 | 欧洲 AI 劳动力机会地图:分析欧盟哪些职业面临自动化、增长或工作流变化 |
| 06-28 | HP 扩大 Frontier 战略合作:在客户体验、软件开发和企业运营中部署 AI |
| 06-26 | 预览 GPT-5.6 Sol:下一代模型,强化代码、科学和网络安全能力,配备最先进安全栈 |
| 06-25 | Codex Remote 正式发布:通过 ChatGPT 移动端远程操作 Mac/Windows 主机 |
| 06-25 | AI Agent 如何改变工作:研究论文展示 Agent 处理更长更复杂任务 |
| 06-24 | OpenAI 与 Broadcom 发布 Jalapeño 推理芯片:专为 LLM 推理优化的定制 AI 芯片 |
| 06-23 | GPT-5 助力免疫学家解开 3 年谜题:GPT-5 Pro 帮助解析 T 细胞行为,支持癌症和自身免疫研究 |
| 06-23 | Appia Foundation 共建 AI 标准:支持评估框架、安全实践和全球合作 |
| 06-22 | Daybreak 安全工具发布:Codex Security 和 GPT-5.5-Cyber 帮助组织大规模发现和修补漏洞 |
| 06-22 | Patch the Planet 计划:帮助开源维护者用 AI 发现、验证和修复漏洞 |
| 06-21 | 三星部署 ChatGPT Enterprise 和 Codex:OpenAI 最大规模企业部署之一 |
| 06-18 | ChatGPT Enterprise 新增用量分析和支出控制 |
| 06-18 | ChatGPT 健康智能提升:GPT-5.5 Instant 改进健康和健身回复 |
| 06-18 | AI 辅助诊断罕见儿童遗传病:推理模型帮助确诊 18 例此前未解病例 |
| 日期 | 新闻 |
|---|---|
| 07-01 | Claude Fable 5 恢复全球上线 |
| 07-01 | Fable 5 重新部署说明:新增网络安全分类器,部分常规编码任务回退至 Opus 4.8;与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴起草越狱严重性评估框架 |
| 06-30 | 商务部解除 Fable 5 和 Mythos 5 出口管制 |
| 06-30 | 发布 Claude Sonnet 5:最具 Agent 能力的 Sonnet,支持规划、浏览器/终端工具,自主运行;Claude Code 默认模型,原生 1M token 上下文,促销价 $2/$10 per Mtok |
| 06-30 | Claude Desktop 登陆 Linux:Ubuntu 和 Debian beta 版 |
| 06-29 | Claude in Microsoft Foundry 正式发布:Azure 托管,提供 Opus 4.8 和 Haiku 4.5 |
| 06-27 | Mythos 5 恢复对关键基础设施组织的访问 |
| 06-25 | 加入 RAISE US 创始合作伙伴:非营利联盟,加强美国劳动力 AI 转型 |
| 06-23 | 发布 Claude Tag:Slack 中 Claude 作为团队成员,可访问指定频道和工具 |
| 日期 | 新闻 |
|---|---|
| 07-01 | 6 月 AI 更新汇总 |
| 07-01 | 纽约 AI 教育峰会:150 位教育和行业领袖参与 |
| 06-30 | Gemini Omni Flash 和 Nano Banana 2 Lite 发布:最快最便宜的 Gemini 图像模型;视频生成 API 上线 |
| 06-30 | 英国 AI 生产力计划 |
| 06-29 | AI 全栈技术解读 |
| 06-25 | Gemma 4 下载量破 2 亿:2.5 个月内达成,此前 Gemma 全系列累计 1 亿 |
| 06-25 | Google Finance 更新:含新 App |
| 日期 | 新闻 |
|---|---|
| 06-29 | Grok 语音 API 登陆 Vercel AI Gateway:grok-voice-think-fast-1.0(实时)、grok-tts(生成)、grok-stt(转录) |
| 06-25 | SuperGrok 和 X 订阅可在 T3code 使用 |
| 06-24 | Grok Build 官方 MongoDB 插件:查询数据、优化索引、管理数据库 |
| 06-23 | Firecrawl 插件登陆 Grok Build:搜索网页、抓取、交互页面 |
| 06-22 | Grok 连接 Interactive Brokers:研究投资、分析组合 |
| 06-22 | Grok Build 新增 /goal 命令:自主执行长时间任务,多轮子 Agent 实现和验证 |
| 06-18 | Grok TTS 人类相似度指数 96 分:仅次于真人(100 分) |
| 06-18 | Grok 模型登陆 Databricks Agent Bricks |
| 06-18 | Grok Word 插件上线:起草文档、总结研究、生成图表 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
本期变化:
| 模型 | 变化 | 详情 |
|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B | ↑27 名 | 52.2 → 60.4 |
| Warp | ↓25 名 | 75.6 → 71.0 |
| Nemotron-CORTEXA | ↓32 名 | 68.2 → 58.2 |
| devlo | ↓39-50 名 | 70.2 → 54.2-58.2 |
| EPAM AI/Run + GPT4o | ↓6 名 | 27.0 → 24.0 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
本期无变动。
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
本期变化:
| 模型 | 变化 | 详情 |
|---|---|---|
| LemonHarness / Multiple | ↑6 名 | 79.9 → 84.5 |
| Gemini CLI / Gemini 3.1 Pro | ↑5 名 | 59.4 → 61.4 |
| Warp / Multiple | ↓6-24 名 | 61.2 → 50.1-59.1 |
| little-coder / Qwen3.6-35B | ↑5 名 | 23.0 → 24.6 |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1508.16 |
| 2 | claude-opus-4-6-thinking | 1503.09 |
| 3 | claude-opus-4-7-thinking | 1502.31 |
本期无变动。