【Anthropic】Claude Fable 5 恢复全球访问
美国商务部解除对 Claude Fable 5 和 Mythos 5 的出口管制,Anthropic 重新部署模型并新增分类器阻止网络安全滥用。部分常规任务将回退至 Opus 4.8,公司正与政府、Amazon、Microsoft、Google 等合作制定 AI 越狱评估框架。这是继 6 月 12 日管制以来的重大进展。 https://x.com/AnthropicAI/status/2072163884430229756
【Anthropic】Claude Sonnet 5 发布,成为 Claude Code 默认模型
Claude Sonnet 5 现为 Claude Code 默认模型,具备原生 100 万 token 上下文窗口,可自主规划、使用浏览器和终端工具。推广期定价为输入 $2/输出 $10 每百万 token(至 8 月 31 日),性能接近数月前更大更昂贵的模型。 https://github.com/anthropics/claude-code/releases/tag/v2.1.197
【OpenAI】GPT-5.6 Sol 预览版发布
OpenAI 发布下一代模型 GPT-5.6 Sol,在编程、科学和网络安全领域能力显著增强,配备最先进的安全技术栈。该模型在 GeneBench-Pro 基准测试中表现突出,标志着 AI 在基因组学和科学研究领域的重要进步。 https://openai.com/index/previewing-gpt-5-6-sol
【OpenAI】GeneBench-Pro 基准测试发布
OpenAI 推出 GeneBench-Pro,专为测试 AI 在基因组学、生物学和科学研究中的表现而设计,使用真实复杂数据集。测试问题需人类专家约 20-40 小时完成,GPT-5.6 Sol 在此基准上取得重大突破。 https://openai.com/index/introducing-genebench-pro
【Google DeepMind】Gemini Omni Flash 登顶视频生成榜首
Gemini Omni Flash 以 Elo 1404 分位居 Video Arena 第一,领先第二名 Seedance 2.0 Mini 101 分,创下视频生成领域最大领先幅度纪录。Google 同时发布 Nano Banana 2 Lite 图像模型。 https://x.com/demishassabis/status/2072833056004522440
SWE-bench Verified
Terminal Bench 2.0
| 日期 | 新闻 |
|---|---|
| 06-30 | How ChatGPT adoption has expanded — 新数据显示 ChatGPT 全球使用增长,用户增加使用频率并探索更多功能 |
| 06-30 | Introducing GeneBench-Pro — 新基准测试 AI 在基因组学、生物学和科研领域的表现,使用真实复杂数据集 |
| 06-30 | Core dump epidemiology — 工程师通过大规模 core dump 分析发现硬件故障和 18 年历史的软件 bug |
| 06-29 | Mapping Europe's AI Workforce Opportunity — 报告分析 AI 如何重塑欧盟就业,识别面临自动化、增长或工作流变化的职业 |
| 06-28 | HP Inc. launches Frontier strategic partnership — HP 扩大与 OpenAI 的 Frontier 合作,在客户体验、软件开发和企业运营中部署 AI |
| 06-26 | Previewing GPT-5.6 Sol — 预览下一代模型,强化编程、科学和网络安全能力,配备最先进的安全栈 |
| 06-25 | How agents are transforming work — 研究论文展示 AI Agent 如何处理更长、更复杂的任务 |
| 06-24 | OpenAI and Broadcom unveil LLM-optimized inference chip — 发布 Jalapeño 定制 AI 芯片,专为 LLM 推理优化 |
| 06-23 | How GPT-5 helped immunologist solve mystery — GPT-5 Pro 协助解决 3 年免疫学难题,或助力癌症和自身免疫研究 |
| 06-22 | Daybreak: Tools for securing every organization — 发布 Daybreak 安全工具,包括 Codex Security 和 GPT-5.5-Cyber |
| 06-22 | Patch the Planet — Daybreak 计划帮助开源维护者发现、验证和修复漏洞 |
| 06-21 | Samsung Electronics brings ChatGPT and Codex — 三星向全球员工部署 ChatGPT Enterprise 和 Codex,为最大规模企业 AI 部署之一 |
Codex 更新:
| 日期 | 新闻 |
|---|---|
| 07-02 | Claude Code v2.1.199 — 支持堆叠 slash-skill 调用(最多加载 5 个 skill) |
| 07-01 | Claude Code v2.1.198 — 子 Agent 默认后台运行 |
| 06-30 | Claude Sonnet 5 发布 — 成为 Claude Code 默认模型,原生 1M token 上下文 |
| 06-29 | Claude Code v2.1.196 — 支持组织默认模型设置 |
| 07-01 | Fable 5 恢复上线 — 商务部解除出口管制,新增网络安全任务分类器,部分编码任务回退至 Opus 4.8 |
| 06-30 | 商务部解除 Mythos 5 和 Fable 5 出口管制 |
| 06-27 | Mythos 5 向关键基础设施组织恢复访问 |
| 06-25 | 加入 RAISE US 联盟 — 作为创始伙伴,支持美国劳动力 AI 转型 |
| 06-23 | Claude Tag 发布 — Slack 中 Claude 作为团队成员加入频道 |
| 日期 | 新闻 |
|---|---|
| 07-01 | June 2026 AI updates — 6 月 Pixel Drop 更新汇总 |
| 07-01 | NYC AI Education Summit — 与纽约教育界探讨 AI 在课堂的应用 |
| 06-30 | UK AI Trailblazers — 英国 AI 生产力计划 |
| 06-29 | Full-stack AI explainer — 解释 AI 全栈基础设施 |
| 06-25 | Google Finance updates — Google Finance 新功能和新应用 |
| 06-30 | Gemini Omni Flash + Nano Banana 2 Lite — 发布视频生成模型和最快图像模型 |
| 07-02 | Gemini Omni Flash 登顶 Video Arena — Elo 1404,领先第二名 101 分 |
| 06-25 | Gemma 4 下载量破 2 亿 — 2.5 个月内达成 |
| 日期 | 新闻 |
|---|---|
| 07-02 | Grok Build 登陆 Railway sandboxes |
| 06-29 | Grok 语音 API 登陆 Vercel AI Gateway — 支持 realtime voice、TTS、STT |
| 06-25 | SuperGrok 和 X 订阅支持 T3code |
| 06-24 | MongoDB 官方插件上线 Grok Build |
| 06-23 | Firecrawl 插件上线 Grok Build Plugin Marketplace |
| 06-22 | Interactive Brokers 集成 — 支持投资组合分析 |
| 06-22 | /goal 命令发布 — 支持长时间自主任务执行 |
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
来源:GitHub
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | Claude Opus 4.6 (thinking)* | 51.9 |
来源:Scale Labs
有变化:
| 模型 | 变化 |
|---|---|
| LemonHarness / Multiple | 排名 8→2,分数 79.9→84.5 ⬆️ |
| Gemini CLI / Gemini 3.1 Pro | 排名 45→40,分数 59.4→61.4 ⬆️ |
| Warp / Multiple | 排名 41→65,分数 61.2→50.1 ⬇️ |
| little-coder / Qwen3.6-35B-A3B | 排名 121→116,分数 23.0→24.6 ⬆️ |
当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
来源:TBench
本期无变动。当前 Top 3:
| 排名 | 模型 | Elo |
|---|---|---|
| 1 | Claude Fable 5 | 1508.16 |
| 2 | Claude Opus 4.6 (thinking) | 1503.09 |
| 3 | Claude Opus 4.7 (thinking) | 1502.31 |
来源:HuggingFace
| 模型 | 变化 |
|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct | 排名 103→76,分数 52.2→60.4 ⬆️ |
| Nemotron-CORTEXA | 排名 50→82,分数 68.2→58.2 ⬇️ |
| Warp | 排名 11→36,分数 75.6→71.0 ⬇️ |
| devlo | 排名 44→83/94,分数 70.2→58.2/54.2 ⬇️ |
| EPAM AI/Run Developer Agent + GPT4o | 排名 156→162,分数 27.0→24.0 ⬇️ |
| Solver (2024-09-12) | 排名 120→126,分数 45.4→43.6 ⬇️ |