【Anthropic】Claude Fable 5 重新上线 美国商务部解除出口管制后,Claude Fable 5 和 Mythos 5 恢复全球访问。Anthropic 新增分类器阻止网络安全任务滥用,常规编程任务回退至 Opus 4.8。公司与亚马逊、微软、谷歌等共建 AI 越狱评估框架。重要:这标志着监管与合作的新模式。 https://x.com/AnthropicAI/status/2072163884430229756
【Anthropic】Claude Sonnet 5 发布,成为默认模型 Claude Sonnet 5 正式发布,具备 100 万 token 上下文窗口,支持自主规划、工具调用(浏览器、终端),成为 Claude Code 默认模型。至 8 月 31 日享促销定价 $2/$10 per Mtok。重要:中端模型首次达到此前高端模型的智能体能力。 https://github.com/anthropics/claude-code/releases/tag/v2.1.197
【OpenAI】发布 GPT-5.6 Sol 预览版 GPT-5.6 Sol 在编程、科学、网络安全领域能力显著增强,配套最先进的安全技术栈。同步推出 GeneBench-Pro 基准测试,评估 AI 在基因组学和生物学研究中的判断分析能力,问题需人类专家 20-40 小时完成。重要:OpenAI 持续强化科学推理能力。 https://openai.com/index/previewing-gpt-5-6-sol
【OpenAI】HP 扩大 Frontier 战略合作 HP Inc. 将 OpenAI Frontier 合作扩展至客户体验、软件开发和企业运营全场景,成为 OpenAI 重要的企业级部署案例。重要:企业级 AI 采用持续加速。 https://openai.com/index/hp-frontier-partnership
【Google DeepMind】Gemini Omni Flash 登顶 Video Arena Gemini Omni Flash 以 Elo 1404 首登 Video Arena 榜首,领先第二名 Seedance 2.0 Mini 达 101 分,创该榜单史上最大跃升。同步发布 Nano Banana 2 Lite 图像模型。重要:Google 确立视频生成领域领先地位。 https://x.com/demishassabis/status/2072833056004522440
LMArena Overall
SWE-bench Verified
Terminal Bench 2.0
| 日期 | 新闻 |
|---|---|
| 2026-06-30 | ChatGPT 采用扩展数据:全球用户使用增长,探索更多功能 |
| 2026-06-30 | GeneBench-Pro 发布:基因组学、生物学研究新基准 |
| 2026-06-30 | Core dump 流行病学调试:发现 18 年历史软件漏洞 |
| 2026-06-29 | 欧洲 AI 劳动力报告:分析欧盟工作岗位自动化影响 |
| 2026-06-28 | HP Frontier 战略合作:在企业运营部署 AI |
| 2026-06-26 | GPT-5.6 Sol 预览版:编码、科学、网络安全能力增强 |
| 2026-06-25 | AI 代理工作报告:扩展生产力 |
| 2026-06-24 | 与 Broadcom 推出 Jalapeño 推理芯片:LLM 优化推理芯片 |
| 2026-06-23 | GPT-5 助力免疫学突破:解决 3 年 T 细胞行为谜题 |
| 2026-06-22 | Daybreak 安全工具:Codex Security 和 GPT-5.5-Cyber 漏洞修复 |
| 2026-06-21 | 三星部署 ChatGPT Enterprise:最大规模企业 AI 部署之一 |
Codex 更新:CLI 0.142.5(日志安全修复)、Remote 正式发布(手机远程控制)。
| 日期 | 新闻 |
|---|---|
| 2026-07-01 | Fable 5 恢复全球上线:新增网络安全分类器,部分编码任务回退至 Opus 4.8 |
| 2026-07-01 | 出口管制解除公告:与美政府合作制定 AI 越狱评估框架 |
| 2026-06-30 | Claude Sonnet 5 发布:最强代理能力 Sonnet 模型 |
| 2026-06-27 | Mythos 5 部分恢复:向关键基础设施组织开放 |
| 2026-06-25 | 加入 RAISE US 联盟:推动美国劳动力 AI 转型 |
| 2026-06-23 | Claude Tag 发布:Slack 团队协作新方式 |
Claude Code 版本更新:v2.1.201(Sonnet 5 系统角色修复)、v2.1.200(AskUserQuestion 不再自动继续)、v2.1.199(技能堆叠支持)、v2.1.198(子代理后台运行)、v2.1.197(Sonnet 5 默认模型)。
Artifacts 功能扩展:Pro 和 Max 计划现已支持,代码实时发布至 claude.ai。
| 日期 | 新闻 |
|---|---|
| 2026-07-01 | 6 月 AI 更新汇总 |
| 2026-07-01 | 纽约 AI 教育峰会:150 位教育行业领袖参与 |
| 2026-06-30 | 英国生产力计划 |
| 2026-06-29 | AI 全栈解析 |
| 2026-06-25 | Google Finance 升级:新应用发布 |
Gemma 4:下载量突破 2 亿(2.5 个月内)。
Gemini Omni Flash:Video Arena 排名第一,Elo 1404,领先第二名 101 分。
| 日期 | 新闻 |
|---|---|
| 2026-07-02 | Grok Build 登陆 Railway 沙盒 |
| 2026-06-29 | Grok 语音 API 登陆 Vercel AI Gateway |
| 2026-06-25 | SuperGrok/X 订阅支持 T3code |
| 2026-06-24 | MongoDB 官方插件:数据库查询优化 |
| 2026-06-23 | Firecrawl 插件上架:网页抓取 |
| 2026-06-22 | Interactive Brokers 集成:投资组合分析 |
| 2026-06-22 | /goal 功能:长时自主任务执行 |
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
来源:GitHub
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | Claude Opus 4-6 (thinking)* | 51.9 |
来源:Scale Labs
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
来源:TBench
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Fable 5 | 1508.5 |
| 2 | Claude Opus 4-6 Thinking | 1503.6 |
| 3 | Claude Opus 4-7 Thinking | 1502.0 |
来源:HuggingFace
新模型入场:
显著上升:
| 模型 | 旧排名 → 新排名 | 分数变化 |
|---|---|---|
| Gemini 3.5 Flash | 13 → 11 | +3.0 |
| Gemini 3 Flash | 20 → 19 | - |
| Claude Opus 4-5-20251101 Thinking-32k | 21 → 20 | - |
| Qwen 3.7 Max Preview | 16 → 15 | - |
显著下降:
| 模型 | 旧排名 → 新排名 | 分数变化 |
|---|---|---|
| Claude Opus 4-8 | 11 → 13 | -2.5 |
| GLM 5.1 | 19 → 22 | -1.2 |
| GLM 5.2 (max) | 25 → 26 | -1.2 |
| Grok 4.20 Beta Reasoning | 15 → 17 | -0.9 |
| Mimo V2 Omni | 73 → 76 | -1.1 |
| Qwen 3.7 Plus | 32 → 33 | -1.3 |
显著变化:
| 模型 | 旧排名 → 新排名 | 分数变化 |
|---|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct | 103 → 76 | +8.2 |
| Warp | 11 → 36 | -4.6 |
| Nemotron-CORTEXA | 50 → 82 | -10.0 |
| Devlo | 44 → 83 | -12.0 |
显著变化:
| 模型 | 旧排名 → 新排名 | 分数变化 |
|---|---|---|
| LemonHarness / Multiple | 8 → 2 | +4.6 |
| Gemini CLI / Gemini 3.1 Pro | 45 → 40 | +2.0 |
| Warp / Multiple | 41 → 65 | -11.1 |