← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-02 00:47

2026-07-02 08:47 CST
快速版 完整版

核心速览

【Anthropic】Claude Fable 5 恢复全球上线

美国商务部解除出口管制,Claude Fable 5 和 Mythos 5 重新部署。Fable 5 新增分类器阻止网络安全任务,部分编码调试任务将回退至 Opus 4.8。Anthropic 与亚马逊、微软、谷歌等合作制定 AI 越狱评估框架。此次事件标志着 AI 安全监管的重要进展。 https://x.com/AnthropicAI/status/2072163884430229756

【Anthropic】Claude Sonnet 5 发布,成为 Claude Code 默认模型

Claude Sonnet 5 具备原生 100 万 token 上下文窗口,支持自主规划、浏览器和终端工具调用。即日起成为 Claude Code 默认模型,促销定价 $2/$10 每百万 token(至 8 月 31 日)。Claude Desktop 现已支持 Linux(Ubuntu 和 Debian)。 https://github.com/anthropics/claude-code/releases/tag/v2.1.197

【OpenAI】发布 GeneBench-Pro 基因组学基准测试

GeneBench-Pro 是面向基因组学、生物学和科研领域的 AI 基准测试,使用真实复杂数据集评估 AI 在判断密集型分析中的表现。单个问题需人类专家 20-40 小时完成,GPT-5.6 Sol 在此基准上取得显著进步。 https://openai.com/index/introducing-genebench-pro

【OpenAI】预览 GPT-5.6 Sol 下一代模型

GPT-5.6 Sol 在编程、科学和网络安全领域能力更强,配备最先进的安全技术栈。该模型在 GeneBench-Pro 基准测试中展现出显著进步。 https://openai.com/index/previewing-gpt-5-6-sol

【xAI】Grok TTS 获评最拟人语音模型

在 Vapi 的 Humanness Index 盲测投票中,Grok TTS 以 96 分位居榜首,仅比真实人声(100 分)低 4 分。Grok 语音 API 现已集成 Vercel AI Gateway。 https://x.com/xai/status/2067654108123910495


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 升至 60.4(+8.2 分,↑27 名)
  • Warp:排名从 11 跌至 36,分数从 75.6 降至 71.0(-4.6 分,↓25 名)
  • devlo:排名从 44 跌至 94,分数从 70.2 降至 54.2(-16 分,↓50 名)
  • Nemotron-CORTEXA:排名从 50 跌至 82,分数从 68.2 降至 58.2(-10 分,↓32 名)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至第 2,分数从 79.9 升至 84.5(+4.6 分,↑6 名)
  • Warp / Multiple:排名从 41 跌至 65,分数从 61.2 降至 50.1(-11.1 分,↓24 名)

快速预览

  • OpenAI 发布 GeneBench-Pro 基准测试,GPT-5.6 Sol 在基因组学任务表现突出;预览 GPT-5.6 Sol 模型,强化代码、科学和网络安全能力
  • Anthropic Claude Fable 5 和 Mythos 5 出口管制解除,Fable 5 重新上线并新增网络安全分类器;发布 Claude Sonnet 5,原生支持 1M token 上下文
  • xAI Grok 语音 API 登陆 Vercel AI Gateway,Grok TTS 在人类相似度指数获 96 分
  • SWE-Bench Verified EntroPO + Qwen3-Coder 大幅跃升(52.2→60.4),Warp 下滑(75.6→71.0);Terminal Bench 2 LemonHarness 冲至第 2(79.9→84.5)
  • LM Arena Claude Fable 5 以 1508 分领跑,前 5 名均为 Claude 系列模型

新闻

OpenAI

日期 新闻
07-01 Codex CLI 0.142.5 发布,阻止完整 WebSocket 请求写入日志
06-30 ChatGPT 全球采用扩展报告:用户使用量增长、探索更多功能、跨区域跨语言增长
06-30 GeneBench-Pro 发布:测试 AI 在基因组学、生物学和科研中的表现,任务需人类专家 20-40 小时完成
06-30 Core dump 流行病学:修复 18 年老 bug:大规模 core dump 分析发现硬件故障和长期软件 bug
06-29 欧洲 AI 劳动力机会地图:分析欧盟哪些职业面临自动化、增长或工作流变化
06-28 HP 扩大 Frontier 战略合作:在客户体验、软件开发和企业运营中部署 AI
06-26 预览 GPT-5.6 Sol:下一代模型,强化代码、科学和网络安全能力,配备最先进安全栈
06-25 Codex Remote 正式发布:通过 ChatGPT 移动端远程操作 Mac/Windows 主机
06-25 AI Agent 如何改变工作:研究论文展示 Agent 处理更长更复杂任务
06-24 OpenAI 与 Broadcom 发布 Jalapeño 推理芯片:专为 LLM 推理优化的定制 AI 芯片
06-23 GPT-5 助力免疫学家解开 3 年谜题:GPT-5 Pro 帮助解析 T 细胞行为,支持癌症和自身免疫研究
06-23 Appia Foundation 共建 AI 标准:支持评估框架、安全实践和全球合作
06-22 Daybreak 安全工具发布:Codex Security 和 GPT-5.5-Cyber 帮助组织大规模发现和修补漏洞
06-22 Patch the Planet 计划:帮助开源维护者用 AI 发现、验证和修复漏洞
06-21 三星部署 ChatGPT Enterprise 和 Codex:OpenAI 最大规模企业部署之一
06-18 ChatGPT Enterprise 新增用量分析和支出控制
06-18 ChatGPT 健康智能提升:GPT-5.5 Instant 改进健康和健身回复
06-18 AI 辅助诊断罕见儿童遗传病:推理模型帮助确诊 18 例此前未解病例

Anthropic

日期 新闻
07-01 Claude Fable 5 恢复全球上线
07-01 Fable 5 重新部署说明:新增网络安全分类器,部分常规编码任务回退至 Opus 4.8;与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴起草越狱严重性评估框架
06-30 商务部解除 Fable 5 和 Mythos 5 出口管制
06-30 发布 Claude Sonnet 5:最具 Agent 能力的 Sonnet,支持规划、浏览器/终端工具,自主运行;Claude Code 默认模型,原生 1M token 上下文,促销价 $2/$10 per Mtok
06-30 Claude Desktop 登陆 Linux:Ubuntu 和 Debian beta 版
06-29 Claude in Microsoft Foundry 正式发布:Azure 托管,提供 Opus 4.8 和 Haiku 4.5
06-27 Mythos 5 恢复对关键基础设施组织的访问
06-25 加入 RAISE US 创始合作伙伴:非营利联盟,加强美国劳动力 AI 转型
06-23 发布 Claude Tag:Slack 中 Claude 作为团队成员,可访问指定频道和工具

Google

日期 新闻
07-01 6 月 AI 更新汇总
07-01 纽约 AI 教育峰会:150 位教育和行业领袖参与
06-30 Gemini Omni Flash 和 Nano Banana 2 Lite 发布:最快最便宜的 Gemini 图像模型;视频生成 API 上线
06-30 英国 AI 生产力计划
06-29 AI 全栈技术解读
06-25 Gemma 4 下载量破 2 亿:2.5 个月内达成,此前 Gemma 全系列累计 1 亿
06-25 Google Finance 更新:含新 App

xAI

日期 新闻
06-29 Grok 语音 API 登陆 Vercel AI Gateway:grok-voice-think-fast-1.0(实时)、grok-tts(生成)、grok-stt(转录)
06-25 SuperGrok 和 X 订阅可在 T3code 使用
06-24 Grok Build 官方 MongoDB 插件:查询数据、优化索引、管理数据库
06-23 Firecrawl 插件登陆 Grok Build:搜索网页、抓取、交互页面
06-22 Grok 连接 Interactive Brokers:研究投资、分析组合
06-22 Grok Build 新增 /goal 命令:自主执行长时间任务,多轮子 Agent 实现和验证
06-18 Grok TTS 人类相似度指数 96 分:仅次于真人(100 分)
06-18 Grok 模型登陆 Databricks Agent Bricks
06-18 Grok Word 插件上线:起草文档、总结研究、生成图表

Benchmark 快照与变化

SWE-Bench Verified

当前 Top 3:

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

本期变化:

模型 变化 详情
EntroPO + R2E + Qwen3-Coder-30B ↑27 名 52.2 → 60.4
Warp ↓25 名 75.6 → 71.0
Nemotron-CORTEXA ↓32 名 68.2 → 58.2
devlo ↓39-50 名 70.2 → 54.2-58.2
EPAM AI/Run + GPT4o ↓6 名 27.0 → 24.0

来源:GitHub - OpenAutoCoder

SWE-Bench Pro (Public)

当前 Top 3:

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 claude-opus-4-6 (thinking)* 51.9

本期无变动。

来源:Scale Labs Leaderboard

Terminal Bench 2.0

当前 Top 3:

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

本期变化:

模型 变化 详情
LemonHarness / Multiple ↑6 名 79.9 → 84.5
Gemini CLI / Gemini 3.1 Pro ↑5 名 59.4 → 61.4
Warp / Multiple ↓6-24 名 61.2 → 50.1-59.1
little-coder / Qwen3.6-35B ↑5 名 23.0 → 24.6

来源:TBench Leaderboard

LM Arena (Overall)

当前 Top 3:

排名 模型 分数
1 claude-fable-5 1508.16
2 claude-opus-4-6-thinking 1503.09
3 claude-opus-4-7-thinking 1502.31

本期无变动。

来源:HuggingFace Leaderboard

来源 · 70 条