← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-01 00:49

2026-07-01 08:49 CST
快速版 完整版

核心速览

【OpenAI】预览 GPT-5.6 Sol 下一代模型

OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,配备最先进的安全技术栈。这是 GPT-5 系列的最新迭代,标志着模型能力的持续提升。 https://openai.com/index/previewing-gpt-5-6-sol

【Anthropic】发布 Claude Sonnet 5,成为 Claude Code 默认模型

Claude Sonnet 5 正式发布,原生支持 100 万 token 上下文窗口,具备更强的代理能力,可自主规划、使用浏览器和终端等工具。该模型现已成为 Claude Code 默认模型,推广期定价为 $2/$10 每百万 token(截至 8 月 31 日)。 https://github.com/anthropics/claude-code/releases/tag/v2.1.197

【Anthropic】美国商务部解除 Claude Fable 5 和 Mythos 5 出口管制

美国商务部已解除对 Claude Fable 5 和 Mythos 5 的出口管制,Anthropic 将从 7 月 1 日起恢复访问。此前 Mythos 5 已获准重新部署给运营关键基础设施的美国组织,此次全面解禁意味着两款模型将恢复通用。 https://x.com/AnthropicAI/status/2072106151890809341

【OpenAI】推出 GeneBench-Pro 基因组学基准测试

OpenAI 发布 GeneBench-Pro,这是一个新的基准测试,用于评估 AI 在基因组学、生物学和科学研究领域的表现,使用复杂的真实世界数据集。该基准将推动 AI 在生命科学领域的应用发展。 https://openai.com/index/introducing-genebench-pro

【xAI】Grok TTS 在语音人性化指数中领先

xAI 的 Grok TTS 模型在 Vapi 的 Humanness Index 盲测投票中获得 96 分,仅比真人语音低 4 分,在所有语音模型中排名第一。该测试通过克隆同一语音和引语跨模型对比,评估语音合成的人性化程度。 https://x.com/xai/status/2067654108123910495


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 提升至 60.4(+8.2分,↑27名)
  • Warp:排名从 11 跌至 36,分数从 75.6 降至 71.0(-4.6分,↓25名)
  • devlo:排名从 44 跌至 94,分数从 70.2 降至 54.2(-16.0分,↓50名)
  • Nemotron-CORTEXA:排名从 50 跌至 82,分数从 68.2 降至 58.2(-10.0分,↓32名)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至第 2,分数从 79.9 提升至 84.5(+4.6分,↑6名)
  • Warp / Multiple:排名从 41 跌至 65,分数从 61.2 降至 50.1(-11.1分,↓24名)

快速预览

  • OpenAI 发布 GPT-5.6 Sol 预览版,强化编程、科学和网络安全能力
  • Anthropic 推出 Claude Sonnet 5,成为 Claude Code 默认模型,原生支持 1M token 上下文
  • 美国商务部解除 Claude Fable 5 和 Mythos 5 出口管制,将恢复访问
  • SWE-Bench Pro: GPT-5.4 (xHigh) 以 59.1 分领跑,Muse Spark 55.0 分紧随其后
  • Terminal Bench 2: LemonHarness 排名从第 8 跃升至第 2,分数从 79.9 升至 84.5

新闻

OpenAI

日期 新闻
06-30 ChatGPT 采用扩展报告 - 全球用户增长、使用频率提升、跨区域跨语言扩展
06-30 GeneBench-Pro 发布 - 新基准测试 AI 在基因组学、生物学和科研领域的表现
06-30 Core dump 流行病学 - 工程师通过大规模 core dump 分析发现硬件故障和 18 年历史软件 bug
06-29 欧洲 AI 劳动力机会报告 - 分析 AI 对欧盟各职业的自动化、增长和工作流变化影响
06-28 HP Frontier 战略合作 - HP 扩大与 OpenAI 合作,在客户体验、软件开发和企业运营中部署 AI
06-26 GPT-5.6 Sol 预览 - 下一代模型,强化编程、科学和网络安全能力,配备最先进安全栈
06-25 AI Agent 变革工作研究 - 研究展示 AI agent 如何处理更长更复杂任务
06-25 Codex Remote 正式发布 - 通过 ChatGPT 移动端远程操作 Mac/Windows 主机
06-24 OpenAI-Broadcom Jalapeño 芯片 - 定制 LLM 推理芯片,提升性能和效率
06-23 GPT-5 助力免疫学家解谜 - GPT-5 Pro 帮助解决 3 年 T 细胞行为谜题
06-22 Daybreak 安全工具 - 发布 Codex Security 和 GPT-5.5-Cyber,帮助组织发现和修复漏洞
06-21 三星部署 ChatGPT Enterprise - 全球员工部署,OpenAI 最大企业级部署之一

Codex 更新:06-29 修复后台 token 消耗过快问题,推出细粒度权限配置系统;06-22 iOS 添加主机人格设置;06-18 macOS 添加 Record & Replay 功能。

Anthropic

日期 新闻
06-30 Claude Sonnet 5 发布 - 成为 Claude Code 默认模型,原生 1M token 上下文,促销价 $2/$10 per Mtok
06-30 Claude Fable 5/Mythos 5 出口管制解除 - 美国商务部通知解除管制,将恢复访问
06-30 Claude Desktop Linux 版发布 - 支持 Ubuntu 和 Debian,Beta 版本
06-29 Claude 登陆 Microsoft Foundry - 正式可用,Azure 托管,提供 Opus 4.8 和 Haiku 4.5
06-27 Mythos 5 部分恢复访问 - 美国关键基础设施运营方可使用 Mythos 5
06-25 加入 RAISE US 联盟 - 作为创始合作伙伴,推动美国劳动力 AI 转型
06-23 Claude Tag 发布 - Slack 中以团队成员身份加入指定频道

Claude Code 更新:v2.1.196 支持组织默认模型;v2.1.195 添加禁用鼠标点击选项;v2.1.193 增强 shell 命令自动分类;v2.1.191 支持 /rewind 恢复清空前对话。

Google

日期 新闻
06-30 英国 AI 生产力计划 - 培训 AI 先锋人才
06-30 Nano Banana 2 Lite + Gemini Omni Flash 发布 - 最快最便宜的 Gemini 图像模型 + 视频生成 API
06-29 AI 全栈解析 - 解释 AI 基础设施各层
06-25 Gemma 4 下载量破 2 亿 - 2.5 个月内达成,此前整个 Gemma 家族累计 1 亿
06-25 Google Finance 升级 - 新应用发布
06-17 AMIE 医疗 AI 研究 - 发表于 Nature,复杂疾病管理能力匹敌初级保健医生

xAI

日期 新闻
06-29 Grok 语音 API 登陆 Vercel AI Gateway - 实时语音、TTS、STT 三种模型
06-25 SuperGrok/X 订阅支持 T3code
06-24 MongoDB 官方插件 - Grok Build 中查询数据、优化索引
06-23 Firecrawl 插件上线 - 网页搜索、抓取、交互
06-22 Interactive Brokers 集成 - 投资组合分析
06-22 /goal 命令发布 - 长时间自主任务执行
06-18 Grok TTS 人性化评分 96 - Vapi Humanness Index 排名第一,仅比真人低 4 分
06-18 Grok 登陆 Databricks Agent Bricks
06-18 Word 插件发布 - 文档起草、研究总结、图表生成
06-17 DigitalOcean VM 预装 Grok Build

Benchmark 快照

SWE-Bench Verified

本期有变动

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8

变化

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct: 排名 103→76,分数 52.2→60.4 (+8.2)
  • Warp: 排名 11→36,分数 75.6→71.0 (-4.6)
  • Nemotron-CORTEXA: 排名 50→82,分数 68.2→58.2 (-10.0)
  • devlo: 排名 44→83/94,分数 70.2→58.2/54.2
  • EPAM AI/Run Developer Agent + GPT4o: 排名 156→162,分数 27.0→24.0

来源:https://github.com/OpenAutoCoder/live-swe-agent

SWE-Bench Pro (Public)

本期无变动

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 claude-opus-4-6 (thinking)* 51.9

来源:https://labs.scale.com/leaderboard/swe_bench_pro_public

Terminal Bench 2.0

本期有变动

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1

变化

  • LemonHarness / Multiple: 排名 8→2,分数 79.9→84.5 (+4.6)
  • Gemini CLI / Gemini 3.1 Pro: 排名 45→40,分数 59.4→61.4 (+2.0)
  • Warp / Multiple: 排名 41→47/65,分数 61.2→59.1/50.1
  • little-coder / Qwen3.6-35B-A3B: 排名 121→116,分数 23.0→24.6 (+1.6)

来源:https://www.tbench.ai/leaderboard/terminal-bench/2.0

LMArena (Overall)

本期无变动

排名 模型 分数
1 claude-fable-5 1508.16
2 claude-opus-4-6-thinking 1503.09
3 claude-opus-4-7-thinking 1502.31

来源:https://datasets-server.huggingface.co/rows?dataset=lmarena-ai/leaderboard-dataset&config=text_style_control&split=latest

来源 · 67 条