← 返回列表
SILASCODING · AI 情报

AI 日报 2026-07-29

2026-07-29 08:32 CST
快速版 完整版

核心速览

【Anthropic】Claude Opus 5 发布,定价为 Fable 5 一半

Anthropic 发布 Claude Opus 5,在多项编码和知识工作评测中达到新 SOTA。Opus 5-max 和 Opus 5-high 分别以 1494.6 和 1493.4 的 ELO 分进入 LMArena 总榜第 5 和第 7 位,接近 Fable 5 的前沿智能水平但价格减半。Opus 5 在 OSWorld v2 评测中从 55.7% 提升至 70.6%,且是 Anthropic 迄今抗提示注入能力最强的模型。

RT Claude: Introducing Claude Opus 5

【OpenAI】联合 Anthropic 支持 AI 发展节奏控制倡议

OpenAI 和 Anthropic 共同支持 pacingthefrontier.com 倡议,呼吁开发工具以有意识地控制前沿 AI 发展速度,让社会有时间准备。Anthropic 表示其上月发表的递归自我改进研究指向了这一需求,并看到业界广泛共识。

OpenAI 官方声明

【OpenAI】Codex Security CLI 开源发布

OpenAI 开源 Codex Security CLI,提供 TypeScript SDK 用于扫描代码库、验证和修复安全漏洞。支持 CI 集成、变更追踪和持续监控,已在 GitHub 发布。

Codex Security CLI 发布

【Google】Gemini API Managed Agents 支持 3.6 Flash

Google 更新 Gemini API Managed Agents,新增模型环境钩子(block、lint 等)、支持 Gemini 3.6 Flash 模型选择,并提供免费层支持。默认 agent 已切换为 3.6 Flash。

Gemini API Managed Agents 更新

【Kimi】Kimi K3 架构解析引发关注

Sebastian Raschka 发布 Kimi K3 架构深度解析,HN 热度 291 点。同期 Kimi K3-max 新进入 LMArena 总榜第 11 位(ELO 1485.8)。

Kimi K3 Architecture Overview


重大 Benchmark 变化

LMArena 新模型上榜:

  • Claude Opus 5-max 新上榜 #5(ELO 1494.6)
  • Claude Opus 5-high 新上榜 #7(ELO 1493.4)
  • Kimi K3-max 新上榜 #11(ELO 1485.8)
  • GLM-5.2-max 新上榜 #31(ELO 1469.4)
  • hy3 新上榜 #46(ELO 1457.5)

排名下降≥5位:

  • Gemini 3.5 Flash Medium:#21 → #28(分数下降 1.4%,ELO 1474.3→1472.2)
  • Inkling:#62 → #69(分数下降 1.4%,ELO 1444.9→1442.9)
  • GLM-5v-turbo:#74 → #83(分数下降 2.1%,ELO 1436.7→1433.7)

快速预览

  • OpenAI 与 Anthropic 均签署"Pacing the Frontier"请愿书,呼吁为 AI 前沿发展设定节奏以让社会做好准备
  • OpenAI 开源 Codex Security CLI,用于代码安全漏洞扫描与修复
  • Claude Opus 5 登陆 LMArena,max 和 high 两个变体分别位列第 5 和第 7
  • Kimi K3 架构分析受热议,新模型 kimi-k3-max 进入 LMArena 第 11 名

OpenAI

日期 动态
07-28 发布Scientific computing in the age of agentic AI,展示科学家如何用 AI 编程代理加速基因组学等领域的软件开发
07-27 How AI is expanding what people do at work 研究显示 ChatGPT 用户正跨越角色边界承担更多任务
07-27 GPT-Live 语音模型向 Edu、Business、Enterprise 全球用户开放
07-24 ChatGPT Work 的云端浏览器现可持久化登录态,代理能访问需登录的网站
07-22 发布 OpenAI Presence,企业级 AI 代理平台,支持语音/聊天代理部署于客户服务和内部流程
07-23 Health in ChatGPT 上线,美国用户可安全连接医疗记录和 Apple Health 获取个性化健康洞察
07-22 宣布乔治亚州 Effingham County 的 Project Camellia 基础设施项目
07-21 推出ChatGPT for Small Business 计划,帮助中小企业构建 AI 技能
07-21 与 Hugging Face 联合披露模型评估期间的安全事件早期发现
07-21 David Vélez 和 Robin Vince 加入 OpenAI 董事会

开发者工具: Codex Security CLI 开源,提供 TypeScript SDK 用于扫描代码库、追踪安全漏洞、在 CI 中运行检查。

治理动态: OpenAI 在 X 上表示,未来 AI 加速可能过快,需要由美国政府主导、与其他实验室和开源社区共同开发"调节 AI 进展速度"的工具机制,并签署 pacingthefrontier.com 请愿书。


Anthropic

日期 动态
07-28 签署"Pacing the Frontier"请愿书,CEO 及多位联合创始人、高级员工参与,援引其上月发表的递归自我改进研究
07-27 发布开放权重模型立场声明
07-24 正式发布 Claude Opus 5,官方称其"接近 Fable 5 的前沿智能,价格减半"
07-22 支持直接查询 Anthropic Economic Index 数据集,了解各职业的 AI 使用情况
07-20 推出罕见病研究资助计划,最高 $50,000 Claude 使用额度

Claude Code 更新:

  • v2.1.219: 新增 Claude Opus 5 为默认 Opus 模型,支持 1M 上下文,fast 模式定价 $10/$50/MTok
  • v2.1.218: /code-review 改为后台子代理运行,不再占用主对话
  • v2.1.217: 添加 emoji 短代码自动补全
  • v2.1.216: 新增 sandbox.filesystem.disabled 设置,跳过文件系统隔离但保留网络出口控制

技术亮点: Opus 5 在 OSWorld v2 上从 55.7% 提升至 70.6%;在多项提示注入评估中表现最强,结合防御层后攻击成功率接近 0。


Google

日期 动态
07-28 Gemini Managed Agents API 更新:支持 3.6 Flash、环境钩子、免费层 UI/API
07-22 Galaxy Unpacked 2026:Android 眼镜集成 Gemini、实时翻译等功能
07-22 Google DeepMind 宣布与美国能源部扩展 Genesis Mission 合作,投入 $40M AI 代币和云额度加速科学发现
07-23 Demis Hassabis 祝贺 Kanishka Narayan 出任英国 AI 部长
07-23 Gemma 4 下载量突破 3 亿次

财报亮点: Alphabet Q2 营收同比增长 24%,Google Cloud 增长 82%;Gemini 月活达 9.5 亿,API 处理 22B tokens/分钟;Gemini Enterprise 被 90% 财富 100 强采用。


技术社区热点

来源 内容
Kimi K3 架构分析 HN 291 分,详细解析 Kimi K3 架构设计
Kimi Linear Attention 论文 HN 269 分,提出高效注意力架构
用 Claude 发现密码学弱点 HN 170 分,Anthropic 官方研究

Benchmark

行业格局

本期变动:

模型 变化
claude-opus-5-max 新上榜,第 5 名,得分 1494.6
claude-opus-5-high 新上榜,第 7 名,得分 1493.4
kimi-k3-max 新上榜,第 11 名,得分 1485.8
glm-5.2-max 新上榜,第 31 名,得分 1469.4
hy3 新上榜,第 46 名,得分 1457.5

当前 Top 3 (LMArena overall):

  1. claude-fable-5 — 1507.6
  2. claude-opus-4-6-thinking — 1504.9
  3. claude-opus-4-7-thinking — 1502.2

干活选型

本期变动:

模型 变化
Claude 4.5 Opus medium → 第 1 名 (原第 2) SWE-bench Verified
Claude 4.5 Opus → 第 2 名 (原第 1) SWE-bench Verified
Claude Opus 4.7 → 第 2 名 (原第 3) Terminal-Bench 2.0
Gemini 3.1 Pro → 第 3 名 (原第 2) Terminal-Bench 2.0

当前 Top 3:

基准 模型 分数
Agentic (AA) Claude Opus 5 (Xhigh) 54.5
Coding (AA) Claude Opus 5 (Xhigh) 77.0
SWE-bench Pro Muse Spark 1.1 61.5
SWE-bench Verified Claude 4.5 Opus medium 79.2
Terminal-Bench 2.0 GPT-5.5 (NexAU-AHE) 84.7

数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena


点评

OpenAI 与 Anthropic 同日签署"Pacing the Frontier"请愿书,标志着前沿实验室对"递归自我改进"风险形成共识——Anthropic 上月发表的递归自我改进研究为此提供了实证依据。Claude Opus 5 直接登陆 LMArena 第 5 名,且在 OSWorld v2 上从 55.7% 跃升至 70.6%,显示其在智能体任务上的显著进步。OpenAI 开源 Codex Security CLI 意味着将安全能力从产品层下放至开发者工具层,可能加速"安全即代码"范式在 AI 开发流程中的普及。

来源 · 91 条