SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-07-29

查看完整版 →
2026-07-29 08:32 CST

核心速览

【Anthropic】Claude Opus 5 发布,定价为 Fable 5 一半

Anthropic 发布 Claude Opus 5,在多项编码和知识工作评测中达到新 SOTA。Opus 5-max 和 Opus 5-high 分别以 1494.6 和 1493.4 的 ELO 分进入 LMArena 总榜第 5 和第 7 位,接近 Fable 5 的前沿智能水平但价格减半。Opus 5 在 OSWorld v2 评测中从 55.7% 提升至 70.6%,且是 Anthropic 迄今抗提示注入能力最强的模型。

RT Claude: Introducing Claude Opus 5

【OpenAI】联合 Anthropic 支持 AI 发展节奏控制倡议

OpenAI 和 Anthropic 共同支持 pacingthefrontier.com 倡议,呼吁开发工具以有意识地控制前沿 AI 发展速度,让社会有时间准备。Anthropic 表示其上月发表的递归自我改进研究指向了这一需求,并看到业界广泛共识。

OpenAI 官方声明

【OpenAI】Codex Security CLI 开源发布

OpenAI 开源 Codex Security CLI,提供 TypeScript SDK 用于扫描代码库、验证和修复安全漏洞。支持 CI 集成、变更追踪和持续监控,已在 GitHub 发布。

Codex Security CLI 发布

【Google】Gemini API Managed Agents 支持 3.6 Flash

Google 更新 Gemini API Managed Agents,新增模型环境钩子(block、lint 等)、支持 Gemini 3.6 Flash 模型选择,并提供免费层支持。默认 agent 已切换为 3.6 Flash。

Gemini API Managed Agents 更新

【Kimi】Kimi K3 架构解析引发关注

Sebastian Raschka 发布 Kimi K3 架构深度解析,HN 热度 291 点。同期 Kimi K3-max 新进入 LMArena 总榜第 11 位(ELO 1485.8)。

Kimi K3 Architecture Overview


重大 Benchmark 变化

LMArena 新模型上榜:

  • Claude Opus 5-max 新上榜 #5(ELO 1494.6)
  • Claude Opus 5-high 新上榜 #7(ELO 1493.4)
  • Kimi K3-max 新上榜 #11(ELO 1485.8)
  • GLM-5.2-max 新上榜 #31(ELO 1469.4)
  • hy3 新上榜 #46(ELO 1457.5)

排名下降≥5位:

  • Gemini 3.5 Flash Medium:#21 → #28(分数下降 1.4%,ELO 1474.3→1472.2)
  • Inkling:#62 → #69(分数下降 1.4%,ELO 1444.9→1442.9)
  • GLM-5v-turbo:#74 → #83(分数下降 2.1%,ELO 1436.7→1433.7)

历史日报

邮件订阅

每天一封邮件,随时可退订