SILASCODING · AI 情报

AI News Digest

每日 AI 新闻 + Benchmark 变化,中文精选
RSS 订阅 邮件订阅
数据源 · 15
OpenAI Anthropic Google AI xAI DeepSeek 智谱 GLM Meta AI Mistral AI Cohere SWE-bench Terminal-Bench LM Arena MMLU-Pro HumanEval GPQA

AI 日报 2026-06-30 00:38

查看完整版 →
2026-06-30 08:38 CST

核心速览

【OpenAI】预览 GPT-5.6 Sol 下一代模型

OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,配备最先进的安全技术栈。这标志着 OpenAI 模型能力的又一次重大跃升,为专业领域应用提供更强支撑。 https://openai.com/index/previewing-gpt-5-6-sol

【OpenAI & Broadcom】推出 LLM 推理专用芯片 Jalapeño

OpenAI 与 Broadcom 联合发布定制 AI 芯片 Jalapeño,专为 LLM 推理优化,提升性能、效率和规模化能力。此举降低对通用 GPU 的依赖,增强 OpenAI 在基础设施层面的自主权。 https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【Anthropic】恢复 Claude Mythos 5 对关键基础设施组织的访问

美国政府解除限制,允许 Claude Mythos 5(Anthropic 最强网络安全模型)重新部署给运营和防御关键基础设施的美国组织。Fable 5 的通用访问仍在协调中。这显示 AI 安全与国家安全之间的平衡正在调整。 https://x.com/AnthropicAI/status/2070665903440871779

【OpenAI】发布 Daybreak 安全工具套件

OpenAI 推出 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞。同时启动 Patch the Planet 计划,支持开源维护者用 AI 修复漏洞。这是 AI 驱动安全领域的重要进展。 https://openai.com/index/daybreak-securing-the-world

【xAI】Grok TTS 在语音人性化测试中领先

xAI 的 Grok TTS 在 Vapi 的 Humanness Index 盲测中获得 96 分,仅比真人语音低 4 分,位居所有模型之首。这表明 xAI 在语音合成领域达到业界领先水平。 https://x.com/xai/status/2067654108123910495


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 提升至 60.4(+15.7%),显著进步
  • Warp:排名从 11 跌至 36,分数从 75.6 降至 71.0(-6.1%)
  • devlo:排名从 44 跌至 83,分数从 70.2 降至 58.2(-17.1%),大幅下滑
  • Nemotron-CORTEXA:排名从 50 跌至 82,分数从 68.2 降至 58.2(-14.7%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至第 2,分数从 79.9 提升至 84.5(+5.8%),跻身前三
  • Warp / Multiple:排名从 41 跌至 65,分数从 61.2 降至 50.1(-18.1%),大幅下滑

历史日报

邮件订阅

每天一封邮件,随时可退订