← 返回列表
SILASCODING · AI 情报

AI 日报 2026-06-30 00:38

2026-06-30 08:38 CST
快速版 完整版

核心速览

【OpenAI】预览 GPT-5.6 Sol 下一代模型

OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,配备最先进的安全技术栈。这标志着 OpenAI 模型能力的又一次重大跃升,为专业领域应用提供更强支撑。 https://openai.com/index/previewing-gpt-5-6-sol

【OpenAI & Broadcom】推出 LLM 推理专用芯片 Jalapeño

OpenAI 与 Broadcom 联合发布定制 AI 芯片 Jalapeño,专为 LLM 推理优化,提升性能、效率和规模化能力。此举降低对通用 GPU 的依赖,增强 OpenAI 在基础设施层面的自主权。 https://openai.com/index/openai-broadcom-jalapeno-inference-chip

【Anthropic】恢复 Claude Mythos 5 对关键基础设施组织的访问

美国政府解除限制,允许 Claude Mythos 5(Anthropic 最强网络安全模型)重新部署给运营和防御关键基础设施的美国组织。Fable 5 的通用访问仍在协调中。这显示 AI 安全与国家安全之间的平衡正在调整。 https://x.com/AnthropicAI/status/2070665903440871779

【OpenAI】发布 Daybreak 安全工具套件

OpenAI 推出 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞。同时启动 Patch the Planet 计划,支持开源维护者用 AI 修复漏洞。这是 AI 驱动安全领域的重要进展。 https://openai.com/index/daybreak-securing-the-world

【xAI】Grok TTS 在语音人性化测试中领先

xAI 的 Grok TTS 在 Vapi 的 Humanness Index 盲测中获得 96 分,仅比真人语音低 4 分,位居所有模型之首。这表明 xAI 在语音合成领域达到业界领先水平。 https://x.com/xai/status/2067654108123910495


重大 Benchmark 变化

SWE-bench Verified

  • EntroPO + R2E + Qwen3-Coder-30B-A3B-Instruct:排名从 103 升至 76,分数从 52.2 提升至 60.4(+15.7%),显著进步
  • Warp:排名从 11 跌至 36,分数从 75.6 降至 71.0(-6.1%)
  • devlo:排名从 44 跌至 83,分数从 70.2 降至 58.2(-17.1%),大幅下滑
  • Nemotron-CORTEXA:排名从 50 跌至 82,分数从 68.2 降至 58.2(-14.7%)

Terminal Bench 2.0

  • LemonHarness / Multiple:排名从 8 升至第 2,分数从 79.9 提升至 84.5(+5.8%),跻身前三
  • Warp / Multiple:排名从 41 跌至 65,分数从 61.2 降至 50.1(-18.1%),大幅下滑

快速预览

  • OpenAI 预览 GPT-5.6 Sol 下一代模型,强化编程、科学和网络安全能力
  • Anthropic 恢复 Claude Mythos 5 对美国关键基础设施组织的访问权限
  • xAI Grok TTS 在 Vapi 人性化指数盲测中获 96 分,接近真人语音水平
  • SWE-Bench Pro: GPT-5.4 (xHigh) 以 59.1 分领跑,Muse Spark 55.0 分紧随其后
  • Terminal Bench 2: LemonHarness 从第 8 名跃升至第 2 名,分数从 79.9 升至 84.5

新闻动态

OpenAI

日期 新闻
06-29 Mapping Europe's AI Workforce Opportunity — 新报告描绘 AI 如何重塑欧盟就业,分析哪些职业面临自动化、增长或工作流变革
06-28 HP Inc. launches Frontier strategic partnership with OpenAI — HP 扩大 Frontier 合作,在客户体验、软件开发和企业运营中部署 AI
06-26 Previewing GPT-5.6 Sol — 预览下一代模型,编程、科学和网络安全能力更强,配备最先进安全栈
06-25 How agents are transforming work — 研究论文展示 AI Agent 如何变革工作,支持更长更复杂任务
06-24 OpenAI and Broadcom unveil LLM-optimized inference chip — 发布 Jalapeño 定制 AI 芯片,专为 LLM 推理优化
06-23 Helping build shared standards for advanced AI — 通过 Appia Foundation 支持评估框架、安全实践和全球合作
06-23 GPT-5 helped immunologist solve a 3-year-old mystery — GPT-5 Pro 助力解开 T 细胞行为谜题,或支持癌症和自身免疫研究
06-22 Daybreak: Tools for securing every organization — 推出 Codex Security 和 GPT-5.5-Cyber 等安全工具
06-22 Patch the Planet — 帮助开源维护者用 AI 发现、验证和修复漏洞
06-21 Samsung Electronics brings ChatGPT and Codex to employees — 三星全球部署 ChatGPT Enterprise 和 Codex,为最大规模企业部署之一
06-18 New usage analytics and spend controls for enterprises — ChatGPT Enterprise 新增支出控制和使用分析
06-18 Improving health intelligence in ChatGPT — GPT-5.5 Instant 改善健康和保健回复质量
06-18 Using AI to help diagnose rare genetic diseases — 推理模型帮助诊断罕见病,在未解病例中识别出 18 个新诊断
06-17 AI chemist improves medicinal chemistry reaction — 近自主 AI 化学家改进药物合成关键反应
06-17 Introducing LifeSciBench — 发布专家编写和评审的生命科学基准测试

Codex 更新

社区动态 (来源: @thsottiaux, @gdb)

  • 06-29: Codex 团队修复使用量消耗过快问题,重置限制并补偿额外重置次数;新增可继承权限配置文件系统
  • 06-29: 预告 7 月 15 日 Codex 快捷键升级

Anthropic

日期 新闻
06-29 Claude Code v2.1.196 — 支持组织默认模型设置
06-27 Mythos 5 恢复访问 — 恢复对美国关键基础设施组织的 Mythos 5 访问,继续推动 Fable 5 全面开放
06-26 Claude Code v2.1.195 — 新增 CLAUDE_CODE_DISABLE_MOUSE_CLICKS 设置
06-25 加入 RAISE US — 作为创始合作伙伴加入,推动美国劳动力 AI 转型
06-25 Claude Code v2.1.193 — 新增 autoMode.classifyAllShell 设置
06-24 Claude Code v2.1.191/rewind 支持从 /clear 之前恢复对话
06-23 Claude Tag — 新功能让 Claude 作为团队成员加入 Slack 频道

社区动态 (来源: @bcherny, @mikeyk)

  • 06-29: Claude 在 Microsoft Foundry 正式发布,Azure 客户可用 Claude Opus 4.8 和 Haiku 4.5
  • 06-29: 下版 Claude Code 将默认后台运行子代理
  • 06-18: Claude Code 新增 Artifacts 功能,可生成交互式页面

Google

日期 新闻
06-29 Ask an AI expert: What exactly is the full stack? — 解析全栈 AI 基础设施
06-25 Google Finance upgrades — 包括新应用
06-25 Gemma 4 达成 2 亿下载 — 仅用 2.5 个月,Gemma 3 发布时全系列下载量为 1 亿
06-17 AMIE medical AI research in Nature — 对话式 AI 系统在复杂疾病管理中匹配初级保健医生水平

社区动态 (来源: @OfficialLoganK, @demishassabis)

  • 06-25: Gemma 4 发布,面向设备端智能
  • 06-23: Project Genie 获戛纳国际创意节 AI Craft 大奖
  • 06-22: Google DeepMind 与 A24 建立研究合作伙伴关系

xAI

日期 新闻
06-29 Grok 语音 API 登陆 Vercel AI Gateway — 支持 grok-voice-think-fast-1.0、grok-tts、grok-stt
06-25 SuperGrok 和 X 订阅可在 T3code 中使用
06-24 MongoDB 官方插件登陆 Grok Build — 查询数据、优化索引、管理数据库
06-23 Firecrawl 插件登陆 Grok Build — 搜索网页、抓取、与页面交互
06-22 Grok 连接 Interactive Brokers — 获取投资组合高质量实时信息
06-22 Grok Build 新增 /goal 命令 — 自主执行长时间任务,多轮子代理实现和验证
06-18 Grok TTS 人性化指数 96 分 — Vapi 盲测中接近真人语音(100 分)
06-18 Grok 模型登陆 Databricks Agent Bricks
06-18 Grok Word 插件上线 — 起草文档、总结研究、生成图表
06-17 DigitalOcean 一键部署 Grok Build 预装 VM
06-16 Grok PowerPoint 插件上线 — 从提示词生成 PPT

Benchmark 快照

SWE-Bench Verified (Top 10)

排名 模型 分数
1 live-SWE-agent + Claude 4.5 Opus medium 79.2
2 Sonar Foundation Agent + Claude 4.5 Opus 79.2
3 TRAE + Doubao-Seed-Code 78.8
4 live-SWE-agent + Gemini 3 Pro Preview 77.4
5 Atlassian Rovo Dev 76.8
6 EPAM AI/Run Developer Agent + Claude 4 Sonnet 76.8
7 mini-SWE-agent + Claude 4.5 Opus (high) 76.8
8 ACoder 76.4
9 mini-SWE-agent + Gemini 3 Flash (high) 75.8
10 mini-SWE-agent + MiniMax M2.5 (high) 75.8

来源: GitHub 等 | 采集时间: 2025-12-15 等

本期变动:

模型 变化
EntroPO + R2E + Qwen3-Coder-30B-A3B 排名 103→76,分数 52.2→60.4 ↑
Warp 排名 11→36,分数 75.6→71.0 ↓
devlo 排名 44→83,分数 70.2→58.2 ↓
Nemotron-CORTEXA 排名 50→82,分数 68.2→58.2 ↓
EPAM AI/Run + GPT4o 排名 156→162,分数 27.0→24.0 ↓

SWE-Bench Pro Public (Top 10)

排名 模型 分数
1 gpt-5.4 (xHigh)* 59.1
2 Muse Spark* 55.0
3 claude-opus-4-6 (thinking)* 51.9
4 gemini-3.1-pro (thinking)* 46.1
5 claude-opus-4-5-20251101 45.89
6 claude-4-5-Sonnet 43.6
7 gemini-3-pro-preview 43.3
8 claude-4-Sonnet 42.7
9 gpt-5-2025-08-07 (High) 41.78
10 gpt-5.2-codex 41.04

来源: Scale Labs | 采集时间: 2026-06-30

本期无变动

Terminal Bench 2.0 (Top 10)

排名 模型 分数
1 NexAU-AHE / GPT-5.5 84.7
2 LemonHarness / Multiple 84.5
3 Capy / GPT-5.5 83.1
4 Codex CLI / GPT-5.5 82.2
5 Polaris / Multiple 82.2
6 WOZCODE / Claude Opus 4.7 80.2
7 TongAgents / Gemini 3.1 Pro 80.2
8 LemonHarness / Multiple 79.9
9 SageAgent / GPT-5.3-Codex 78.4
10 Droid / GPT-5.3-Codex 77.3

来源: tbench.ai | 采集时间: 2026-05-14 等

本期变动:

模型 变化
LemonHarness / Multiple 排名 8→2,分数 79.9→84.5 ↑↑
Gemini CLI / Gemini 3.1 Pro 排名 45→40,分数 59.4→61.4 ↑
Warp / Multiple 排名 41→47,分数 61.2→59.1 ↓
little-coder / Qwen3.6-35B-A3B 排名 121→116,分数 23.0→24.6 ↑

LMArena Overall (Top 10)

排名 模型 Elo 分数
1 claude-fable-5 1508.16
2 claude-opus-4-6-thinking 1503.09
3 claude-opus-4-7-thinking 1502.31
4 claude-opus-4-6 1499.07
5 claude-opus-4-7 1493.80
6 muse-spark 1487.27
7 gemini-3.1-pro-preview 1486.09
8 gemini-3-pro 1485.79
9 claude-opus-4-8-thinking 1483.71
10 gpt-5.5-high 1481.25

来源: HuggingFace | 采集时间: 2026-06-25

本期无变动

来源 · 61 条