【OpenAI】预览 GPT-5.6 Sol 下一代模型
OpenAI 发布 GPT-5.6 Sol 预览版,在编程、科学和网络安全领域展现更强能力,配备最先进的安全技术栈。这标志着 OpenAI 模型能力的又一次重大跃升,为专业领域应用提供更强支撑。 https://openai.com/index/previewing-gpt-5-6-sol
【OpenAI & Broadcom】推出 LLM 推理专用芯片 Jalapeño
OpenAI 与 Broadcom 联合发布定制 AI 芯片 Jalapeño,专为 LLM 推理优化,提升性能、效率和规模化能力。此举降低对通用 GPU 的依赖,增强 OpenAI 在基础设施层面的自主权。 https://openai.com/index/openai-broadcom-jalapeno-inference-chip
【Anthropic】恢复 Claude Mythos 5 对关键基础设施组织的访问
美国政府解除限制,允许 Claude Mythos 5(Anthropic 最强网络安全模型)重新部署给运营和防御关键基础设施的美国组织。Fable 5 的通用访问仍在协调中。这显示 AI 安全与国家安全之间的平衡正在调整。 https://x.com/AnthropicAI/status/2070665903440871779
【OpenAI】发布 Daybreak 安全工具套件
OpenAI 推出 Daybreak 工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助组织大规模发现、验证和修补漏洞。同时启动 Patch the Planet 计划,支持开源维护者用 AI 修复漏洞。这是 AI 驱动安全领域的重要进展。 https://openai.com/index/daybreak-securing-the-world
【xAI】Grok TTS 在语音人性化测试中领先
xAI 的 Grok TTS 在 Vapi 的 Humanness Index 盲测中获得 96 分,仅比真人语音低 4 分,位居所有模型之首。这表明 xAI 在语音合成领域达到业界领先水平。 https://x.com/xai/status/2067654108123910495
SWE-bench Verified
Terminal Bench 2.0
Codex 更新
社区动态 (来源: @thsottiaux, @gdb)
| 日期 | 新闻 |
|---|---|
| 06-29 | Claude Code v2.1.196 — 支持组织默认模型设置 |
| 06-27 | Mythos 5 恢复访问 — 恢复对美国关键基础设施组织的 Mythos 5 访问,继续推动 Fable 5 全面开放 |
| 06-26 | Claude Code v2.1.195 — 新增 CLAUDE_CODE_DISABLE_MOUSE_CLICKS 设置 |
| 06-25 | 加入 RAISE US — 作为创始合作伙伴加入,推动美国劳动力 AI 转型 |
| 06-25 | Claude Code v2.1.193 — 新增 autoMode.classifyAllShell 设置 |
| 06-24 | Claude Code v2.1.191 — /rewind 支持从 /clear 之前恢复对话 |
| 06-23 | Claude Tag — 新功能让 Claude 作为团队成员加入 Slack 频道 |
| 日期 | 新闻 |
|---|---|
| 06-29 | Ask an AI expert: What exactly is the full stack? — 解析全栈 AI 基础设施 |
| 06-25 | Google Finance upgrades — 包括新应用 |
| 06-25 | Gemma 4 达成 2 亿下载 — 仅用 2.5 个月,Gemma 3 发布时全系列下载量为 1 亿 |
| 06-17 | AMIE medical AI research in Nature — 对话式 AI 系统在复杂疾病管理中匹配初级保健医生水平 |
社区动态 (来源: @OfficialLoganK, @demishassabis)
| 日期 | 新闻 |
|---|---|
| 06-29 | Grok 语音 API 登陆 Vercel AI Gateway — 支持 grok-voice-think-fast-1.0、grok-tts、grok-stt |
| 06-25 | SuperGrok 和 X 订阅可在 T3code 中使用 |
| 06-24 | MongoDB 官方插件登陆 Grok Build — 查询数据、优化索引、管理数据库 |
| 06-23 | Firecrawl 插件登陆 Grok Build — 搜索网页、抓取、与页面交互 |
| 06-22 | Grok 连接 Interactive Brokers — 获取投资组合高质量实时信息 |
| 06-22 | Grok Build 新增 /goal 命令 — 自主执行长时间任务,多轮子代理实现和验证 |
| 06-18 | Grok TTS 人性化指数 96 分 — Vapi 盲测中接近真人语音(100 分) |
| 06-18 | Grok 模型登陆 Databricks Agent Bricks |
| 06-18 | Grok Word 插件上线 — 起草文档、总结研究、生成图表 |
| 06-17 | DigitalOcean 一键部署 Grok Build 预装 VM |
| 06-16 | Grok PowerPoint 插件上线 — 从提示词生成 PPT |
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
| 4 | live-SWE-agent + Gemini 3 Pro Preview | 77.4 |
| 5 | Atlassian Rovo Dev | 76.8 |
| 6 | EPAM AI/Run Developer Agent + Claude 4 Sonnet | 76.8 |
| 7 | mini-SWE-agent + Claude 4.5 Opus (high) | 76.8 |
| 8 | ACoder | 76.4 |
| 9 | mini-SWE-agent + Gemini 3 Flash (high) | 75.8 |
| 10 | mini-SWE-agent + MiniMax M2.5 (high) | 75.8 |
来源: GitHub 等 | 采集时间: 2025-12-15 等
本期变动:
| 模型 | 变化 |
|---|---|
| EntroPO + R2E + Qwen3-Coder-30B-A3B | 排名 103→76,分数 52.2→60.4 ↑ |
| Warp | 排名 11→36,分数 75.6→71.0 ↓ |
| devlo | 排名 44→83,分数 70.2→58.2 ↓ |
| Nemotron-CORTEXA | 排名 50→82,分数 68.2→58.2 ↓ |
| EPAM AI/Run + GPT4o | 排名 156→162,分数 27.0→24.0 ↓ |
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
| 4 | gemini-3.1-pro (thinking)* | 46.1 |
| 5 | claude-opus-4-5-20251101 | 45.89 |
| 6 | claude-4-5-Sonnet | 43.6 |
| 7 | gemini-3-pro-preview | 43.3 |
| 8 | claude-4-Sonnet | 42.7 |
| 9 | gpt-5-2025-08-07 (High) | 41.78 |
| 10 | gpt-5.2-codex | 41.04 |
来源: Scale Labs | 采集时间: 2026-06-30
本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | NexAU-AHE / GPT-5.5 | 84.7 |
| 2 | LemonHarness / Multiple | 84.5 |
| 3 | Capy / GPT-5.5 | 83.1 |
| 4 | Codex CLI / GPT-5.5 | 82.2 |
| 5 | Polaris / Multiple | 82.2 |
| 6 | WOZCODE / Claude Opus 4.7 | 80.2 |
| 7 | TongAgents / Gemini 3.1 Pro | 80.2 |
| 8 | LemonHarness / Multiple | 79.9 |
| 9 | SageAgent / GPT-5.3-Codex | 78.4 |
| 10 | Droid / GPT-5.3-Codex | 77.3 |
来源: tbench.ai | 采集时间: 2026-05-14 等
本期变动:
| 模型 | 变化 |
|---|---|
| LemonHarness / Multiple | 排名 8→2,分数 79.9→84.5 ↑↑ |
| Gemini CLI / Gemini 3.1 Pro | 排名 45→40,分数 59.4→61.4 ↑ |
| Warp / Multiple | 排名 41→47,分数 61.2→59.1 ↓ |
| little-coder / Qwen3.6-35B-A3B | 排名 121→116,分数 23.0→24.6 ↑ |
| 排名 | 模型 | Elo 分数 |
|---|---|---|
| 1 | claude-fable-5 | 1508.16 |
| 2 | claude-opus-4-6-thinking | 1503.09 |
| 3 | claude-opus-4-7-thinking | 1502.31 |
| 4 | claude-opus-4-6 | 1499.07 |
| 5 | claude-opus-4-7 | 1493.80 |
| 6 | muse-spark | 1487.27 |
| 7 | gemini-3.1-pro-preview | 1486.09 |
| 8 | gemini-3-pro | 1485.79 |
| 9 | claude-opus-4-8-thinking | 1483.71 |
| 10 | gpt-5.5-high | 1481.25 |
来源: HuggingFace | 采集时间: 2026-06-25
本期无变动