【OpenAI】向 SEC 提交机密 S-1 注册声明 OpenAI 已向美国证券交易委员会提交机密 S-1 草案,为可能的 IPO 做准备。SEC 审查完成后将决定进一步行动时间,这标志着 OpenAI 向公开上市迈出关键一步。 https://openai.com/index/openai-submits-confidential-s-1
【OpenAI】Codex 在 AWS 正式可用 OpenAI 前沿模型和 Codex 现已在 AWS 全面上线,企业客户可通过现有 AWS 环境、控制和采购流程使用 OpenAI 服务。这为企业提供新的部署路径,加快从评估到生产的进程。 https://openai.com/index/openai-frontier-models-and-codex-are-now-available-on-aws
【OpenAI】推出经济研究交流平台 OpenAI 启动经济研究交流项目,研究 AI 对就业、生产力和经济的影响。研究项目申请现已开放,旨在通过实证研究理解 AI 技术的经济效应。 https://openai.com/index/economic-research-exchange
【Anthropic】向 SEC 提交机密 S-1 注册声明 Anthropic 已向 SEC 提交机密 S-1 草案,待审查完成后可选择进行 IPO。这表明 Anthropic 正为可能的公开上市做准备,与 OpenAI 动作类似。 https://www.anthropic.com/news/confidential-draft-s1-sec
【Anthropic】扩大 Project Glasswing 访问范围 Anthropic 将 Claude Mythos Preview 访问权限扩展至约 150 个组织,覆盖超过 15 个国家。该计划旨在推动 Claude 在更广泛场景下的应用和测试。 https://www.anthropic.com/news/expanding-project-glasswing
SWE-bench Verified
--safe-mode 故障排查模式IPO 与战略规划(2026-06-08)
产品与技术更新
政策与安全
基础设施与企业案例
IPO 与产品扩展
Claude Code 更新
--safe-mode 标志,可禁用所有自定义项(CLAUDE.md、插件、技能、hook、MCP 服务器)以排查故障 来源fallbackModel 设置,支持配置最多三个后备模型,主模型过载时按顺序尝试 来源研究与安全
模型与社区
| 排名 | 模型 | 分数 | 来源 |
|---|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium (20251101) | 79.2 | OpenAutoCoder |
| 1 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 | Sonar |
| 3 | TRAE + Doubao-Seed-Code | 78.8 | ByteDance |
| 4 | live-SWE-agent + Gemini 3 Pro Preview (2025-11-18) | 77.4 | OpenAutoCoder |
| 5 | Atlassian Rovo Dev (2025-09-02) | 76.8 | Atlassian |
| 5 | EPAM AI/Run Developer Agent v20250719 + Claude 4 Sonnet | 76.8 | EPAM |
| 5 | mini-SWE-agent + Claude 4.5 Opus (high reasoning) | 76.8 | mini-SWE-agent |
| 8 | ACoder | 76.4 | ACoder-AI |
| 9 | mini-SWE-agent + Gemini 3 Flash (high reasoning) | 75.8 | mini-SWE-agent |
| 9 | mini-SWE-agent + MiniMax M2.5 (high reasoning) | 75.8 | mini-SWE-agent |
| 排名 | 模型 | 分数 | 来源 |
|---|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 | Scale Labs |
| 2 | Muse Spark* | 55.0 | Scale Labs |
| 3 | claude-opus-4-6 (thinking)* | 51.9 | Scale Labs |
| 4 | gemini-3.1-pro (thinking)* | 46.1 | Scale Labs |
| 5 | claude-opus-4-5-20251101 | 45.89 | Scale Labs |
| 6 | claude-4-5-Sonnet | 43.6 | Scale Labs |
| 7 | gemini-3-pro-preview | 43.3 | Scale Labs |
| 8 | claude-4-Sonnet | 42.7 | Scale Labs |
| 9 | gpt-5-2025-08-07 (High) | 41.78 | Scale Labs |
| 10 | gpt-5.2-codex | 41.04 | Scale Labs |
| 排名 | 模型 | 分数 | 来源 |
|---|---|---|---|
| 1 | vix / Claude Opus 4.7 | 90.2 | TBench |
| 2 | JJAgent / Multiple | 87.1 | TBench |
| 3 | NexAU-AHE / GPT-5.5 | 84.7 | TBench |
| 4 | LemonHarness / Multiple | 84.5 | TBench |
| 5 | Capy / GPT-5.5 | 83.1 | TBench |
| 6 | Codex CLI / GPT-5.5 | 82.2 | TBench |
| 6 | Polaris / Multiple | 82.2 | TBench |
| 8 | TongAgents / Gemini 3.1 Pro | 80.2 | TBench |
| 8 | WOZCODE / Claude Opus 4.7 | 80.2 | TBench |
| 10 | LemonHarness / Multiple | 79.9 | TBench |
| 排名 | 模型 | Elo 分数 | 来源 |
|---|---|---|---|
| 1 | claude-opus-4-6-thinking | 1502.17 | LMArena |
| 2 | claude-opus-4-7-thinking | 1499.70 | LMArena |
| 3 | claude-opus-4-6 | 1498.38 | LMArena |
| 4 | claude-opus-4-7 | 1493.64 | LMArena |
| 5 | muse-spark | 1488.97 | LMArena |
| 6 | gemini-3.1-pro-preview | 1487.45 | LMArena |
| 7 | gemini-3-pro | 1485.97 | LMArena |
| 8 | gpt-5.5-high | 1482.33 | LMArena |
| 9 | gpt-5.4-high | 1480.43 | LMArena |
| 10 | gemini-3.5-flash | 1479.08 | LMArena |
显著上升
显著下降
显著上升
显著下降
小幅上升
数据来源状态:所有数据来源均成功采集,无失败来源。