| 项目 | 要点 |
|---|---|
| 模型定位 | "最智能模型",面向编码、研究、数据分析等复杂任务 |
| System Card | 已发布,含安全评估详情 |
| Bio Bug Bounty | 红队挑战赛,寻找生物安全风险的通用越狱方法,奖金最高 $25,000 |
| 来源 | Introducing GPT-5.5 · System Card · Bio Bug Bounty |
全新图像生成模型,改进文字渲染、多语言支持与高级视觉推理能力。 → 来源
开源权重模型,用于检测和脱敏文本中的 PII(个人身份信息),号称 SOTA 精度。 → 来源
面向生命科学的前沿推理模型,加速药物发现、基因组分析、蛋白质推理等科研流程。 → 来源
Opus 4.7 正式发布,在高级软件工程任务上较 Opus 4.6 有明显提升,尤其在最难任务上表现突出。 → 来源
GPT 模型、Codex、Managed Agents 现可在 AWS 环境中使用,企业可在自有 AWS 基础设施内安全构建 AI。 → 来源
修订协议简化合作关系,增加长期确定性,支持大规模 AI 创新。 → 来源
ChatGPT Enterprise 和 OpenAI API 获 FedRAMP Moderate 授权,美国联邦机构可安全采用。 → 来源
将 issue tracker 转化为始终在线的 agent 系统,减少上下文切换,提升工程产出。 → 来源
Codex 驱动的云端 agent,可自动化复杂工作流、连接工具、安全扩展团队运营。 → 来源
macOS/Windows 版 Codex 新增 computer use、应用内浏览、图像生成、记忆和插件功能。 → 来源
| 日期 | 事项 | 来源 |
|---|---|---|
| 4/28 | 社区安全承诺:模型保障、滥用检测、政策执行、安全专家协作 | 链接 |
| 4/26 | Sam Altman 分享五项指导原则 | 链接 |
| 4/23 | GPT-5.5 Bio Bug Bounty($25K) | 链接 |
| 4/16 | 网络安全防御生态:GPT-5.4-Cyber + $10M API 资助 | 链接 |
| 版本 | 日期 | 关键变更 |
|---|---|---|
| v2.1.123 | 4/29 | 修复 OAuth 401 重试循环(CLAUDE_CODE_DISABLE_EXPERIMENTAL_BETAS=1) |
| v2.1.122 | 4/28 | 新增 ANTHROPIC_BEDROCK_SERVICE_TIER 环境变量(default/flex/priority) |
| v2.1.121 | 4/28 | MCP server 配置新增 alwaysLoad 选项,跳过 tool-search 延迟 |
| v2.1.119 | 4/23 | /config 设置持久化至 ~/.claude/settings.json,参与项目/本地/策略覆盖优先级 |
| v2.1.118 | 4/23 | 新增 vim visual mode (v) 和 visual-line mode (V) |
说明:以下为 Scale Leaderboard 当前快照,非变化对比(本次无变化数据)。带 * 号表示使用了额外推理策略(如 thinking/xHigh)。
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
| 4 | gemini-3.1-pro (thinking)* | 46.1 |
| 5 | claude-opus-4-5-20251101 | 45.89 |
| 6 | claude-4-5-Sonnet | 43.6 |
| 7 | gemini-3-pro-preview | 43.3 |
| 8 | claude-4-Sonnet | 42.7 |
| 9 | gpt-5-2025-08-07 (High) | 41.78 |
| 10 | gpt-5.2-codex | 41.04 |
| 11 | claude-4-5-haiku | 39.45 |
| 12 | qwen3-coder-480b-a35b | 38.7 |
| 13 | minimax-2.1 | 36.81 |
| 14 | gemini-3-flash | 34.63 |
| 15 | gpt-5.2 | 29.94 |
| 16 | kimi-k2-instruct | 27.67 |
| 17 | qwen3-235b-a22b | 21.41 |
| 18 | gpt-oss-120b | 16.2 |
| 19 | deepseek-v3p2 | 15.56 |
| 20 | gemma-3-27b-it | 11.38 |
→ 来源:Scale SWE-bench Pro Public Leaderboard
快照观察: