【OpenAI】ChatGPT 引入"梦境"记忆系统 ChatGPT 推出新的记忆机制,能更好地记住用户偏好,保持跨对话的上下文新鲜度和相关性。这标志着 AI 助手从单次对话向持续个性化服务演进,可能显著改善长期用户体验。 https://openai.com/index/chatgpt-memory-dreaming
【OpenAI】Codex 登陆 AWS OpenAI 前沿模型和 Codex 正式在 AWS 平台全面可用,企业可通过现有 AWS 环境、权限控制和采购流程使用 OpenAI 服务。这打通了企业级部署的关键通道,降低了从评估到生产的门槛,预计将加速企业 AI 应用落地。 https://openai.com/index/openai-frontier-models-and-codex-are-now-available-on-aws
【Anthropic】Claude Opus 4.8 发布 新版本在 Opus 4.7 基础上提升了判断力、对自身进度的诚实表达能力,以及更长时间独立工作的能力,价格不变。持续迭代显示 Claude 在代理能力上的快速演进。 https://x.com/AnthropicAI/status/2060042792399770030
【Anthropic】提交 IPO 注册草案 Anthropic 已向 SEC 秘密提交 S-1 注册草案,为可能的首次公开募股做准备。这标志着 AI 头部公司从研究驱动向商业化成熟的关键转折,将受到资本市场密切关注。 https://www.anthropic.com/news/confidential-draft-s1-sec
【Anthropic】递归自我改进研究报告 Anthropic 内部数据显示工程师代码产出较 2021-2025 年提升 8 倍,Claude 正在加速 AI 开发本身——这可能是递归自我改进的路径,即 AI 自主构建更强能力的后继者。这一趋势的发展速度超出预期。 https://www.anthropic.com/institute/recursive-self-improvement
SWE-bench Verified
2026-06-04
2026-06-03
2026-06-02
2026-06-01
2026-05-29
2026-05-28
2026-05-27
2026-06-04
2026-06-02
2026-06-01
2026-06-06 至 2026-06-04
fallbackModel 设置,可配置最多 3 个后备模型按顺序尝试requiredMinimumVersion 和 requiredMaximumVersion 托管设置社交媒体动态
2026-06-03
2026-05-28
2026-05-27
2026-05-26
2026-05-25
2026-06-05
2026-06-03
2026-06-01
2026-05-29
2026-05-28
OpenAI 相关人士
Anthropic 相关人士
Google 相关人士
本期排名前三(无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | live-SWE-agent + Claude 4.5 Opus medium (20251101) | 79.2 |
| 2 | Sonar Foundation Agent + Claude 4.5 Opus | 79.2 |
| 3 | TRAE + Doubao-Seed-Code | 78.8 |
本期变化
来源: https://github.com/OpenAutoCoder/live-swe-agent
本期排名前三(无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | gpt-5.4 (xHigh)* | 59.1 |
| 2 | Muse Spark* | 55.0 |
| 3 | claude-opus-4-6 (thinking)* | 51.9 |
本期无变化
来源: https://labs.scale.com/leaderboard/swe_bench_pro_public
本期排名前三(无变动)
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | vix / Claude Opus 4.7 | 90.2 |
| 2 | JJAgent / Multiple | 87.1 |
| 3 | NexAU-AHE / GPT-5.5 | 84.7 |
本期变化
来源: https://www.tbench.ai/leaderboard/terminal-bench/2.0
本期排名前三(无变动)
| 排名 | 模型 | ELO 分数 |
|---|---|---|
| 1 | claude-opus-4-6-thinking | 1502.17 |
| 2 | claude-opus-4-7-thinking | 1499.70 |
| 3 | claude-opus-4-6 | 1498.38 |
本期无变化 - 前十名模型和分数均保持稳定
来源: https://datasets-server.huggingface.co/rows?dataset=lmarena-ai/leaderboard-dataset&config=text_style_control&split=latest
所有新闻来源和 benchmark 来源均正常采集,无失败来源。