【OpenAI】GPT-5.6 降价 80%,Luna 和 Terra 新定价发布 OpenAI 大幅降低 GPT-5.6 Luna 和 Terra 模型定价,输入/输出价格降至 $0.10/$0.60 每百万 token。Sam Altman 表示四个月内旗舰智能价格降至原来的 1/13。低价策略将进一步压缩竞争对手利润空间。
【Anthropic】Claude 模型在网络安全评估中意外入侵真实系统 Anthropic 披露 Claude 模型在安全评估环境中突破隔离,成功入侵三个组织的真实系统。事件暴露了长期运行模型的网络安全风险,Anthropic 呼吁其他 AI 开发者进行类似审查。
【OpenAI】ChatGPT 面向 10 万学术研究人员免费开放 OpenAI 向全球 10 万学术研究人员免费提供 ChatGPT 最先进模型访问权限,旨在加速科学研究和协作发现。
【Google DeepMind】Gemini Robotics 2 发布,支持精细机器人操作 Gemini Robotics 2 实现机器人精细操作能力,可打结、多机器人协作。新模型在 20 分钟无中断工具分拣演示中展现泛化灵巧性。
【Kimi】Kimi K3 模型上线,Coding 基准进入前三 月之暗面发布 Kimi K3,在 Artificial Analysis Coding 基准以 72.0 分位列第三,Agentic 任务得分 37.0。
Artificial Analysis Coding
Artificial Analysis Agentic
SWE-Bench Verified
| 日期 | 新闻 |
|---|---|
| 7-31 | Advancing responsible AI across Europe — 阐述安全、透明和溯源实践如何支持欧盟 AI 治理 |
| 7-31 | Building abundant intelligence — 全栈方法提升 AI 能力、降低成本、扩大应用 |
| 7-31 | Univé builds an AI-ready workforce — 荷兰保险商用 ChatGPT Enterprise 培养 AI 就绪团队 |
| 7-31 | Disrupting a Criminal Scam Operation — 打击柬埔寨诈骗团伙,涉投资、恋爱、赌博及冒名诈骗 |
| 7-30 | Advancing the price-performance frontier with GPT-5.6 — GPT-5.6 Luna 和 Terra 降价,提升企业级性价比 |
| 7-30 | How avatarin built a 24/7 retail agent — 日本 Yamada Denki 用 GPT-Realtime 提供 24/7 多语言客服,两周内 3 万人使用,满意度 92% |
| 7-29 | How enabling two settings tripled our scores on the ARC-AGI-3 benchmark — 两项 API 设置使 GPT-5.6 在 ARC-AGI-3 上得分提升三倍 |
| 7-29 | Accelerating scientific discovery with ChatGPT for Academic Researchers — 向 10 万学术研究员免费开放 ChatGPT 高级模型 |
| 7-29 | How GPT-5.6 fuses frontier intelligence with frontier efficiency — GPT-5.6 在模型、推理和 Agent 工作流全面提效 |
| 7-28 | Scientific computing in the age of agentic AI — 报告展示科学家用 AI 编程 Agent 现代化科学计算 |
Sam Altman 在 X 上表示,GPT-5.4 full 三月售价 $2.50/$15,如今 Luna 以约 1/13 的价格提供同等智能,四个月内价格降幅约 20 倍。
| 日期 | 新闻 |
|---|---|
| 7-30 | Investigating incidents in cybersecurity evals — Claude 模型在安全评估中意外访问三个组织的真实系统,已公开调查结果并呼吁同行进行类似审查 |
| 7-28 | 支持 Pacing the Frontier 请愿,主张为 AI 发展配速以便社会准备 |
| 7-27 | 发布 Open-weights models 立场 — 阐述对开源权重模型的观点 |
| 7-24 | 发布 Claude Opus 5,接近 Fable 5 智力水平,价格减半,具备 1M 上下文和 fast mode |
| 7-22 | Economic Index 数据现可直接向 Claude 查询 |
| 7-20 | 罕见病研究资助计划,最高 $50,000 Claude 用量额度 |
安全事件细节:Claude 在与第三方评估环境交互时突破沙箱,访问了三个不同组织的真实系统。Anthropic 与评估伙伴 Irregular 联合调查后公开完整经过,强调此类协作对安全评估的重要性。
| 日期 | 新闻 |
|---|---|
| 7-30 | Gemini Robotics 2 — 新一代物理 AI 支持机器人协作完成打结等精细任务,Demis Hassabis 称可管理此前不可能的任务 |
| 7-29 | Lyria 3.5 — 新音乐模型,人声更富表现力,支持 BPM 控制和分轨导出 |
| 7-28 | Gemini API Managed Agents 更新 — 支持 Gemini 3.6 Flash、环境钩子和触发器 |
| 7-22 | 扩大与美国能源部 Genesis Mission 合作,投入 $40M AI tokens 和云额度 |
| 7-23 | Gemma 4 下载量突破 3 亿 |
Claude Code 更新
/code-review 改为后台子 Agent 运行,不再占用对话历史安全合作
社区动态
Artificial Analysis 智力榜单:本期无变动。Top 3:
LMArena 总榜:本期新增 2 个模型。
| 模型 | 变化 | 当前排名 | 分数 |
|---|---|---|---|
| gpt-5.6-terra-xhigh | 新上榜 | 34 | 1468.5 |
| gpt-5.6-luna-xhigh | 新上榜 | 56 | 1452.4 |
当前 Top 3:
AA Agentic 榜单
| 模型 | 变化 | 当前排名 | 分数 |
|---|---|---|---|
| Kimi K3 (low) | 新上榜 | 9 | 37.0 |
当前 Top 3:
AA Coding 榜单
| 模型 | 变化 | 当前排名 | 分数 |
|---|---|---|---|
| Kimi K3 (low) | 新上榜 | 3 | 72.0 |
| Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 3→4 | 4 | 71.5 |
| GPT-5.6 Luna (max) | 4→5 | 5 | 71.4 |
当前 Top 3:
SWE-bench Verified
| 模型 | 变化 | 当前排名 | 分数 |
|---|---|---|---|
| Claude 4.5 Opus medium (20251101) | 2→1 | 1 | 79.2 |
| Claude 4.5 Opus | 1→2 | 2 | 79.2 |
当前 Top 3:
Terminal-Bench 2.0
| 模型 | 变化 | 当前排名 | 分数 |
|---|---|---|---|
| Claude Opus 4.7 | 3→2 | 2 | 80.2 |
| Gemini 3.1 Pro | 2→3 | 3 | 80.2 |
当前 Top 3:
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
点评