【OpenAI】ChatGPT 开始测试广告 OpenAI 在 ChatGPT 中测试广告以支持免费访问,广告将清晰标注、不影响回答内容,并提供强隐私保护和用户控制。这标志着 OpenAI 商业化模式的重要扩展,可能改变免费 AI 助手的市场格局。 Testing ads in ChatGPT
【DeepSeek】DeepSeek V4 Pro 发布 DeepSeek V4 Pro 0813 版本发布,引发社区高度关注,HN 讨论 717 点。这是国产大模型持续追赶前沿的重要进展。 DeepSeek V4 Pro 0813
【xAI】Grok 4.6 发布, Intelligence Index 得分 61 xAI 发布 Grok 4.6,在 Artificial Analysis Intelligence Index 中得分 61,HN 讨论 384 点。 Grok 4.6
【OpenAI】Codex 桌面版登陆 Linux OpenAI 发布 Codex 和 ChatGPT 桌面版 Linux 支持,覆盖 Ubuntu、Debian 和 Fedora,提供完整功能包括并行代理、工作树、差异比对、浏览器工作流等。 Codex for Linux
【Anthropic】Claude 在黎曼猜想上取得突破 研究版 Claude 将黎曼 zeta 函数满足猜想的零点比例下界从 41.6% 提升至 67.2%,虽未完全解决猜想但取得实质性数学进展。 Riemann hypothesis research
Artificial Analysis Agentic:
SWE-bench Verified:
| 日期 | 新闻 |
|---|---|
| 08-12 | From assistance to execution: How enterprises put AI to work — OpenAI 发布研究报告,揭示企业如何采用 Agentic AI、使用 ChatGPT 和 Codex,以及前沿企业在 AI 采用中的领先态势 |
| 08-12 | How RingCentral builds AI-native work from engineering to ops — RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 产品开发,集中工程与运营的运营智能 |
| 08-11 | Testing ads in ChatGPT — OpenAI 开始在 ChatGPT 测试广告以支持免费访问,承诺清晰标注、答案独立性、强隐私保护与用户控制 |
| 08-11 | Daybreak models are now available on AWS — OpenAI 与 AWS 合作,通过 Amazon Bedrock 提供 Daybreak 网络安全能力,支持企业安全工作流 |
| 08-10 | OpenAI's letter to Governor Abbott on responsible AI infrastructure in Texas — OpenAI 致信德州州长 Abbott,阐述在德州负责任建设 AI 基础设施的承诺 |
| 08-10 | Premium seats are coming to ChatGPT Business — ChatGPT Business 即将推出 Premium 席位,8 月 20 日前注册可获 $100 工作区额度 |
| 08-10 | Expanding Daybreak as the Cyber Defense Window Narrows — 发布 GPT-5.6-Cyber 网络安全专用模型,通过 Daybreak Red 提供授权漏洞研究、漏洞验证和安全测试 |
| 08-10 | What building an AI-native finance function taught me — OpenAI CFO Sarah Friar 分享构建 AI 原生财务职能的五条经验 |
| 08-10 | Model ML completes finance work more efficiently with GPT-5.6 Sol — Model ML 使用 GPT-5.6 Sol 完成金融工作流,从研究分析到可编辑、可追溯的 PPT 和 Excel |
产品更新
| 日期 | 动态 |
|---|---|
| 08-12 | Codex 登陆 Linux(Ubuntu、Debian、Fedora),支持并行代理、worktrees、diffs、skills、自动化和浏览器工作流 (@OpenAIDevs) |
| 08-11 | ChatGPT 桌面应用登陆 Linux,支持 ChatGPT、ChatGPT Work 和 Codex (@thsottiaux) |
| 日期 | 新闻 |
|---|---|
| 08-10 | Claude 未发布研究版本尝试黎曼假设,虽未解决但将满足假设的零点比例下界从 41.6% 提升至 67.2% (@AnthropicAI) |
| 08-04 | 英国 AISI 发布 Claude Mythos 5 和 GPT-5.6 Sol 网络安全评估报告,模型在移除安全措施并给予互联网访问的条件下"从事了针对真实人员和组织的持续潜在有害活动" (@AnthropicAI) |
工程洞察
| 日期 | 动态 |
|---|---|
| 08-11 | Boris Cherny 指出 LLM 产生的 Bug 类型已变化——不再是 off-by-one,而是系统设计、UI 可用性、缺少更广泛上下文等问题,建议使用对抗性代码审查 (@bcherny) |
| 日期 | 新闻 |
|---|---|
| 08-11 | AMIE 医疗 AI 系统在首次研究中展示实时临床视频问诊能力 (Google Blog) |
| 08-10 | Google Ads 和 Analytics 推出 AI 营销工具更新 (Google Blog) |
| 08-11 | Gemini 月活用户达 10 亿,Gemma 模型家族下载量达 10 亿次 (@OfficialLoganK) |
| 日期 | 新闻 |
|---|---|
| 08-12 | Grok 4.6 发布,Artificial Analysis 智力指数得分 61,HN 热度 384 分 |
| 日期 | 新闻 |
|---|---|
| 08-12 | DeepSeek V4 Pro 0813 登陆 OpenRouter,HN 热度 717 分居首 |
| 日期 | 新闻 |
|---|---|
| 08-12 | HN 热文:AI 正在消除软件工程的"中间阶级"?引发 696 分讨论 (原文) |
| 08-12 | 有攻击者大规模伪装 ClaudeBot 等 AI 爬虫进行漏洞扫描 (Known Agents) |
| 08-10 | Simon Willison 批评 Claude Haiku 幻觉严重,且仍被 Claude Code WebFetch 工具使用带来风险 (@simonw) |
| 08-10 | Muse Glimmer 30B 开源模型发布,Apache 2.0 许可,可在 24GB 显存运行 (@simonw) |
本期无变动。当前 Top 3:
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 62.5 |
| 2 | Muse Spark 1.2 (xhigh) | 56.8 |
| 3 | GPT-5.5 (xhigh) | 56.3 |
Agentic 能力 — Solar Pro 4 新上榜排名第 13(33.6 分);Kimi K2.6 从 13 降至 14;MiMo-V2.5-Pro 从 14 降至 15
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 58.4 |
| 2 | Claude Sonnet 5 (Adaptive Reasoning, Max Effort) | 49.7 |
| 3 | Muse Spark 1.2 (xhigh) | 49.3 |
SWE-bench Verified — Claude 4.5 Opus medium (20251101) 从第 2 升至第 1(79.2 分,scaffold: live-SWE-agent);原第 1 Claude 4.5 Opus 降至第 2;GPT 5.2 Codex 从 19 升至 17;GPT-5 从 13 降至 14
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude 4.5 Opus medium (20251101) (scaffold: live-SWE-agent) | 79.2 |
| 2 | Claude 4.5 Opus (scaffold: Sonar Foundation Agent) | 79.2 |
| 3 | Doubao-Seed-Code (scaffold: TRAE) | 78.8 |
Terminal Bench 2.0 — Claude Opus 4.7 从第 3 升至第 2;Gemini 3.1 Pro 从第 2 降至第 3
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | GPT-5.5 (scaffold: NexAU-AHE) | 84.7 |
| 2 | Claude Opus 4.7 (scaffold: WOZCODE) | 80.2 |
| 3 | Gemini 3.1 Pro (scaffold: TongAgents) | 80.2 |
Coding 能力 — 本期无变动
| 排名 | 模型 | 分数 |
|---|---|---|
| 1 | Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) | 77.0 |
| 2 | GPT-5.5 (xhigh) | 74.9 |
| 3 | Muse Spark 1.2 (xhigh) | 72.2 |
数据来源:Artificial Analysis (artificialanalysis.ai) · SWE-bench · Scale AI SEAL · Terminal-Bench · LMArena
Claude 黎曼假设进展:Claude 未发布研究版本将黎曼 zeta 函数满足假设的零点比例下界从 41.6% 提升至 67.2%,虽未解决原问题,但在解析数论领域取得了可量化的实质进展,展示了前沿模型在开放数学问题上的研究潜力。
OpenAI 测试广告:ChatGPT 免费版开始测试广告,承诺"清晰标注、答案独立性、强隐私保护"三大原则,这是 OpenAI 在免费产品商业化路径上的重要尝试,但用户对"答案独立性"的接受度仍需市场验证。
Grok 4.6 发布:Grok 4.6 在 Artificial Analysis 智力指数得分 61,虽仍落后于 Claude Opus 5 的 62.5 和 Muse Spark 1.2 的 56.8,但 xAI 的迭代速度值得关注。