Building Abundant Intelligence:OpenAI 的全栈 AI 宏大叙事

当智能的成本下降,更多工作就变得值得去做;当模型更强,这些工作就能创造更多价值。

2026 年 7 月 31 日,OpenAI 官方发布文章 Building abundant intelligence,系统阐述了其“全栈方法”(full-stack approach)——通过协调基础设施、模型、平台与产品,让先进 AI 变得更强大、更便宜、更有用。这不是一篇简单的产品公告,而是一份关于 AI 经济循环、算力效率与落地路径的深度产业宣言。

事件概述:从“规模”到“丰裕”

OpenAI 在文章开篇就明确了一个核心观点:

AI 基础设施的价值不在于它有多大,而在于它让什么成为可能:让更强的智能以更低的成本,惠及更多人。

这种“丰裕”既是使命(让 AGI 惠及全人类),也是商业引擎。文章引用了一系列近期动作来说明这一循环:

  • 价格大幅下调:GPT‑5.6 Luna 降价 80%(现每百万输入 tokens $0.20,输出 $1.20);GPT‑5.6 Terra 降价 20%($2 / $12)。
  • 新增快速模式:GPT‑5.6 Sol 的 Fast 模式速度提升至标准处理的 2.5 倍,价格仅为 2 倍,智能水平不变。
  • 工程优化成果:GPT‑5.6 Sol 协助优化生产级模型服务软件,端到端服务成本降低 20%;改进投机解码(speculative decoding),token 生成效率提升超过 15%。
  • 系统级改进:在 ARC-AGI-3 基准上,通过改进保留推理(retained reasoning)与上下文管理,GPT‑5.6 Sol 的得分从 13.3% 提升到 38.3%,同时输出 token 减少了 6 倍——模型本身没有变,变的是周围系统。

这些数据共同指向一个结论:OpenAI 正在将竞争重心从“堆算力、堆参数”转向“系统化地榨取每一单位算力的价值”。

关键技术点:全栈协同与效率工程

1. 经济模型:按“成功结果”定价

文章提出了一个很务实的问题:

客户购买 token 不是为了 token 本身,而是为了解决问题、交付软件、完成合同审查或得到科学答案。

因此,正确的衡量指标不是单价,而是“成功结果的总成本”,包括时间、重试、人工监督和纠错成本。一个更贵但一次做对的模型,可能比一个便宜但反复出错的模型更经济。这重新定义了模型选型逻辑:不是“哪个模型适合哪个任务”,而是“这个结果需要多少智能、多快需要、愿意付出什么成本”。

2. 系统效率:让模型周围的一切更聪明

OpenAI 强调,效率不仅仅是模型参数决定的,而是整个系统的协作结果:

  • 更好的路由(routing) 让硬件保持高效生产。
  • 更智能的上下文管理 防止 agent 重复劳动。
  • 更强的工具与产品设计 减少完成任务的步骤数。

上述 ARC-AGI-3 的分数跃升就是系统优化的直接证明:相同的模型,不同的“外部大脑”,结果天差地别。

3. 数据飞轮:规模化的真实反馈

OpenAI 公布了几项关键用户数据:

  • 模型目前触达超过 10 亿活跃用户200 万企业客户
  • 用户注册 6 个月后,日均消息量增加约 50%,ChatGPT 的使用场景类型翻倍。
  • 在 OpenAI 内部,通过 Codex 完成的 agentic 工作已占周输出 token 的 99.8%,财务团队也已将 agentic 工具作为主要工作方式。

这组数据说明:从“问答”到“做事”(asking → doing)的转变已经在真实业务中大规模发生。

对数据科学与 AI Agent 落地的意义

这篇文章虽然由 OpenAI 的 CFO Sarah Friar 署名,本质上是一篇面向投资者、开发者和企业决策者的“价值宣言”。它的意义在于:

  1. AI Agent 的 ROI 模型正在成熟。过去大家关注 token 单价,现在必须关注“完成一个任务的总成本”。这迫使数据科学团队建立包含重试率、人工介入率、时间成本的综合评估框架,而不是简单地拿单价对比模型。

  2. 系统工程的重要性被提到空前高度。同一个模型,通过更好的上下文管理、路由和工具集成,性能可以提升近 3 倍,成本降低数倍。这意味着 Agent 落地不是“选一个最强模型”就完事的事,而是要对整个推理链路做系统调优。

  3. “智能丰裕”将推动工作流重构。当智能足够便宜,原本不值得自动化的小任务(例如临时邮件整理、小型合约审查)也会被纳入自动化范围。这会改变数据科学的日常工作方式——从“写脚本”变成“指挥 agent 写脚本并验证结果”。

  4. 需求侧反馈驱动基础设施决策。OpenAI 明确表示,投入决策基于用户与工作负载增长、企业承诺、API 消耗、利用率、收入以及模型能力进步等证据。这意味着 AI 基础设施的建设将从“押注式”变成“响应式”,对产业生态更加健康。

我的技术点评

这篇文章的翻译腔少,战略意图浓。几个值得深入思考的点:

第一,“未改变模型”的系统性提升是最大的信号。 ARC-AGI-3 从 13.3% 到 38.3% 是在“模型不变”的前提下实现的。这说明当前 AI 能力的瓶颈已经开始从模型本身向外围系统转移。对应用层开发者来说,这是一个利好消息:即使不训练新模型,通过改进 agent 的上下文管理、记忆机制和任务拆解,就能获得巨大的能力提升。这也是为什么“Agent 工程”会逐渐成为一门独立的工程学科。

第二,价格战背后的算力利用率逻辑。 Luna 降价 80%,同时靠工程优化把服务成本降低 20%。这不是简单的补贴换市场,而是通过提高单位算力利用率实现的可持续降价。对下游企业来说,token 价格下降会直接降低 AI 功能嵌入现有产品的边际成本,但也要警惕:低价 token 可能诱使开发者忽略推理设计优化,反而造成更高的总成本。聪明的方法仍然是根据任务复杂度做分级路由。

第三,99.8% 的内部 token 占比需要理性看待。 Codex 占了 OpenAI 每周输出 token 的 99.8%,这个数字非常震撼,但要注意:ChatGPT 用户的输出 token 相对较短,而 agentic 工作往往需要大量中间推理 token(例如规划、工具调用、代码生成)。这个数字更多反映的是“内部工作流已经 agent 化”的事实,而不是“Agent 比聊天更受欢迎”。

第四,文章对“技术细节”故意含糊。 例如“保留推理”“上下文管理”的具体实现方式、“基准分析”的完整条件都没有展开。这符合 OpenAI 一贯的传播策略:展示结果,不展示配方。但作为技术社区,我们应该保持清醒——这些数字可能来自特定评测集和特定运行条件,能否在真实业务中复现,还需要更多独立验证。

第五,关于“丰裕”的宏大叙事背后,是残酷的算力军备竞赛。 文章承认“AI 基础设施必须提前数年规划”,而模型和需求变化快得多。这种时间差必然导致产能波动。所谓“纪律”(discipline)本质上是财务上的风险控制。对于看多 AI 长期价值的人来说,这是合理的长期主义;但对于担心泡沫的人来说,这种“基于证据的投资”恰恰是泡沫的典型特征——直到它不是。作为从业者,我们更应关注自己能否在这个周期中构建出独立于 OpenAI 生态的、真正有壁垒的应用价值。

原文链接


本文基于 OpenAI 官方文章整理与点评,所有数据和表述均以原文为准。原文中未说明的技术实现细节,本文明确标注为“未说明”,不进行臆测。