AI 时代的记分卡:用“有用智能每美元”衡量投资回报

事件概述

2026 年 7 月 17 日,OpenAI CFO Sarah Friar 在官方博客发表文章《A scorecard for the AI age》,提出一套面向 CFO 及企业领导者的 AI 投资回报衡量框架。核心观点是:传统软件的成功指标(席位、活跃用户、续约率)已不适用于 AI 时代,企业需要一种更强大的度量——完成的工作量(work accomplished)。文章名为“AI 时代的记分卡”,旨在通过四个维度回答一个基本经济问题:AI 完成的工作价值是否增长快于其成本?

关键技术点

该框架的核心是 “Useful Intelligence per Dollar”(每美元有用智能),具体分解为四个度量问题:

1. 完成了多少有用工作?

  • 定义:从具体工作流出发,明确“完成”的标准。例如客服团队是“客户问题已解决”,工程团队是“代码变更通过测试”,法务团队是“合同准确及时审查”。
  • 核心思想:token 只有在转化为人们可用的工作时才创造价值。随着模型能力提升(长上下文、多步推理、工具调用),可以承担更复杂的任务。
  • 实践建议:从一个工作流开始,在任务发生的系统中直接度量完成结果。

2. 每项成功任务的实际成本是多少?

  • 计算公式(完成工作的全部成本) / (达到质量标准的任务数)
  • 关键洞察:最低的单 token 价格并不等于最低的每任务成本。一个能力更强的模型可能一次就给出正确结果,减少了重试、人工审核、延迟和总计算量,从而降低全成本。
  • 分层模型策略:OpenAI 近日发布的 GPT‑5.6 系列提供了三个层级:
    • Sol:旗舰模型,适合需要最强推理、一次成功的任务;
    • Terra:平衡性能与成本;
    • Luna:最快、最经济的模型,适用于高吞吐量简单任务。
  • 数据支撑:在 Artificial Analysis Coding Agent Index 上,GPT‑5.6 Sol 以 72.7% 的得分创下新高,同时比另一个领先模型少用 54% 的输出 token,且估计 API 成本低 36.2%。

3. AI 完成任务的可信度(dependability)如何?

  • 三个等级
    • Ready to use:结果直接可用,无需修改;
    • Needs correction:需要重试或人工编辑;
    • Needs escalation:必须由人接手完成。
  • 价值:可信度直接降低审查、纠正、重复工作的成本。组织还应明确数据访问范围、系统可用范围、审批节点等治理边界。
  • 基础:ChatGPT Work 建立在 ChatGPT Enterprise 的安全、隐私、合规和空间管理基础上,使组织可以在给予 AI 更多上下文的同时保持适当监督。

4. 随着使用规模扩大,每 AI 美元能否购买更多工作?

  • 度量方法:长期跟踪同一工作流,观察完成的任务数、总成本和质量趋势。如果完成的工作增长快于总成本且质量不变/提高,则说明每美元产出价值上升。
  • 核心杠杆:计算(compute)是此问题的中心。更好的模型、更高效的推理、专用硬件、更高利用率、更智能的路由、更强的产品设计,都能提升计算本身的回报。

对数据科学和 AI Agent 落地的意义

  • 从指标到决策:过去企业 AI 投资常以“token 成本”、“模型精度”为 KPI,但这些无法直接关联业务价值。该框架提供了 CFO 层面可接受的语言:成本、成功任务数、可信度、规模经济。数据科学家可以用此框架重新设计评估体系,将模型评估与商业 ROI 挂钩。
  • AI Agent 的工程化衡量:Agent 系统(如代码生成代理、客服代理)的落地瓶颈之一就是难以量化。文中“完成的有用工作”“每成功任务成本”“可信度分级”恰好是 Agent 环境下的可观测指标。例如追踪 Agent 一次自主完成 vs 需要人工介入的比例,可作为“Ready to use”的 proxy。
  • 推动模型选择与推理优化:框架强调“全成本视角”而非单纯降低 token 价格,这会倒逼团队在选择模型时做更全面的测算(包括重试率、延迟、人工介入成本),而非盲目追求最低价的 API 或最新的大模型。

我的技术点评

这篇文章的核心价值不在于模型本身,而在于把 AI 投资从“技术采购”提升到“业务经济学”层面。Sarah Friar 作为 CFO 的视角非常务实:她回避了空洞的 AGI 叙事,直接给出 CFO 能立即用来和工程团队对话的工具。

几个值得注意的亮点:

  • “Useful Intelligence per Dollar” 是一个极其简洁的框架,四个问题层层递进,从“有没有用”到“值不值”再到“靠不靠谱”和“能不能持续”,逻辑闭环。
  • 不回避成本复杂性:明确指出最低 token 价格 ≠ 最低总成本,并用 GPT‑5.6 的实测数据佐证。这提醒企业在模型选型时必须做端到端的经济学模拟。
  • 可信度的可操作化:将“dependability”分解为三级结果,比单纯的准确率指标更具业务指导性。数据科学家可以据此设计线上 A/B 实验,观测 Agent 的“ready to use”比例变化。

不过文章对“如何计算有用工作的价值”着墨不多——比如一个解决客户问题的价值如何货币化?这需要企业结合自身财务数据补全。另外,框架里多次提到 ChatGPT Work 和 GPT‑5.6,商业推广的痕迹较明显,但核心方法论本身是通用的。

最后,我特别认同文末的一句话:“Capability earns first use. Dependability makes AI part of how work gets done.” 能力让企业愿意尝试,但只有可靠才能让 AI 真正嵌入日常流程。这是所有 AI Agent 落地团队应该牢牢记住的。

原文链接https://openai.com/index/a-scorecard-for-the-ai-age