OpenAI 的“AI 年代成绩单”:不再只看 token,开始看每一美元买到多少工作
OpenAI 提出以“每一美元带来多少有用智能”为衡量框架,建议企业从完成的工作和结果可靠性出发评估 AI 价值,而不是单看 token 成本。文章将该理念与 GPT-5.6 和 ChatGPT Work 的产品推进联系起来,强调把 AI 从“能用”推进到“值回成本”的管理逻辑。
OpenAI 提出以“每一美元带来多少有用智能”为衡量框架,建议企业从完成的工作和结果可靠性出发评估 AI 价值,而不是单看 token 成本。文章将该理念与 GPT-5.6 和 ChatGPT Work 的产品推进联系起来,强调把 AI 从“能用”推进到“值回成本”的管理逻辑。
OpenAI 周四发表了一篇题为 “A scorecard for the AI age” 的文章,试图把企业衡量人工智能价值的方式,从“买了多少席位、用了多少 token”推向一个更直接的问题:AI 到底帮人完成了多少真正有用的工作。
这篇文章由 OpenAI 首席财务官 Sarah Friar 撰写。她写道,CFO 们最常问的问题其实很简单:怎么从 AI 支出里拿到更多价值。OpenAI 给出的答案不是更低的 token 单价,而是一套新的衡量框架——“Useful Intelligence per Dollar”,即“每一美元带来多少有用智能”。
先看“工作结果”,再看模型价格
OpenAI 认为,企业评估 AI 不能只看成本 per token。一个便宜模型,可能因为需要更多重试、更多人工复核、更多返工,最后反而更贵;一个更强的模型,虽然单次调用价格更高,却可能一次就完成任务,整体成本反而更低。
在这篇文章里,OpenAI 把新的“成绩单”拆成四个问题:
- AI 是否完成了真正重要的工作?
- 每一项成功任务的真实成本是多少?
- 人们是否可以依赖结果?
- 随着使用规模扩大,每一美元是否能换来更多价值?
OpenAI 说,判断 AI 价值的起点应该是具体工作流:客服是否更快关闭工单,工程团队是否更快交付通过测试的代码,法务是否按时准确完成合同审核,财务是否更快做完月末分析。
这一套表述并不新鲜,但它把 OpenAI 近几周的产品动作串成了同一条线。OpenAI 发布 GPT-5.6:更强性能、更低成本,安全与监管同步推进 已经把“更少 token 完成更多工作”写进了模型发布逻辑,而 OpenAI 发布 ChatGPT Work,把 ChatGPT 推向“做完工作”的阶段 则把这种逻辑直接放进了工作流产品。
代理式工作流,正在把 AI 变成“预算问题”
OpenAI 的这篇文章并不只是在谈技术,它其实是在重写一套企业管理语言。文章强调,AI 的价值应该以“完成了多少工作”为中心,而不是以“买了多少算力”或“部署了多少模型”为中心。
OpenAI 还把“依赖性”抬到了和“能力”同样重要的位置。它建议企业追踪三类结果:
- ready to use:结果可直接使用;
- needs correction:结果需要人工修改;
- needs escalation:结果需要人接手完成。
这意味着,AI 的评估不再只是实验室分数,而是进入了组织内部的流程管理:哪些任务可以自动做,哪些必须复核,哪些动作需要审批,哪些数据可以被模型访问。
对 OpenAI 来说,这也解释了为什么它近来一边推 GPT-5.6,一边推 ChatGPT Work。OpenAI 在 GPT-5.6 官方说明 中称,新模型在编码、知识工作、网络安全和科学任务上更高效;而 ChatGPT Work 官方页面 则把重点放在跨应用、跨文件、跨浏览器的长链路任务上。
Reuters 在 7 月 9 日的报道 中写道,ChatGPT Work 是 OpenAI 对 Anthropic Claude Cowork 的直接回应,目标用户是想把 AI 编码能力带进办公流程、但又不想面对高门槛的白领用户。Reuters 还指出,GPT-5.6 的发布曾因美国政府出于国家安全担忧而推迟,随后才获得更广泛放行。另一篇 Reuters 报道 也提到,这一轮发布带着明显的监管背景。
OpenAI 为什么此时强调“每美元产出”
OpenAI 之所以把话题从 token 价格拉到“工作产出”,与它自身的增长和成本压力密切相关。
Reuters 今年 1 月报道,OpenAI 首席财务官 Sarah Friar 曾表示,公司年化收入已超过 200 亿美元,而且增长与计算能力扩张紧密相关。Reuters 2 月又报道,OpenAI 正在设定到 2030 年约 6000 亿美元的计算支出目标,显示这家公司仍在沿着高投入、高增长的路线前进。
换句话说,当一家 AI 公司自身已经把算力、模型和企业工作流都压到了同一张账本上时,它自然会更强调:谁能把 AI 从“能用”推进到“值回成本”,谁就更接近下一阶段的竞争门槛。
这也是为什么 OpenAI 在文章里不断重复“work accomplished”而不是“model usage”。在它的逻辑里,AI 真正该被比较的,不是一次调用有多便宜,而是完成一项任务到底花了多少钱、用了多少人工、出了多少次错、最后能否稳定复用。
从“会说话”到“会交付”
OpenAI 的表述也反映了行业竞争的变化。过去两年,企业客户习惯先问模型能不能回答问题;现在,问题逐渐变成它能不能跨系统执行任务、能不能持续推进项目、能不能在有人监管的前提下把结果做出来。
AI Flux 此前在 OpenAI 如何管理 AI 投资进入代理时代 中已梳理过 OpenAI 对企业 AI 预算和治理的看法:先把可见性和控制边界建起来,再谈扩大代理式工作流。此次“scorecard”更像是把这一思路再往前推进一步。
OpenAI 的文章没有承诺 AI 会自动变得更便宜,也没有声称企业一定会马上节省预算。它给出的只是一个判断框架:如果 AI 真要成为基础设施,就必须让企业能够回答一个最朴素的问题——每一美元到底买到了多少真正有用的工作。
而这,可能才是 AI 时代更难的一道题。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

