产业与商业 · 深度报道

OpenAI试图把AI使用量连接到商业价值:从统计Token转向衡量完成的工作

OpenAI推出将使用数据与业务结果连接的分析功能,建议企业从具体工作流入手衡量AI带来的实际价值,而非单看Token或使用量。该方法强调定义基线、跟踪完成任务与质量、计入审核与重试成本,以便评估AI部署的真实ROI。

AIFluxNews AIFlux 编辑2026 年 9 月 17 日阅读约 5 分钟
OpenAI试图把AI使用量连接到商业价值:从统计Token转向衡量完成的工作

OpenAI推出将使用数据与业务结果连接的分析功能,建议企业从具体工作流入手衡量AI带来的实际价值,而非单看Token或使用量。该方法强调定义基线、跟踪完成任务与质量、计入审核与重试成本,以便评估AI部署的真实ROI。

OpenAI正在推动企业重新思考AI投资回报率:企业不应只看使用了多少Token、花了多少钱,或有多少员工登录过系统,而应进一步追踪AI帮助完成了什么工作,以及这些工作是否带来了可衡量的业务结果。

OpenAI在9月16日发布的《如何将AI使用连接到商业价值》中,介绍了ChatGPT Work与Codex管理控制台中的一组分析功能。该功能把使用量和成本数据、任务分类以及部分工作成果放在一起,帮助管理员和业务负责人判断哪些AI工作流值得继续投入。

这是一项产品更新,也反映出企业AI市场正在面对的一个现实问题:AI部署已经从试点阶段进入日常使用,但“有人在用”并不等于“企业获得了价值”。

从使用量和支出,走向任务与结果

OpenAI提供的Usage视图,可以显示ChatGPT Work和Codex的活跃用户、额度以及Token使用情况。管理员可以按团队或用户筛选,观察采用率在哪里增长、支出集中在哪里,也可以发现某个团队是否缺少入门培训,或者某项工作流的容量需求正在上升。

但单独的使用量很难解释一笔AI支出究竟意味着什么。高用量可能来自一项已经成为业务基础设施的重复性工作流,也可能只是大量试错,甚至是模型反复失败后的重试。

因此,OpenAI在Insights中加入了任务分类功能。系统会对部分消息进行分类,将使用情况归入软件工程、销售与收入等工作领域,并进一步细分为功能开发、代码维护、客户研究和规划等任务。管理员可以据此与业务负责人讨论:AI究竟在支持哪一类工作,以及应当用什么指标判断它是否改善了流程。

在Codex的Outcomes视图中,企业还可以观察Codex参与的合并提交和代码行,以及代码审查活动。OpenAI建议工程团队把这些趋势与审查时间、缺陷数量和返工情况结合起来看。AI生成或参与的代码变多,本身并不能证明工程效率提高;只有当交付更快、质量保持稳定,或者返工减少时,使用量才更接近有意义的结果指标。

OpenAI给出的衡量路径:先定义一个工作流

OpenAI建议企业不要一开始就试图计算整个组织的AI回报,而是选择一个重要且重复发生的工作流,先建立基线,再观察一段时间内的变化。

它给出的基本问题包括:团队希望改善什么,是准备工作更快、质量更高、成本更低,还是带来更多销售;在没有AI时,这项工作多久完成一次、需要多长时间,怎样才算合格;使用AI之后,完成时间和质量发生了什么变化;节省出来的时间是否转化成了客户沟通、产品开发或其他有价值的工作;最后,这些收益是否值得覆盖AI、部署、培训和持续支持的成本。

OpenAI特别提醒,评估时应把审核和纠错时间计算在内。一个模型如果能很快生成初稿,却需要员工花大量时间检查和重写,表面的速度优势可能会消失。类似地,较便宜的模型如果更容易失败和重试,也未必带来更低的单项工作成本。

OpenAI在另一篇相关说明《AI时代的计分卡》中,把这一思路概括为“每一美元带来的有用智能”(Useful Intelligence per Dollar)。它建议企业关注四个问题:AI是否完成了重要工作;每项成功任务的完整成本是多少;人们是否能够依赖结果;以及随着使用扩大,每一美元是否完成了更多有价值的工作。

这套口径与传统软件的席位数、活跃用户数和续费率不同。对AI而言,成本不仅包括模型和工具调用,还包括员工时间、人工审核、重试、延迟和返工。企业最终需要衡量的,是达到质量标准的成功任务数量,以及完成这些任务所付出的总成本。

一个245%的ROI示例,但数字并非真实客户结果

OpenAI在产品文章中提供了一个销售团队的假设案例:20名销售人员每周准备两份客户简报。假设使用AI后,每份简报从四小时缩短到一小时,每周工作46周,全年可节省5,520小时。

如果团队把其中一半时间用于更有生产力的工作,并按每小时75美元的全包员工成本计算,估算出的年度产能价值为20.7万美元。文章进一步假设第一年AI、部署、培训和支持成本为6万美元,由此得出245%的“示例性ROI”。

OpenAI明确说明,这些数字全部是假设,估算的只是产能价值,并没有计入更高成交率、更大合同金额等潜在销售收益。因此,这个案例不能被理解为OpenAI客户已经实现245%的实际回报,而是用来说明企业如何建立自己的计算方法。

文章还列出了一些客户案例。OpenAI称,密码管理公司1Password使用Codex构建、审查和测试软件,并估算出553%的ROI以及每年80万美元的工程产能价值;ATV Big Air Tour则称,活动列表审核从每周八小时减少到一小时,库存工作从两三天减少到两三小时;游戏公司Playco称,使用GPT-6 Astra制作和测试可玩原型时,人工修复次数比此前模型减少了50%。

这些数据来自OpenAI及相关客户的案例描述,属于企业自报或供应商发布的结果,并不等同于独立控制实验。不同公司的基线、成本口径、工作复杂度和收益计算方式也可能不同,不能简单横向比较。

企业AI的竞争重点正在从“接入”转向“嵌入”

OpenAI此前发布的《企业AI现状》报告称,企业用户平均每天节省40至60分钟,75%的受访员工表示AI改善了工作速度或质量。报告还指出,企业消息量和API推理Token消耗都在增长,AI正在从单次问答进入更重复、更复杂的工作流。

但这类数据同样需要谨慎理解。员工报告的时间节省是一种感知指标,企业使用量增长也只能说明采用和工作深度发生变化,不能自动推导出利润、收入或客户满意度的改善。

OpenAI在8月发布的Enterprise Signals分析中承认,Token并不是商业价值的完美衡量标准:一条简短回答可能非常有用,一段很长的输出也可能没有实际作用。不过,Token数量仍可以作为观察AI使用深度的代理指标。该分析显示,截至2026年6月,Codex占企业客户ChatGPT与Codex合计输出Token的64%;所谓前沿企业——每月AI使用量排名前10%的企业——每名活跃用户产生的输出Token是典型企业的8.3倍,而1月时这一差距为2.6倍。

OpenAI把这种差距解释为企业从“辅助”转向“委托执行”的速度不同。更深入的使用通常意味着AI获得了更多组织背景、数据连接和工具权限,也承担了更长的多步骤任务。但使用深度越高,企业同时需要处理权限、隐私、审计、审批和错误恢复等问题。

AIFlux此前关于OpenAI推出Data agent、把企业数据连接到分析和行动的报道也指出,自然语言分析要真正进入企业流程,仍然依赖可信的数据语义、底层权限、证据链和人工审批。此次分析工具的更新,与这种产品路线相互呼应:企业不仅要知道AI用了多少资源,还要知道资源被用于哪项工作、完成到了哪一步,以及结果是否能进入下一环节。

仍然难以回答的问题:价值由谁定义

OpenAI的框架把企业AI评估推进了一步,但它并没有消除衡量本身的难题。

首先,不同部门对“完成”的定义不同。客服可能把问题解决视为成功,工程团队可能要求代码通过测试和审查,财务团队则可能要求预测准确、数据可追溯并得到负责人批准。统一的使用量指标容易获得,统一的业务结果却很难建立。

其次,AI带来的时间节省不一定会转化为财务收益。员工少花一小时制作报告,可能用于服务更多客户,也可能被新的会议和审批填满。要把节省的时间转化为收入或成本改善,企业需要明确谁负责重新配置这部分产能,以及如何观察后续变化。

再次,结果质量往往不是一次性准确率能够表达的。AI可能在大多数情况下给出可用答案,却在少数高风险任务上造成严重返工。企业需要跟踪“直接可用”“需要修改”和“需要升级给人工处理”的比例,并把这些结果与风险和责任边界联系起来。AIFlux近期关于AI代理不能只看一次成功、还要衡量重复执行一致性的报道显示,在长期或重复工作流中,“成功过一次”与“可以持续依赖”并不是同一个指标。

最后,OpenAI自己既是工具供应商,也是这套衡量框架的提出者。它提供的分析功能可以帮助客户观察使用和工作流,但关于效率、ROI和客户案例的结论仍应由企业结合自身系统数据独立验证。尤其在企业采购规模扩大、模型调用成本上升的背景下,供应商关于商业价值的叙述需要与财务、运营和质量数据对照,而不能只依赖产品控制台中的指标。

从仪表板开始,而不是从一个宏大ROI数字开始

OpenAI建议企业从管理控制台的Insights中选择一项与业务优先事项有关的任务,邀请业务负责人共同确定基线、质量标准和复盘日期,再决定是扩大工作流、改善培训,还是更换模型和执行方式。

这套方法的核心并不是为所有AI活动制造一个漂亮的总ROI数字,而是把AI支出还原为一连串可检查的问题:完成了多少任务,多少任务达到质量要求,员工和系统为此投入了什么,结果是否带来更快的交付、更低的成本、更少的风险或更多收入。

随着AI从聊天工具走向能够连接数据、调用工具并执行多步骤工作的系统,企业真正需要管理的也不再只是模型价格,而是从使用到结果之间的整条链路。谁可以使用AI、AI可以看到什么、它可以采取哪些行动、哪些环节必须由人审核,以及最终由谁对业务结果负责,可能会和模型本身的能力一样,决定AI投资能否产生持续价值。

来源:OpenAI:《如何将AI使用连接到商业价值》OpenAI:《AI时代的计分卡》OpenAI Enterprise SignalsOpenAI:《企业AI现状》报告

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。