产业与商业

OpenAI发布企业AI使用研究:Codex占企业客户合计输出Token的64%

OpenAI 发布两份企业使用研究,指出企业客户正在将 AI 从“提供建议”的工具推进为可调用工具、接入企业数据并执行多步骤任务的代理系统;报告显示截至 2026 年 6 月,Codex 在企业客户合计输出 Token 中占比 64%,但该数据反映的是输出结构而非市场份额或收入比例。研究还发现“前沿企业”与典型企业在使用深度上拉开显著差距,企业要把代理转化为可持续能力需建立权限、复核与治理等流程。

OpenAI发布企业AI使用研究:Codex占企业客户合计输出Token的64%

OpenAI 发布两份企业使用研究,指出企业客户正在将 AI 从“提供建议”的工具推进为可调用工具、接入企业数据并执行多步骤任务的代理系统;报告显示截至 2026 年 6 月,Codex 在企业客户合计输出 Token 中占比 64%,但该数据反映的是输出结构而非市场份额或收入比例。研究还发现“前沿企业”与典型企业在使用深度上拉开显著差距,企业要把代理转化为可持续能力需建立权限、复核与治理等流程。

OpenAI发布的两份企业人工智能使用研究显示,企业客户正在把AI从回答问题的辅助工具,推向能够调用工具、连接企业数据并执行多步骤任务的代理系统。OpenAI称,截至2026年6月,Codex在企业客户使用的Codex与ChatGPT合计输出Token中占64%。

这一数字被OpenAI视为企业AI使用方式发生变化的信号,但它衡量的是输出量结构,并不等同于Codex在企业客户数量或收入中的占比。研究数据也主要来自OpenAI自身产品生态,不能直接代表整个企业AI市场。

从“提供建议”到“完成工作”

OpenAI在8月12日发布的文章《From assistance to execution: How enterprises put AI to work》介绍了两项相互补充的研究:一份名为 Enterprise Signals 的报告,重点分析企业客户如何使用代理能力;另一份工作论文《How Organizations Use AI: Evidence from ChatGPT》,则考察AI在不同企业、岗位和职级中的使用扩散情况。

OpenAI对两者的概括是,企业AI正在从“协助”走向“执行”。传统聊天式工具通常帮助员工整理信息、提出建议或生成初稿,而代理可以进一步访问工具和文件,执行资料搜集、代码修改、分析和报告撰写等较长的工作流程,最后把结果交由人审阅。

以产品定位来说,ChatGPT Work和Codex都被OpenAI放在这一转变中。公司举例称,员工不只是询问如何准备一份演示文稿,也可以要求代理跨多个来源收集信息并完成初稿。不过,OpenAI同时强调,真正投入生产环境仍需要清晰的权限、人工复核和治理机制。

前沿企业与普通企业之间的差距扩大

OpenAI把每月使用强度排名前10%的企业定义为“前沿企业”,并以每名活跃用户产生的输出Token衡量使用深度。2026年6月,前沿企业每名活跃用户产生的输出Token是典型企业的8.3倍;1月时这一差距为2.6倍。

这项比较并不是企业规模或收入排名,而是OpenAI根据自身平台上的使用强度划分的队列。换句话说,8.3倍反映的是企业在OpenAI产品上的使用深度差异,不能直接推导出前沿企业的AI投资回报率,也不能说明它们在整个市场中拥有同等幅度的技术优势。

研究还显示,企业之间的差距不仅体现在使用频率,也体现在是否把AI接入更完整的工作流。前沿企业中,每周使用Plugins的活跃用户比例为21%,典型企业为9%;使用skills的比例分别为19%和3%。OpenAI称,Plugins可以把可复用的操作指令与企业数据、工具和行动能力组合起来,例如让销售代理结合团队销售手册和CRM信息,生成一份供人审阅的客户回复。

OpenAI还给出一个内部对照:该公司内部每周使用Plugins的活跃员工比例为95%。这一数据说明更深度的使用方式在技术条件上已经存在,但并不意味着普通企业能够在没有额外数据整理、流程设计和治理投入的情况下复制这种水平。

Codex的增长不再局限于工程部门

Codex最初主要面向软件开发,但OpenAI的企业数据表明,使用增长正在向更多知识工作职能扩散。自2月以来,企业Codex周活跃用户在法律部门增长108倍,在销售和招聘部门均增长41倍,在营销部门增长26倍;工程部门的增长为5倍。

这些倍数是研究期间相对于基线的增长,不是这些职能中使用Codex的绝对人数,也不能简单理解为相关部门已有多数员工都在使用Codex。尤其是在基数较小的部门,较高的倍数可能部分反映早期扩散阶段的统计特征。

OpenAI以维珍航空为例介绍这种变化:工程团队使用Codex重构遗留代码,把原本可能需要两周的工作压缩到约30分钟;产品团队则使用ChatGPT Work完成竞争研究。公司没有在这篇研究文章中提供足够的独立材料来验证这些案例是否可以普遍复制,因此它们更适合作为企业使用场景,而不是行业平均表现。

这种“执行—复核”的分工,也出现在其他AI编程代理的实践中。AIFlux此前报道的Anthropic把更多代码审查交给AI、Bun完成大规模Rust迁移显示,代理带来的变化不只是生成更多代码,还包括把审查、测试和任务编排纳入自动化流程。

早期职业员工的使用强度更高

两份研究中的另一项发现与许多“管理层率先采用AI”的调查叙事不同。OpenAI称,基于数百万次对话的行政数据,早期职业员工的使用强度高于高管。采用AI六个月后,早期职业员工每周发送的消息数量比高管多13条。

OpenAI认为,这可能意味着企业内部已经形成AI使用习惯的员工,未必集中在组织层级最高的位置。对管理者而言,一个可行方向是识别这些员工已经形成的有效工作流,把它们转化为团队共享的方法,而不是只通过增加账号数量来推动采用。

相关工作论文的分析范围更广。论文称,研究人员将ChatGPT Enterprise账户记录与员工岗位、任务分类以及上市公司财务数据进行隐私保护式关联;截至2026年3月,六个月采用期的员工层面样本包含超过1,500家组织和超过1,700万条消息。主报告则称Enterprise Signals使用了超过1,000万条消息的样本。两项研究的样本和分析口径并不完全相同,数字不应混为一谈。

企业真正面对的不是“有没有AI”,而是能否形成稳定流程

OpenAI研究的核心结论并不是企业只要部署代理就能自动获得更高产出。相反,报告强调,企业需要把代理连接到正确的上下文和工具,并建立权限、复核和治理机制。企业还需要持续培训员工、建设共享工作流和数据基础设施,才能把个人层面的尝试扩展为组织能力。

这也解释了为什么企业AI的竞争,正在从“谁先开通账号”转向“谁能把有效用例制度化”。前沿企业的高输出量可能反映了更成熟的流程设计、更充分的工具接入以及更强的组织推动,而不仅仅是模型本身的差异。

OpenAI此前在企业产品和Codex更新中也不断强调工作流导向。AIFlux此前报道的OpenAI计划在Codex中退役GPT-5.4并迁移至GPT-5.6 Terra和Luna表明,模型分层、成本和任务强度正在被放进同一套企业工具链中考量。

但截至目前,OpenAI并未公开一套能够让外部研究者完整复现这些企业使用指标的方法,也没有证明输出Token增长必然带来同等幅度的收入、生产率或业务结果。企业客户使用竞争对手模型、自建模型的情况,也不在这些数据的测量范围内。

因此,这两份报告更准确的含义是:在OpenAI的企业客户中,代理式工作流正在扩大,部分高强度使用者已经明显拉开差距;而企业AI下一阶段的关键问题,将是如何在权限可控、结果可审计的前提下,把这些局部实践变成可持续的组织流程。

来源:OpenAI:From assistance to execution: How enterprises put AI to work工作论文:How Organizations Use AI: Evidence from ChatGPT

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读