应用与产品

Legora称GPT-6 Astra数分钟审阅41份文件:企业AI竞争转向“完成工作”

OpenAI披露客户案例称,Legora使用GPT-6 Astra在一次Agent运行中数分钟内完成了41份财务报表的勾稽检查并发现4处植入错误,展示了跨文件、可追踪的专业工作流执行能力,但结果来自双方内部评估,尚无独立复核,最终判断仍需法律专业人员把关。

Legora称GPT-6 Astra数分钟审阅41份文件:企业AI竞争转向“完成工作”

OpenAI披露客户案例称,Legora使用GPT-6 Astra在一次Agent运行中数分钟内完成了41份财务报表的勾稽检查并发现4处植入错误,展示了跨文件、可追踪的专业工作流执行能力,但结果来自双方内部评估,尚无独立复核,最终判断仍需法律专业人员把关。

OpenAI公布的一项客户案例显示,法律科技公司 Legora 使用 GPT-6 Astra,在一次 Agent 运行中于数分钟内完成了41份文件的财务报表勾稽检查,并找出测试人员预先植入的4处错误。这个案例把新模型的卖点从单次问答或文本生成,推进到了跨文件、可追踪的专业工作流执行。

不过,相关数据来自 OpenAI 与 Legora 的内部评估,尚未有独立机构公开复核。它可以说明双方希望展示的能力方向,却不能单凭一则客户案例证明 Astra 已经能够在所有法律、审计或财务场景中稳定替代专业人员。

一次运行处理41份文件

OpenAI在客户案例中说,Legora 是一家面向法律及其他专业工作的智能体操作系统,已被超过10万名专业人士使用,覆盖50多个市场的1800多个企业法务部门和律师事务所。

案例聚焦于财务报表勾稽,也就是把草拟账目中的每一个数字,与试算表、合并报表以及上一年度账目进行逐项核对,直到数字能够相互对应。Legora法律工程师 Percevale Perks 形容,这类工作可能耗费整个晚上,有时甚至需要数天。

在 GPT-6 Astra 的支持下,Legora 的 Agent 在一次运行中处理了41份文件。OpenAI称,系统逐项检查余额与支持性报表之间的关系,标记金额差异,并记录每一项核对结果。专业人员随后可以查看每一条数字和判断依据,而不是只接收一段没有过程记录的总结。

Legora表示,在其预先设置的财务报表勾稽测试中,Astra 找出了全部4处植入错误,其中包括收入附注中隐藏的50万英镑差额。系统还保留了上一代模型已经正确完成的检查,并额外完成了大约50项检查。

这类结果的关键不只是“找出错误”,而是能否留下可复核的工作轨迹。对法律、审计、税务和合规团队来说,数字来自哪些文件、经过怎样的比较、哪些项目需要人工确认,往往与最终答案本身同样重要。

“40%提升”是内部基准结果

Legora使用自家的 Legora Benchmark for Agentic Reasoning(BAR)评估模型。OpenAI称,在这项财务报表工作流中,GPT-6 Astra相较此前模型的表现提升接近40%;在 BAR 的全部任务中,平均提升约3%。

这里的表述需要保留边界。40%是特定工作流上的内部基准改进幅度,并不等同于模型在所有专业任务上的总体准确率,也不是由独立第三方按照公开协议进行的行业标准测试。OpenAI公布的材料也没有给出完整的测试集、失败案例、人工复核成本或不同文件格式下的误差分布。

这与 OpenAI 对 Astra 的整体定位相吻合。公司在《Path to Astra》中称,Astra已经达到其 Preparedness Framework 所定义的“关键”网络安全能力门槛,并在加强防护后计划逐步开放。AIFlux此前对这项披露的报道指出,这些能力数字主要来自 OpenAI 的自有评估,外界尚未获得完整协议和可重复的独立结果。

因此,Legora案例更适合被理解为一个工作流示范:模型可以同时吸收大量相互关联的文件,并把长时间的机械比较转化为专业人员可审阅的初步结果。它并不能单独证明模型在真实客户文件、跨法域规则或高风险财务决策中已经达到同样水平。

人仍然负责最后的判断

OpenAI在案例中反复强调,Agent负责穷举式比较,专业人员仍然负责对结果作出判断。Legora称,Astra带来的变化包括处理能力、信息摄取规模以及对复杂上下文的消化能力,但最终是否存在重大风险、应该怎样修改文件,仍由法律专业人士决定。

这种“人在回路中”的设计,在法律行业尤其重要。财务报表中的差异可能来自录入错误,也可能来自合并范围、会计政策或交易背景的变化。一个模型能够发现数字不一致,并不意味着它能够自动决定哪一种解释具有法律或财务效力。

这也是企业级法律AI正在面对的实际问题:产品不只要生成看起来合理的文字,还要能够继承权限、保留来源、记录操作,并让人知道什么时候必须接管。Google Cloud最近推出的 Gemini Enterprise for Legal也把权限控制、审计和既有法律软件连接器作为法律智能体平台的重要组成部分。两家公司采取的产品路径不同,但共同指向同一个变化:企业买的越来越不是一个聊天窗口,而是一套能够进入现有流程的执行系统。

从法律审查扩展到专业服务

OpenAI称,Legora正把平台从合同和协议审查、法律研究扩展到审计、税务、合规和风险管理。财务报表勾稽之所以适合作为展示场景,是因为它既有大量结构化和非结构化材料,也有明确的逐项检查要求,同时又需要专业人员处理例外情况。

对模型厂商而言,这类任务提供了比通用问答更接近商业价值的衡量方式。企业关心的不是模型是否能写出一段流畅说明,而是它能否在有限权限下读取正确资料、连续执行多个步骤、发现遗漏,并把结果交给员工复核。如果这些环节能够稳定工作,模型才可能真正减少重复性劳动。

但工作流越接近真实业务,风险也越集中。文件权限错误、来源引用缺失、误报或漏报,都可能造成比普通聊天错误更大的后果。尤其是法律和财务场景,效率提升必须与保密、责任归属、审计和人工签核同时推进。

下一步要看公开数据和长期使用结果

目前已确认的是,OpenAI于2026年9月3日发布了这项 Legora 客户案例;Legora在一次 Agent 运行中处理了41份文件,OpenAI称其在特定内部财务报表工作流基准上的表现提升接近40%,并找出了4处植入错误。案例还确认,最终判断仍保留给法律专业人员。

尚未确认的,则包括这项任务在真实客户项目中的平均错误率、人工复核所需时间、不同语言和会计制度下的表现,以及模型是否会在复杂例外中错误地把差异标记为问题。OpenAI也没有在这篇客户案例中公布完整的 BAR 测试方法或独立审计结果。

如果这些系统要从演示走向大规模部署,后续最值得观察的指标将不只是一次运行处理了多少文件,而是它能否持续降低复核负担、减少遗漏、保留可靠的证据链,并在不确定时及时把决定交还给人。对 Legora 和 OpenAI 来说,这或许比“数分钟审阅41份文件”更能决定产品能否进入法律与专业服务的核心流程。

原始资料包括 OpenAI:Legora reviewed 41 documents in minutes with GPT-6 AstraLegora Tabular Review产品页OpenAI:Path to Astra。关于Astra发布与企业部署背景,另可参考 The Verge的报道CNET的报道

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读