Legora 用 GPT-6 Astra 在几分钟内审阅 41 份财务文档
Legora 用 GPT-6 Astra 在几分钟内审阅 41 份财务文档
OpenAI 于 2026 年 9 月 3 日发布了一篇客户案例,介绍了欧洲初创公司 Legora 如何利用 GPT-6 Astra 优化其法律与专业工作流。Legora 是一个面向法律与专业工作的智能体操作系统,目前有超过 10 万名专业人士使用,覆盖 50 多个市场的 1800 多个法务部门和律师事务所。该案例聚焦于一项极其繁琐的财务工作——财务报表勾稽(financial-statement tie-out),并展示了 GPT-6 Astra 在准确率、完整性和可靠性方面的显著提升。
事件/产品概述
Legora 的客户工作流中有一项称为“financial-statement tie-out”的任务:需要将草拟报表中的每一个数字逐一对照试算平衡表(trial balances)、合并明细表(consolidation schedule)以及上一年度报表,直到每一项都核对一致。Legora 法律工程师 Percevale Perks 表示,这项工作“通常要花上一整晚,有时甚至好几天”。
使用 GPT-6 Astra 后,Legora 的 Agent 在一次运行中完成了 41 份文档的勾稽工作,耗时仅 几分钟。Agent 检查了每个余额与其支持明细表的一致性,识别出金额断裂点,并记录了每一项检查结果。最终,GPT-6 Astra 找到了 Legora 预先植入的全部 4 个错误(包括收入注释中隐藏的一笔 50 万英镑差额),并在 Legora 的内部基准测试中,将财务报表工作流的性能提升了近 40%。
值得注意的是,Legora 将最终判断权保留给法律专业人士。Agent 负责大量重复性比较与核查,而人类专家负责对每个结果进行最终决策。这种人机协作(human-in-the-loop)的模式,也是 Legora 从法律工作向审计、税务、合规和风险领域拓展的核心策略。
关键技术点
大规模文档处理能力:GPT-6 Astra 能够一次摄入并消化 41 份复杂财务文档,提取大量明细项目与数字,并在单次 Agent 运行中完成系统性检查。Perks 指出,前后最大的变化在于“处理能力”——能摄取如此庞大的文档量、消化极其复杂的信息,并获取所有不同细项和数字。
Agent 工作流设计:Legora 的 Agent 将工作流拆分为“检查每个余额 vs. 支持明细表”“记录每个检查结果”“保留所有正确项”等步骤。最终输出的是一个包含每个细项和数字的细粒度审核记录,供法律专家审阅。
准确率、完整性与可靠性提升:Legora 使用自有的 Agentic Reasoning 基准(Legora Benchmark for Agentic Reasoning, BAR) 对 GPT-6 Astra 进行评估。BAR 衡量的是基于真实场景的端到端法律任务性能。在财务报表勾稽任务中,GPT-6 Astra 比上一代模型提升了近 40%;而在 BAR 的全部任务中,平均提升约 3%。具体到本次任务,GPT-6 Astra 不仅找出了全部 4 个植入的错误,还保留了上一代模型所有正确执行的检查,并额外完成了约 50 项检查。
与人类专家协作的边界:系统设计明确区分了“Agent 执行比较/记录”和“专家做判断”的边界。最终决策权不在模型手上,而是在法律专家手中——这有助于在高风险领域建立信任。
对数据科学或 AI Agent 落地的意义
这个案例展示了 AI Agent 从“文本生成”走向“复杂工作流自动化”的真实潜力。对数据科学和 AI 工程而言,有几点值得关注:
- 长尾、枯燥、高价值的重复性任务是最佳落地场景:财务报表勾稽这类任务需要高精度和极高耐心,且人力成本高昂。Agent 擅长做海量一致性检查,而人类的优势在于专业判断。这种互补关系正是 Agent 落地的典型范式。
- 评估基准的设计直接反映业务价值:Legora 提出的 BAR 基准,不是简单的问答或代码生成,而是针对真实法律工作流设计的端到端评测。只有把评估指标和真实业务结果(如错误发现率、检查覆盖度、耗时)绑定,才能有效衡量模型改进。
- 人机协同的架构应当成为默认设计:Legora 强调最终判断由法律专家负责。将 Agent 用于“穷举比较”和“留痕记录”,可以显著降低专业人士的工作负担,同时规避完全自主决策带来的合规风险。
- 巨大的性能差异可能出现在特定领域任务上:GPT-6 Astra 在财务报表工作流上提升近 40%,而在全任务中平均只提升约 3%。这说明,不同任务的瓶颈差异极大,当模型上下文窗口、推理能力和长文档处理能力大幅增强时,某些以前无法完成或错误率高的任务会突然变得可行。
我的技术点评
这则案例的有趣之处,不在于“AI 能处理文档”,而在于它如何把边界感处理得非常好。
首先,Agent 一次性处理 41 份文档并保留完整审计轨迹(每个检查项都记录在案),这种做法比单纯给出“最终答案”更有价值。对于法律、审计、财务这类要求可追溯性的行业,过程透明度往往与结果正确性同样重要。Legora 将“逐项核对”作为 Agent 的核心任务,并输出“每条细项的核对记录”,是一个很聪明的工程设计。
其次,近 40% 的提升与全任务均值 3% 的提升形成了鲜明对比,这提示我们在评估大模型能力时,不能用通用基准代表所有任务。一个模型可能对普通任务只有小幅升级,但对“超长文档 + 数字推理 + 多步骤比较”这类此前难以完成的组合任务,会产生质的飞跃。这里的 40% 很可能不是“模型变聪明了”,而是“模型的容量(缩放能力)终于突破了某个任务的可行性门槛”。
最后,我对“全部 4 个植入错误均被找到”这一结果保持审慎认同。植入错误本身是人工设计的,可能与真实世界中的错误模式有差异。但即便如此,能够在几分钟内处理数十份财务报表并保持高覆盖率,已经比纯人工处理在速度上有了数量级优势。原文未说明该测试的重复次数、随机性控制以及错误植入的具体方法,因此在泛化性上仍需更多证据。不过,从工程角度看,Legora 选择的“Agent 做检查、人做判断”的流程,是当前法律科技落地中相当务实的一条路径。
原文链接
🔗 Legora reviewed 41 documents in minutes with GPT-6 Astra | OpenAI
原文发布时间:2026-09-03
来源:OpenAI News
