事件概述

OpenAI 于 2026 年 10 月 6 日发布博文,介绍其与 AI 合同领域厂商 Ironclad 的研究合作。合作的核心目标很明确:把复杂的专业工作流(这里具体指合同与法务运营流程)转化为可训练、可评测的研究任务,从而推进 AI Agent 在计算机上执行专业工作的能力。

背景是 OpenAI 此前发布 GPT‑6 Astra 时,已经展示了模型在准备文档、测试网站等计算机使用场景上的进展。下一步的目标是让 Agent 能更高效地操作专业软件、解决复杂业务问题——包括理解企业业务规则、执行多步工作流,并验证自己的产出是否满足最初的需求。为此,OpenAI 选择直接与少数最懂这类工作流的软件公司合作,把高价值的困难任务变成模型的研究问题。Ironclad 是第一个合作伙伴。

关键结果:GPT‑6 Astra 是首个在 Ironclad 任务上训练的前沿模型。在 OpenAI 的研究评测中,它的平均得分比 GPT‑5.6 Sol 高 32%,而每次尝试的估计耗时低 48%。

关键技术点

1. 任务来自真实业务流程,而非合成玩具题

博文用一个采购软件的例子说明任务的复杂度:法务运营团队在搭建采购流程时,需要把「金额超过阈值要财务审批、特定请求要安全团队审查、非标准条款要法务审查」这一串规则,转化为受理表单、文档模板、审批规则和最终协议的记录。Agent 做同样的事,必须在软件操作过程中始终把这些约束保持在视野内——配好财务审批阈值,还要验证阈值上下的请求确实走了正确的分支。

Ironclad 员工以及 OpenAI 内部使用 Ironclad 的人员,共同帮助研究者识别出 11 个任务,覆盖法律、商务与采购工作,例如设置保密协议(NDA)、创建采购审批流程、以及根据申请人选择的司法辖区更新可复用的法律条款。OpenAI 估计这些任务对一名有经验的用户来说,平均每个需要 30–40 分钟。

2. 细粒度 rubric 评测

每个任务按 8 到 50 条标准(取决于复杂度)进行评估。这不仅能给出总分,还能看出模型具体做对了哪些部分、在哪里失手。

3. 托管环境 + 合成任务 + 强化学习

Ironclad 提供了其产品的托管软件环境,供模型在其中练习这些任务。OpenAI 研究者围绕代表性工作流构造了合成训练任务,并使用强化学习,让模型通过练习与反馈迭代改进。OpenAI 把这一组合——由懂行的人挑选的任务、细化的评分标准、可供模型练习的环境——视为「在真实且对客户最重要的任务上取得改进」的保障。

4. 数据来源与合规说明

合成任务来自 SEC EDGAR 数据库中公开可得的合同,并经过过滤以移除个人信息。OpenAI 明确表示:训练与评测未使用 OpenAI 客户数据、OpenAI 内部合同,也未使用 Ironclad 非公开的客户数据或合同。

5. 评测结果

对比采用各自得分最高的设置:Astra 用 Max reasoning,GPT‑5.6 Sol 用 High reasoning。

指标 GPT‑5.6 Sol(High reasoning) GPT‑6 Astra(Max reasoning)
平均 rubric 得分 41.6% 55.0%
每次尝试估计平均耗时 37.0 分钟 19.2 分钟

在 11 个研究任务上,Astra 的平均分为 55.0%,Sol 为 41.6%,估计平均耗时从 37.0 分钟降到 19.2 分钟。OpenAI 还提到,一个用于 Astra 开发过程的内部模型在这些任务上达到了 63.7%,并希望把进一步提升带到未来的模型中。

博文给出的两个对比片段中,Astra 在约 20 分钟内满足了约 94% 的任务标准,GPT‑5.6 Sol 在约 32 分钟内满足了约 85%。

需要特别注意的是脚注说明:这些结果只覆盖 11 个研究任务,不是 Ironclad 的全部工作流;时间是基于假设的模型处理与生成速度做出的模拟估计,并不是实测的客户节省时间。

对数据科学或 AI Agent 落地的意义

第一,专业软件的 Agent 化,瓶颈在「规则保持」而不是「单步操作」。 Ironclad CTO Sunita Verma 在博文中点出了这个问题:合同流程必须处理例外情况,同时保持业务所依赖的规则;如果 Agent 在任务进行到一半时丢掉其中一条规则,软件公司就无法放心地把任务交给它。这恰好解释了为什么多步工作流的评测不能只看每一步是否成功,而要看最终成品在它被设计覆盖的各种情境下是否都能正确运行。对于做流程自动化、RPA 升级或企业 Agent 的团队,这是一个重要的评测设计原则。

第二,领域专家进研究闭环是一条可复制的路径。 OpenAI 的伙伴筛选标准很具体:团队要能提出一个具体的失败案例(要 Agent 做什么、在哪里失败、如何判定成功),并带来深度理解业务的专家、安全的测试环境、以及可安全用于研究的数据。这其实是一份很实用的「企业 Agent 项目立项清单」。

第三,rubric 化的细粒度评测正在成为专业 Agent 的标准基础设施。 8–50 条标准这种量级的评分维度,意味着评测本身需要领域知识投入,也意味着评测结果可以反向定位失败环节,而不是只产出一个人工智能从业者熟悉的单一分数。

我的技术点评

这次合作最值得关注的不是那 32% 的相对提升,而是训练与评测的同源设计:任务由懂业务的人挑、环境由软件厂商提供、反馈用强化学习闭环。这比在通用 benchmark 上刷分要扎实得多,因为它把「什么叫成功」这个最难的判断,交回给了真正承担业务后果的一方。

但也要保持冷静。11 个任务是一个很小的样本,平均 55.0% 的 rubric 得分说明模型距离可靠自主还差得很远——专业场景里,一半的标准没满足通常等同于不可用。而 19.2 分钟相对于 37.0 分钟的「耗时下降」,原文反复强调是模拟估计,不能等同于真实工时节省。此外,Ironclad 产品的具体能力边界、Astra 的模型规模或 RL 算法细节,原文均未说明。

我比较认同的一点是「人类监督仍然重要」这个判断——它不是客套话,而是从评测数据里自然得出的结论。对于正在评估企业 Agent 可行性的团队,我的建议是:先照 OpenI 这份合作清单,把自己业务里最痛的一个多步流程写清楚判定标准,再去谈模型选型。流程定义不清,模型能力再强也落不了地。

原文链接