OpenAI与Ironclad合作构建11项合同工作流任务,GPT‑6 Astra平均评分55.0%高于GPT‑5.6 Sol的41.6%
核心概要
OpenAI与AI合同平台Ironclad合作,将法律、商务与采购领域的合同工作流转化为11项研究任务,每项按8至50条标准评分,并在Ironclad托管软件环境中用合成任务和强化学习训练模型;在11项任务上,GPT‑6 Astra平均评分55.0%,高于GPT‑5.6 Sol的41.6%,估计每次尝试平均耗时从37.0分钟降至19.2分钟。
深度剖析
研究团队与Ironclad员工及在OpenAI使用Ironclad的人员共同识别出11项法律、商务与采购任务,包括设置保密协议、创建采购审批流程,以及更新可复用法律条款以反映请求者所选司法辖区。 与以往通用计算机使用评测不同,这些任务由熟悉实际业务规则的人挑选,并配有Ironclad产品的托管软件环境供模型练习,使评测贴近真实专业工作流。 任务数量、任务类型与来源在文中明确说明;每项任务按8至50条标准评分,估计有经验用户平均需30至40分钟完成一项。
GPT‑6 Astra是首个在Ironclad任务上训练的前沿模型,在11项研究任务上平均评分55.0%,高于GPT‑5.6 Sol的41.6%,估计每次尝试平均耗时从37.0分钟降至19.2分钟。 文中同时报告了评分与模拟耗时两个维度,并说明比较采用Astra的Max reasoning与Sol的High reasoning,即各自得分最高的设置。 对比基于11项研究任务的平均评分与估计平均耗时;文中另给出单任务示例,Astra满足约94%标准、估计20分钟,Sol满足约85%、估计32分钟。
用于开发Astra的内部模型在这些任务上达到63.7%,高于Astra的55.0%,团队表示希望把这一增益带入未来模型。 该数字提示训练流程本身仍有可提取的改进空间,而不仅是已发布模型与上一代模型的差距。 该结果来自内部模型在同样11项任务上的评分,文中未给出其耗时或更细的配置说明。
训练数据由SEC EDGAR公开合同中经过去除个人信息过滤的模拟任务构成,未使用OpenAI客户数据、OpenAI内部合同或Ironclad非公开客户数据与合同。 这一数据来源说明使外部读者能够判断该评测在数据合规与可复现性上的边界。 文中以脚注形式明确列出数据来源与排除项,属于对训练与评测数据范围的直接陈述。
启示与展望
该结果适用于这11项研究任务,而非Ironclad的全部工作流;文中明确说明时间是基于假设的模型处理与生成速度得出的模拟估计,不是实测的客户时间节省。方法上,任务由Ironclad员工与在OpenAI使用Ironclad的人员共同识别,模型在Ironclad提供的托管产品环境中练习,训练任务由SEC EDGAR公开合同经过去除个人信息的过滤后生成。这一组合适合希望把自身专业工作流转化为模型训练与评测问题的软件公司,前提是能提供懂业务的人员、安全的测试环境和可安全用于研究的数据。
评分标准由8至50条构成,但文中未展示各任务的具体标准内容与权重,读者难以判断评分对哪些能力更敏感。耗时是模拟估计,其假设的处理与生成速度未在文中展开,因此不宜直接换算为真实人力节省。内部模型63.7%的结果缺少配置与耗时信息,其增益来源仍待说明。此外,11项任务之外的泛化表现、以及模型在长流程中是否会丢失某条业务规则,文中以人工监督仍然重要来回应,但未给出量化证据。
