InvestigationWorlds 用 100 个真实联邦判决构建法律调查环境,最强模型仅解决三分之一案件
相关研究与后续进展核心概要
作者构建 InvestigationWorlds:从 PACER 检索 100 个已决简易判决动议的真实联邦民事案件,用经律师验证的生成流程在原始证据卷宗周围合成带角色标签的文件,使同一语料支持多个自洽但互不相容的事实假说,仅一个与法院采纳的假说一致;在 100 个案件上评估六个前沿智能体,发现它们虽能检索到相关证据,却常锁定错误假说,最高案件解决率仅 33.3%。
Figure 1 : The InvestigationWorlds pipeline. Real federal cases with summary judgment motions are filtered from PACER. Statements of facts, supporting exhibits, and the Court’s opinion are processed by an LLM pipeline that extracts entities, ground facts, and the two party hypotheses ( h p h_{p} , h d h_{d} ), and assembles them into a document graph and hypothesis Directed Acyclic Graph (DAG). A planner-and-judge agent then augments the document graph with synthetic exhibits tagged by evidentiary role (see Table 1 ).
arXiv深度剖析
提出首个以真实案件为基础、包含多个对抗性解释的智能体调查环境,并以法院意见作为司法验证的基准真值。 既有法律基准测试问答、先例检索或考试式推理,假定单一正确答案或良定义查询;InvestigationWorlds 让同一证据支持多个自洽但不相容的结论,并以法院采纳的假说作为评分目标。 100 个案件来自 28 个州、哥伦比亚特区和波多黎各,覆盖 41 个联邦司法区、全部 12 个巡回区,按 5 类联邦案件类型各 20 例平衡,归档 PACER PDF 共 42,283 页;一名律师在不知法院意见与采纳标签的情况下仅凭实体证据调查 10 个随机案件,阅读 459 页、耗时 12 小时,其事实结论在全部 10 例中与法院采纳结果一致。
提出经律师验证的生成流程,用角色标签文件(signal、noise、chaff、pro-alternative signal、alternative-specific noise)在真实记录周围构造可控歧义的大规模语料。 与端到端合成语料或按检索相似度设置干扰项的做法不同,该流程以真实案件记录为锚,按证据角色针对假说 DAG 生成文件,并公开全部提示词与角色分类法。 三名执业律师合计 30 余年经验、约 100 小时专家评审;55 个案件的分阶段审查中,当事人假说、替代假说与 chaff 文件的通过率均超过 94%,在 10 例一致性子集上一致率超过 81%;全部 100 例均接受假说保真度审计。
在 100 个案件上评估六个前沿智能体,发现最佳模型仅解决三分之一案件,且检索到相关证据并不足以避免锁定错误假说。 该结果揭示了一种既有评测未捕捉的失败模式:智能体可以检索到相关证据,却仍相信错误的替代假说;同时显示承诺频率与条件准确率之间存在权衡。 Haiku 4.5 案件解决率最高(33.3%),Sonnet 4.6 为 29.9%;六个模型均超过均匀随机基线 9.9%,但仅这两个超过“随机相信一个假说并拒绝其余”的 25.0% 基线,增益 8.3 与 4.9 个百分点且均不显著;在 87 个两模型均有完整输出的案件上,Haiku 承诺率 80.7%、Sonnet 73.3%,Sonnet 在已承诺判决中更准确(74.1% 对 70.8%)。
通过文档角色消融与生成器替换实验,显示支持替代假说的证据会诱导智能体改变判断,而评估者相对排名在不同生成流程下保持稳定。 消融量化了语料组成对判断的影响,生成器替换实验则回应了“该环境是否只测量评估者与生成器的对齐”这一疑问。 在 50 个案件的累积消融中,加入 20 份 pro-alternative 文件使五个模型的案件解决率下降 4 至 22 个百分点;在 506 个配对判决中,相信替代假说的比例从 3/506(0.6%)升至 115/506(22.7%),其中 55 个此前为“不相信”、59 个此前为“不知道”;用 OpenAI 模型端到端重建 30 个留出案件后,评估者排名在并列范围内保持一致,无一对评估者发生严格顺序反转。
启示与展望
该环境面向美国联邦民事案件中已完成充分简报的简易判决动议,这一姿态恰好提供结构化基准真值,使严格评测成为可能;作者认为该方法可推广到州法院记录、行政裁决与仲裁裁决等具有类似证据结构的场景。对读者而言,它适用于需要评估智能体在无明确查询、多份证据支持多个自洽叙述时能否构建并坚持正确事实叙述的研究与工程场景;公开的 PACER 文档语料、生成流程与提示词、以及部分匿名化合成文档,使其他团队可以扩展案件集或迁移到新领域。
合成文件经律师判定为可信且符合角色,但并非经法院检验,取证式真实感(元数据模式、线程惯例、原生格式工件)仍可逐步叠加;当前实例限于美国联邦简易判决案件,向其他司法辖区与裁决类型的迁移尚待验证。此外,替代假说由语言模型生成并经律师审计,其难度分布与真实调查中的干扰项是否一致仍是开放问题;生成器替换实验仅覆盖 30 个留出案件,评估者排名在并列范围内保持一致,但个别模型(如 DeepSeek v4)在不同生成条件下案件解决率变化较大,其稳定性值得进一步观察。
