D-RAC 用一次多模态转换把 236 份 PDF 变成 1748 个可检索块,分块成本比前沿模型智能体分块低 77.8%–85.6%
核心概要
该工作提出 D-RAC,把任意企业文档先确定性归一化为 PDF、再用一次多模态大模型调用转成面向检索的 Markdown,随后沿用 W-RAC 的 ID 级分块规划;在 RAG-Multi-Corpus 的 236 份文档、795 页 PDF 子集上以 72 分钟、零错误完成转换与分块,得到 1,748 个可检索块,相比前沿大模型智能体分块减少 95.7% 的分块阶段输出 token、降低 77.8%(GPT-4.1)至 85.6%(Gemini 2.5 Pro)的分块成本、缩短 75% 的分块时间,并在 762 条查询上取得 Recall@6 0.798、MRR 0.690、NDCG@6 0.801。
深度剖析
D-RAC 把检索感知的分块从网页扩展到任意企业文档格式:先把 DOCX、PPTX、XLSX、扫描件或原生 PDF 确定性归一化为 PDF,再用一次多模态大模型调用把渲染页面转成面向检索的 Markdown,之后完全沿用 W-RAC 的确定性解析与 ID 级分块规划。 相对此前只面向可确定性转成 Markdown 的 HTML 的 W-RAC,这里把“可恢复结构”这一前提从网页推广到 PDF 及一切可渲染格式,且多模态模型只被使用一次,用于格式转换而非分块生成。 论文给出四阶段架构(归一化与渲染、转换、解析与分节、规划与重建),渲染为 200 DPI、单边不超过 1,568 像素的本地确定性操作,转换使用 Gemma-3 27B/12B、5 页一批、5 路并行,温度 0.1。
面向检索的表格规范化把每一行表格改写为一条自包含的陈述句,用列头作为上下文,并明确禁止把多行合并成析取式句子,从而让每个表格事实可被独立嵌入与检索。 论文指出稠密向量检索表格单元格的失败模式在于单元格脱离行列头后语义不完整,因此把检索感知提前到格式转换阶段,而不是留给分块或嵌入阶段补救。 转换提示词强制禁止 Markdown 表格语法、禁止合并不同行(例如不得把 Policy Term=16/20 写成“16 或 20 年”),并有确定性后处理把漏网的表格语法按行转成散文;论文称该策略建立在此前关于表格上下文散文改善摘要与问答的发现之上。
递归分节算法在标题边界处切分超出规划预算的文档,并把父级标题链作为上下文带入每次规划调用,使分块规划可扩展到 500 页以上文档。 相对把整篇文档一次性交给模型的做法,这里以 60 个元素为预算、优先用最粗标题层级切分、必要时下沉到更细层级并对无标题区域使用固定大小回退,同时合并过小分节。 在 503 页压力测试中,5,060 个元素的文档通过 95 个并行分节调用在 68.7 秒内完成规划,约为其转换时间的 5%;父级标题上下文仅增加几十个输入 token。
在 236 份文档、795 页的 RAG-Multi-Corpus PDF 子集上,D-RAC 以零转换与零分块错误完成全流程,检索质量超过规则抽取的定长分块并与智能体分块持平,而分块阶段成本大幅下降。 论文强调智能体参考分块来自语料库干净的结构化源文件,而 D-RAC 处理的是渲染后的 PDF 页面这一最难输入格式,却仍在全部七项总体指标上持平或超过。 转换累计 3,758.5 秒(含分块规划共 71.7 分钟墙钟时间),产出 1,020,219 字符、5,584 个元素、1,748 个块;762 条查询上 Recall@6 从定长分块的 0.717 提升到 0.798、MRR 从 0.602 到 0.690、NDCG@6 从 0.764 到 0.801;分块输出 token 从 270,454 降到 11,714(减少 95.7%),成本降低 77.8%(GPT-4.1)与 85.6%(Gemini 2.5 Pro),分块时间从 2,167.5 秒降到 541.8 秒。
启示与展望
该结果面向企业知识库的文档摄取与分块环节,适用于任何可被忠实渲染为 PDF 的输入格式,包括 DOCX、PPTX、XLSX、HTML、扫描图像与原生 PDF。评估语料是 RAG-Multi-Corpus 的 PDF 子集,覆盖汽车、学术教育、云服务、企业技术与银行金融五个虚构组织的产品说明、FAQ、政策流程、零件目录与服务指南;由于这些输入本身即为 PDF,归一化阶段在实验中是恒等操作,其他格式的转换效果由架构设计而非本实验直接验证。检索评估使用 762 条带支撑事实标注的查询,覆盖四个组织,CloudWay-24 在参考集中没有标注查询。成本对比以 GPT-4.1 与 Gemini 2.5 Pro 的公开定价为基准,时间对比引用 W-RAC 实验中测得的智能体分块处理时间。论文指出该设计可自然延伸到实体感知分块、图检索与策略驱动的块重组,并与 W-RAC 一起构成面向网页与文档的统一摄取基础。
转换质量依赖多模态模型对渲染页面的读取,论文用逐字保留、禁止合并、图像抑制与确定性后处理来约束输出,但转换提示词与规划提示词放在附录中,正文只给出规则要点。检索相关性判定采用“支撑事实内容词至少 60% 出现在块中”的规则,而非人工相关性标注,这一判定口径对三个系统一致,但会如何影响不同查询类型的相对排序,正文未展开。布尔类查询是智能体分块唯一保持优势的类别,论文将其列为观察而未给出机制解释。成本外推到百万页企业语料的部分基于定价与 token 结构推算,而非在该规模上实测。此外,本证据包为全文,但表格在正文中以文本形式呈现,个别数值列的对齐需以原文表格为准。
