跳到主要内容
返回时间线
Journal of Zhejiang University(Science Edition)来源发表:

Universal Doc AI:融合OCR、RAG与LLM的通用智能文档管理系统

核心概要

本文提出并描述了 Universal Doc AI 这一多模态智能文档管理系统,将光学字符识别(OCR)、检索增强生成(RAG)、向量语义检索与大语言模型(LLM)整合为统一平台,对用户上传的PDF、扫描件、图像与手写笔记进行文本抽取、语义分块、向量索引与基于文档内容的对话式问答,并报告在检索准确率、回答相关性与交互效率上相较传统关键词检索有所提升。

AI-generated editorial illustration: Universal Intelligent Document Management System Using OCR, Retrieval-Augmented Generation, and Large Language Models

深度剖析

提出一个统一的AI文档管理框架,同时处理文本型与图像型文档,覆盖PDF、扫描件、Word、文本文件以及JPG/JPEG/PNG等图像格式。 相较以往多聚焦单一环节(OCR、检索或对话)的工作,本文把文档获取、存储、组织与问答放在同一架构内。 以系统架构与六阶段流程(文档获取、文本抽取、预处理、语义索引、检索、响应生成)的形式给出,属于设计层面的论证。

将OCR接入RAG流水线,对扫描件与图像先做噪声去除、方向校正、文本区域检测与字符识别,再进入语义处理。 把图像型内容转化为可检索文本,使原本无法被关键词检索的扫描件与照片进入语义检索范围。 以算法1(OCR文本抽取)的步骤化描述呈现,文中说明手写识别为“where supported”。

采用重叠语义分块、稠密向量嵌入与向量数据库索引,并以余弦相似度做Top-K语义检索,替代精确关键词匹配。 检索依据语义相关性而非字面匹配,并保留文档标识、元数据、页码与分块引用以便溯源。 以算法2、3、4、6的步骤化描述给出,属于方法说明而非对照实验数据。

由LLM基于检索到的上下文生成回答,并附文档引用;当上下文不足时系统告知用户而非给出推测性回答,以此降低幻觉。 把回答限制在上传文档的知识范围内,并保留可核验的来源引用,区别于仅依赖预训练知识的通用聊天机器人。 以算法5(上下文感知生成)的步骤化描述与结论中的定性表述给出。

启示与展望

该框架面向需要在上传文档范围内做问答与语义检索的机构场景,包括教育机构、企业、医疗机构、律所、金融机构与政府部门;其设计目标是支持PDF、扫描件、图像与文本文件,并配套安全存储、文件夹组织、元数据管理、版本跟踪、用户认证与基于角色的共享权限。文中将多语言文档理解、手写识别、文档摘要、语音交互与多模态推理列为未来工作,说明这些能力在当前版本中属于待扩展范围。

所载文本为不含图表与实验表格的版本,因此实验评估中“检索准确率、回答相关性与交互效率”的具体指标、数据集构成、样本规模与对照基线均无法从现有内容确认;OCR噪声对下游检索的影响在文献综述中被引述为随噪声增加而下降,但本文系统在该条件下的表现仍属开放问题;手写笔记的识别效果文中以“where supported”限定,其覆盖程度有待明确;多语言理解、摘要与语音交互被列为未来方向,当前可用性尚待验证。

来源