BoneGraph:面向骨科学的领域专用自校正推理系统
核心概要
该工作构建了BoneGraph——一个以7,449份文献与16本教科书为语料、248,629个SPECTER2段落向量和1,597个概念/1,699条因果关系的骨知识图谱为共享底座、由Chat、Search、Reasoning、Vision、Mechanics五个标签页组成的骨科学专用系统,检索在30题七领域基准上达到MRR 0.928,视觉骨区分类器在留出MURA上达到92.6%准确率,在给定正确段落时把答题准确率从42%提升到78%,且全部推理在本地单台Jetson AGX Orin上完成、无第三方API调用。
深度剖析
构建了骨科学专用的检索底座:通过OpenAlex的133条、17组关键词分类法收集54,634篇论文元数据,用三层PDF解析管线获得7,674份经校验全文PDF与16本开放教科书,经PyMuPDF抽取、两遍正文语言过滤、句子感知切分后得到248,629个段落,并以SPECTER2(文档用proximity适配器、查询用ad-hoc适配器)编码为768维向量。 既有开放学术索引(OpenAlex、PubMed)与科学嵌入(SPECTER、SPECTER2)都未针对骨科学做语料策展,该工作把二者组合并补上骨特异关键词分类法与PDF解析阶段,形成领域聚焦的检索能力。 语料与处理流程在方法部分逐步给出(54,634篇元数据、7,674份PDF、7,433篇英文全文、248,629个chunk),检索效果由30题七领域人工基准支撑,MRR 0.928,最低为simulation 0.833与biomaterials 0.867。
提出并实现了自校正推理回路:推理代理仅依据问题、对话历史与用户规则作答,不接触检索证据;随后由纯Python实现的八条内置物理接地规则(覆盖皮质骨模量、小梁骨模量、皮质骨密度、小梁BV/TV、WHO T值、Wolff定律方向、密度-强度幂律、溶骨病灶效应)做确定性筛查,再由掌握检索文献与一跳知识图谱边的critic给出accept、dispute或conflicting_evidence,回路硬性上限为两轮。 相对self-refinement让模型自评,该工作把纠正信号换成确定性物理检查与外部证据锚定的critic;相对自一致性,作者指出多数投票不适用于骨科学开放式散文式回答。 规则种类(range、forbid pattern、comparative)与八条规则的具体阈值在表10中逐条列出;critic只接收原始一跳边、不接收预组合多跳链,这一约束由五条骨折领域探针审计(文献通道余弦相似度0.78–0.84)所驱动。
用户反馈被编译为持久、可检查、可撤销的规则:用户否决答案并给出自由文本纠正后,由llama3.2:3b编译为结构化可编辑规则,用户确认后进入个人规则库,此后每次请求既被预置进代理提示,又被确定性接地检查;论文给出一个完整走查,其中关于骨质疏松中皮质骨与小梁骨失效顺序的错误前提在规则生效后被纠正,且模型权重未发生任何改变。 通用LLM没有持久接受专家纠正的机制,同一错误可能在下一个相似问题上重现;该工作把学习放在可列举、可编辑、可开关、可删除的检索与规则应用上,而非不透明的权重更新。 走查以图3分四步呈现(无规则时八条内置规则与critic均未质疑前提、用户纠正、规则编译确认、规则生效后经九条规则接地并由critic一轮修订后接受),作者同时指出该例中纠正源自用户而非系统自发。
视觉与力学两个成像标签页采用轻量接地与集成的路线:视觉侧在冻结的BiomedCLIP特征上训练骨区分类头(MLP 92.6%准确率、macro-F1 0.918;线性探针89.6%、0.886),配以最近邻分布外守卫(阈值取MURA验证集分数第一百分位0.827)与图像嵌入纠正记忆(存储原图加90/180/270度旋转与水平翻转共五份,匹配阈值约0.9);力学侧集成此前的D2IM模型,从单张未变形micro-CT切片直接预测位移与应变场,推理时无需有限元或数字体积相关。 相对PathChat式的基础编码器加指令微调路线,该工作以极小训练成本换取边缘可运行与分布外安全降级;相对孤立的深度学习力学代理,它把位移/应变预测放进与检索、推理同一Web应用。 视觉指标在按患者不重叠划分的MURA留出验证集上报告,七个骨区各自均超过85%;分布外守卫在MURA验证片(最近邻余弦0.83–0.99,中位0.95)与分布外图像(0.47–0.50)之间分离干净;异常检测头仅74.2%准确率、异常召回0.61,被作者明确列为初步结果。
启示与展望
该系统的适用范围由作者明确界定:全文语料仅限通过OpenAlex与解析管线可获取的开放获取PDF,付费文献只存在于元数据而不在正文索引中;知识图谱仅作为critic的一跳证据通道,从不作为权威推理器;视觉分类器仅在上肢X光(MURA)范围内有效,分布外守卫在临床CT、MRI与micro-CT上会撤回预测并回退到裸VLM;力学模型在特定椎体micro-CT数据集上训练,最可靠地泛化到同类切片。系统被定位为研究与教育工具、面向人在回路的使用,而非临床诊断设备。这一架构使后续扩展成为可能:作者计划把视觉分类器扩展到下肢X光与临床CT数据集并置于模态路由器之后,用LoRA做PathChat式指令微调,加入跨模态检索、自动上下文压缩、D2IM自训练命令行界面,以及在Mechanics标签页中并列集成数字体积相关引擎。
作者列出的开放问题包括:知识图谱虽经清理但为机器抽取,尚未在骨折领域逐边核验且仍然碎片化;接地推理基准仅50题、每条件运行一次,显著差异建立在较小边际上;提示结构与证据使用之间的联系是暂定的,因为底层差异并不显著;题目由语言模型从语料段落生成,仅核对了来源数量而非经领域专家审核,其中一题在自身措辞中给出数量因而只测试计算;关键词检索条件在同一批题目上调参且尚未进入部署系统,需要留出题集确认。此外,分布外守卫与纠正记忆的阈值必须保守设置,异常检测头不得被解读为临床标志。就本次阅读而言,正文、表格与附录提示均已载入,但图1至图10为图像内容,其内部细节无法从文本中核验,因此涉及图示的定量描述以正文与表注所述为准。
