跳到主要内容
返回时间线
arXiv来源发表:

BioGait-VLM 用三模态视觉-语言-生物力学框架在 8 类步态基准上达到 68.1% 准确率,并在盲法专家评审中以 69.2% 的病例被选为更优模型

核心概要

该工作提出 BioGait-VLM,一个在冻结的 InternVL3.5-1B 上构建的三模态(RGB 视觉、语言、显式生物力学)框架,通过时序证据蒸馏分支和将 3D 骨架运动学投影为语言对齐语义 token 的生物力学 token 化分支,在由公开 GAVD 与自采 30 例退行性颈椎病(DCM)队列合并而成的 8 类、1181 段视频、受试者不重叠的基准上取得 68.1% 准确率与 52.9% 宏 F1(DCM 类 F1 98.1%、异常步态 F1 80.4%),并由四位 DCM 领域专家在 52 段留出视频的盲法评审中于 69.2% 病例(36/52,p<0.001)将其评为优于基线。

Source-provided article image: BioGait-VLM: A Tri-Modal Vision–Language–Biomechanics Framework for Interpretable Clinical Gait Assessment
Fig. 1

Fig. 1. Overview of BioGait-VLM. The framework integrates three streams: (Top) Temporal Evidence Distillation (TED) for rhythmic dynamics; (Middle) Visual Con- text; and (Bottom) Biomechanical Tokenization, projecting 3D kinematics into se- mantic tokens. Fused within a frozen LVLM, these modalities enable state-of-the-art classification and evidence-grounded clinical reporting.

· 第 4 页

深度剖析

提出生物力学 token 化分支,用现成 HSMR 估计器逐帧提取 46 维 SKEL 姿态向量,再经模板映射转成结构化自然语言描述(如“Frame t: [Pelvis] tilt=α° list=β° ... [R.Knee] flex=δ°”),与临床指令提示拼接后 token 化,使 LLM 能直接“阅读”关节运动学。 以往骨架图网络(如 ST-GCN)只输出类别概率,通用 LVLM 又缺乏量化细粒度时序异常的能力;该工作把运动学数值转成语义 token 注入预训练语义空间,无需单独的骨架编码器。 消融显示去掉生物力学分支后,结构定义明确的病理(帕金森、DCM)性能下降;盲法专家评审中完整模型在证据支撑维度得 4.23 分,而最强基线为 2.31 分。

引入时序证据蒸馏(TED)分支,用 32 个可学习运动查询、3 层 4 头 Transformer 解码器对帧级视觉特征做交叉注意力聚合,形成全局动态描述子,以捕捉震颤、慌张步态等节律异常。 标准 VLM 通常用朴素均值池化处理视频,会掩盖步态诊断所需的细粒度节律线索;TED 以查询为潜在时序锚点,按运动模式相关性而非视觉外观聚合帧特征。 消融中移除 TED 分支导致性能明显下降,肌病类 F1 下降尤为显著,说明静态 VLM 特征难以捕捉摇摆步态等节律异常。

采集并整理 DCM 临床步态数据集:30 名患者、239 段视频,来自华盛顿大学医学院三级中心的门诊神经外科就诊者,由脊柱外科主治医师诊断确定标签,采用 30 fps、1080p、10 米走廊矢状位标准化拍摄,并保留真实临床背景杂物。 公开数据集(如 GAVD)常缺少特定脊柱病理;该队列专门针对 DCM 这类细微且常被误诊的步态异常(痉挛、失衡、步频增快),填补了该病理类别。 数据采集遵循 HIPAA 与 IRB 规范,采用双流去标识化流程(骨架路径不保留标识符、视觉路径先做人脸模糊),仅去标识化衍生物用于训练。

构建受试者不重叠的泄漏感知评测协议:GAVD 用 158 名受试者(728 段)训练、40 名(214 段)测试,DCM 按 8:2 患者级划分(24 名 187 段训练、6 名 52 段测试),合并后共 915 段训练、266 段测试,零受试者重叠。 与原始 GAVD 划分不同,该协议防止模型记忆患者身份,使评测更贴近真实临床的跨患者泛化场景。 在此严格协议下,SlowFast、TSN 与零样本 Qwen3-VL-2B、InternVL3.5-1B 准确率均低于 40%,而完整模型达 68.1%。

启示与展望

该结果面向临床步态评估场景,适用于具备标准化矢状位拍摄条件、且已按受试者划分训练与测试的机构;方法以冻结的 InternVL3.5-1B 为骨干,仅训练时序解码器与线性分类头,因此对算力需求相对可控。对临床医生而言,其价值在于同时给出分类结果与引用具体关节角度、步时、摆动百分比等量化指标的文字理由,可作为筛查与文档记录的辅助;对研究者而言,它提供了把显式生物力学注入视觉语言模型的可行范式,以及一个包含 DCM 类别的 8 类基准与泄漏感知划分协议。

DCM 队列规模较小(30 名患者、留出 52 段),宏 F1 在少数类上可能波动较大,因此 68.1% 准确率与 52.9% 宏 F1 的稳定性仍需更大规模、更多中心的队列检验。token 化只编码关节角度等运动学参数,不含力与力矩等动力学量,且参数来自单目姿态估计而非直接测量,可能受单视角深度歧义与遮挡(如宽松衣物)影响。作者已启动第二阶段采集,使用 OpenCap 双手机多视角无标记动作捕捉,以期用经验证的肌骨序列替代估计参数。此外,盲法专家评审为聚焦式定性试点,四位评审各看 13 例,其结论的普适性有待更大规模评估确认。

来源