跳到主要内容
返回时间线
arXiv来源发表:

在1,888名参与者、32,847段视频上评测七种视频基础模型,VideoPrism在16项任务中10项居首,V-JEPA2-SSv2在翻转手掌任务上取得85.3%的AUC

核心概要

该研究构建了一个来自1,888名参与者(其中727人患帕金森病)的32,847段网络摄像头视频数据集,覆盖16项标准化临床任务,并以冻结特征加线性分类头的方式系统评测了七种视频基础模型(VideoPrism、V-JEPA2及其SSv2变体、ViViT、VideoMAE、VideoMAEv2、TimeSformer),结果显示任务显著性与模型架构高度相关:VideoPrism在视觉言语运动学和面部表情任务上表现最佳,V-JEPA2系列在上肢运动任务上更强,TimeSformer在手指敲击等节律性任务上仍具竞争力,整体AUC为76.4%–85.3%、准确率为71.5%–80.6%,特异性最高达90

Source-provided article image: Benchmarking Video Foundation Models for Remote Parkinson’s Disease Screening
Fig. 1

Fig. 1. Overview of the benchmarking framework for PD screening using video foundation models (VFMs). (A) Video Dataset: Our study utilizes a large-scale dataset from 1, 888 participants performing 16 standardized clinical tasks. (B) Evaluation Pipeline: Raw video data is processed through a suite of state-of- the-art frozen VFMs to extract latent representations. These embeddings are evaluated using a task-specific linear classification head to differentiate between PD and non- PD participants. (C) Task-Model Saliency: Systematic evaluation to investigate architecture-specific strengths.

· 第 2 页

深度剖析

研究建立了目前规模最大的网络摄像头录制的帕金森病视频数据集,包含来自1,888名参与者(727人患PD)的32,847段视频,覆盖16项受MDS-UPDRS启发的标准化临床任务,并划分为上肢运动学、视觉言语运动学、面部表情以及眼动-颈部-认知控制四个临床域。 此前基于计算机视觉的帕金森病筛查工作多依赖模仿临床观察的手工特征或任务专用模型,难以跨任务泛化;该数据集与任务体系为跨任务、跨架构的系统比较提供了统一基础。 数据来自八项经IRB批准的独立临床与非临床研究(2017–2025年),PD状态由自我报告(445人)或临床确认(282人)确定,队列以白人为主(1,366人),350人未披露种族。

在冻结特征加线性分类头的统一协议下,七种视频基础模型在16项任务上的AUC为76.4%–85.3%、准确率为71.5%–80.6%,其中翻转手掌和握拳任务AUC最高(分别为85.3%±0.2%和84.3%±0.1%),翻转手掌特异性达90.3%±0.5%。 该研究首次在同一临床任务体系下横向比较多种VFM架构,表明无需任务专用微调,冻结的预训练嵌入即可捕捉具有临床意义的体征。 结果基于按参与者划分的训练/验证/测试集(60%/20%/20%),在可行时报告30个随机种子的均值与95%置信区间,超参数搜索在Weights & Biases上进行并为所有任务和模型分配相同计算时间。

任务显著性与模型架构高度相关:VideoPrism在16项任务中10项排名第一,在视觉言语运动学和面部表情域优势最明显;V-JEPA2系列在上肢运动任务(如翻转手掌、伸展手臂、鼻触)上最强,且V-JEPA2-SSv2一致优于基础V-JEPA2;TimeSformer在手指敲击等节律性任务上表现最佳。 此前对VFM在帕金森病临床任务上的比较效果了解有限,该研究揭示了不同预训练范式(语义-视觉蒸馏、潜在预测世界建模、分解时空注意力)与特定临床域之间的对应关系。 结论基于16项任务上各模型验证集AUC的横向比较,V-JEPA2-SSv2在SSv2数据集上的额外微调与其在上肢协调任务上的优势相关。

多视图训练未显著优于单视图(准确率和AUC的p>0.70),过采样策略略微但非显著地降低了平均准确率(74.51% vs 74.97%)和AUC(79.83% vs 80.54%),提示冻结VFM嵌入已能应对现有类别不平衡。 该消融实验为远程视频筛查中是否需要多视图聚合和类别平衡处理提供了实证参考,表明显著诊断特征常可在短片段中捕捉。 单视图无过采样配置在16项任务上的平均准确率为74.97%(标准差3.12%)、平均AUC为80.54%(标准差2.42%),多视图和过采样对比均报告了统计检验结果。

启示与展望

该研究为基于视频基础模型的远程帕金森病筛查建立了基线,适用于使用日常设备(智能手机、网络摄像头)在家庭或临床监督下执行标准化任务的场景。其冻结特征协议使结果可直接用于比较不同VFM架构的固有表征能力,为研究者选择适合特定临床域(如上肢运动学或口面部表现)的模型提供依据。代码和匿名结构化数据已公开,便于复现和扩展。

冻结评估协议未探索任务专用微调或LoRA等参数高效方法可能达到的性能上限;实验限于可本地部署的开源权重模型;部分PD诊断标签来自自我报告,可能引入标签噪声;队列以白人为主,向更多样化人群的泛化性有待验证。此外,高AUC与低敏感性之间的差距提示决策阈值可能非最优,临床筛查效用可能需要改进模型校准并整合多任务与多模态信息。

来源