arXiv 2026年9月24日该研究构建了一个来自1,888名参与者(其中727人患帕金森病)的32,847段网络摄像头视频数据集,覆盖16项标准化临床任务,并以冻结特征加线性分类头的方式系统评测了七种视频基础模型(VideoPrism、V-JEPA2及其SSv2变体、ViViT、VideoMAE、VideoMAEv2、TimeSformer),结果显示任务显著性与模型架构高度相关:VideoPrism在视觉言语运动学和面部表情任务上表现最佳,V-JEPA2系列在上肢运动任务上更强,TimeSformer在手指敲击等节律性任务上仍具竞争力,整体AUC为76.4%–85.3%、准确率为71.5%–80.6%,特异性最高达90该研究构建了一个来自1,888名参与者(其中727人患帕金森病)的32,847段网络摄像头视频数据集,覆盖16项标准化临床任务,并以冻结特征加线性分类头的方式系统评测了七种视频基础模型(VideoPrism、V-JEPA2及其SSv2变体、ViViT、VideoMAE、VideoMAEv2、TimeSformer),结果显示任务显著性与模型架构高度相关:VideoPrism在视觉言语运动学和面部表情任务上表现最佳,V-JEPA2系列在上肢运动任务上更强,TimeSformer在手指敲击等节律性任务上仍具竞争力,整体AUC为76.4%–85.3%、准确率为71.5%–80.6%,特异性最高达90在1,888名参与者、32,847段视频上评测七种视频基础模型,VideoPrism在16项任务中10项居首,V-JEPA2-SSv2在翻转手掌任务上取得85.3%的AUC该研究构建了一个来自1,888名参与者(其中727人患帕金森病)的32,847段网络摄像头视频数据集,覆盖16项标准化临床任务,并以冻结特征加线性分类头的方式系统评测了七种视频基础模型(VideoPrism、V-JEPA2及其SSv2变体、ViViT、VideoMAE、VideoMAEv2、TimeSformer),结果显示任务显著性与模型架构高度相关:VideoPrism在视觉言语运动学和面部表情任务上表现最佳,V-JEPA2系列在上肢运动任务上更强,TimeSformer在手指敲击等节律性任务上仍具竞争力,整体AUC为76.4%–85.3%、准确率为71.5%–80.6%,特异性最高达90该研究构建了一个来自1,888名参与者(其中727人患帕金森病)的32,847段网络摄像头视频数据集,覆盖16项标准化临床任务,并以冻结特征加线性分类头的方式系统评测了七种视频基础模型(VideoPrism、V-JEPA2及其SSv2变体、ViViT、VideoMAE、VideoMAEv2、TimeSformer),结果显示任务显著性与模型架构高度相关:VideoPrism在视觉言语运动学和面部表情任务上表现最佳,V-JEPA2系列在上肢运动任务上更强,TimeSformer在手指敲击等节律性任务上仍具竞争力,整体AUC为76.4%–85.3%、准确率为71.5%–80.6%,特异性最高达90