arXiv 2026年9月9日该工作把通用视频世界模型V-JEPA 2在约62小时无标注声道实时MRI视频上继续自监督预训练,得到冻结的Arti-JEPA编码器,并在音素预测、口吃流畅/不流畅分类与舌切除术前术后迁移三类任务上评估,发现时间视频先验明显优于逐帧图像编码器、潜空间预测至少不弱于像素重建、域适配对跨域音素预测约翻倍Cohen's κ但对二分类口吃检测帮助有限,且术后音素信号仍可部分解码。该工作把通用视频世界模型V-JEPA 2在约62小时无标注声道实时MRI视频上继续自监督预训练,得到冻结的Arti-JEPA编码器,并在音素预测、口吃流畅/不流畅分类与舌切除术前术后迁移三类任务上评估,发现时间视频先验明显优于逐帧图像编码器、潜空间预测至少不弱于像素重建、域适配对跨域音素预测约翻倍Cohen's κ但对二分类口吃检测帮助有限,且术后音素信号仍可部分解码。Arti-JEPA:将视频世界模型适配到声道实时MRI以分析言语产生该工作把通用视频世界模型V-JEPA 2在约62小时无标注声道实时MRI视频上继续自监督预训练,得到冻结的Arti-JEPA编码器,并在音素预测、口吃流畅/不流畅分类与舌切除术前术后迁移三类任务上评估,发现时间视频先验明显优于逐帧图像编码器、潜空间预测至少不弱于像素重建、域适配对跨域音素预测约翻倍Cohen's κ但对二分类口吃检测帮助有限,且术后音素信号仍可部分解码。该工作把通用视频世界模型V-JEPA 2在约62小时无标注声道实时MRI视频上继续自监督预训练,得到冻结的Arti-JEPA编码器,并在音素预测、口吃流畅/不流畅分类与舌切除术前术后迁移三类任务上评估,发现时间视频先验明显优于逐帧图像编码器、潜空间预测至少不弱于像素重建、域适配对跨域音素预测约翻倍Cohen's κ但对二分类口吃检测帮助有限,且术后音素信号仍可部分解码。