跳到主要内容
返回时间线
arXiv来源发表:

Arti-JEPA:将视频世界模型适配到声道实时MRI以分析言语产生

核心概要

该工作把通用视频世界模型V-JEPA 2在约62小时无标注声道实时MRI视频上继续自监督预训练,得到冻结的Arti-JEPA编码器,并在音素预测、口吃流畅/不流畅分类与舌切除术前术后迁移三类任务上评估,发现时间视频先验明显优于逐帧图像编码器、潜空间预测至少不弱于像素重建、域适配对跨域音素预测约翻倍Cohen's κ但对二分类口吃检测帮助有限,且术后音素信号仍可部分解码。

Source-provided article image: Arti-JEPA: Adapting Video World Model to Real-Time MRI of the Vocal Tract for Speech-Production Analysis
Figure 1 ·

Figure 1 : Arti-JEPA framework overview. Left: domain-adaptive pretraining on the largest available pool of vocal-tract real-time MRI, approximately 50 hours of high-frame-rate video, using a masked latent-prediction objective. Right: the resulting encoder is frozen and evaluated on a set of downstream tasks that probe how far the learned representation generalizes.

arXiv

深度剖析

提出无标签的Arti-JEPA适配配方:在约62小时、92名说话人的无标注rtMRI声道视频上继续V-JEPA 2的掩码潜预测目标,并用与帧率无关的重采样把61–99 fps的异质来源统一到50 fps网格,同时全程用无标签指标监测表征坍缩。 此前JEPA与VideoMAE视频模型均未被适配到构音rtMRI;该工作把通用视频先验以约10 GPU天的低成本重新指向构音流形,而非从头训练。 预训练语料为USC 75-Speaker约19.3小时与在研纵向语料约42.6小时,合计约61.9小时、9,353段视频、92名说话人;坍缩监测显示特征标准差约1.42、有效秩约40/1024、平均绝对余弦约0.44,损失稳定在约0.40平台,作者据此判断未发生坍缩。

在冻结表征上建立音素识别与分类基准:时间视频先验显著优于逐帧图像编码器,且在同等适配下潜预测(V-JEPA)至少与像素重建(VideoMAE)相当,在细粒度音素上占优。 把'潜预测还是像素重建更适合构音建模'这一对比作为受控问题提出,并在同一ViT-L骨干、同一探针下比较六种冻结编码器。 帧级跨域测试中,适配后的Arti-JEPA达到κ=0.505(域内)与0.352(跨域),高于公开V-JEPA 2的0.362与0.156;段级分类中Arti-JEPA在元音、辅音、方式、部位四组上均领先,跨域元音macro-F1为0.516,而原始编码器在未见说话人上约损失一半macro-F1、适配后约损失十分之一。

域适配的效果依任务而定:它使跨域音素预测的κ大致翻倍,但对流畅/不流畅二分类帮助有限,且区分口吃类型明显难于二分类检测。 把同一冻结表征同时用于典型言语与两类临床人群,直接比较适配收益在不同任务上的差异,而非只报告单一任务提升。 口吃二分类中Arti-JEPA T-SSL为0.817 macro-F1,对比通用V-JEPA 2的0.789,四种编码器全部落在0.03的带宽内;类型三分类的合并macro-F1降至0.381、κ降至0.110,而三类随机水平为0.333,召回在重复与延长上分别降至0.183与0.318。

舌切除迁移分析显示:术前即已出现明显性能下降,术后效应在说话人之间差异很大,且粗粒度构音结构比细粒度音素身份更稳健。 用冻结探针在术前/术后配对采集上做推理,把性能下降分解为说话人外推、扫描协议与病理/手术等逐级条件,并给出哪些音素对比坍缩或重组的混淆结构。 元音κ从域内0.543降至典型跨域0.470,再降至术前0.282;手术带来的合并额外下降仅约0.029。部位类别最稳健,术前κ=0.545高于典型跨域锚点0.408;稳健性排序为部位>方式>辅音身份>元音身份。spk1与spk2术后元音与辅音身份分类改善,spk3(切除范围最大)在四项任务上均大幅下降。

启示与展望

该工作面向以英语为记录语言、单层灰度正中矢状面、约84×84至104×104像素的rtMRI场景,编码器在冻结状态下配合轻量探针使用,适用于典型说话人的音素读出、口吃流畅性检测以及舌切除术前术后的迁移分析。作者指出,其价值在于把冻结编码器当作可复用的测量工具,用于构音与临床言语科学中标注稀缺的场合;后续可扩展的方向包括在更大算力下重跑适配、为舌切除队列补充匹配的域内对照、纳入儿童言语与英语之外的语言,以及比较同步音频与rtMRI分类器以判断构音成像相对声学额外提供了什么信息。

读者仍需留意:舌切除队列仅三名受试者,其中只有一名接受了大范围舌切除,因此无法系统建立切除范围或位置与具体音素对比损失之间的对应关系;术前与术后采集的刺激材料不同,逐说话人的术前到术后差异存在混淆,作者因此只依赖段级任务。口吃部分受显存限制把每个事件固定采样为32帧,长时不流畅可能被欠采样,且类别先验在留出说话人上不匹配,导致类型分类的召回偏低。此外,声学条件化潜空间推演的尝试得到的是负结果,在0.64秒片段上仅靠视频外推即可求解下一潜变量目标,如何让声学成为必要条件仍是开放问题。文中还提到,部分图表与附录细节在本次可读文本中以引用形式出现,若需核对逐类混淆结构,应回到原文图表。

来源