SignRAG以分层预训练加检索增强强化微调,在CSL-Daily上首次让无gloss手语翻译全面超越有gloss方法
核心概要
SignRAG提出一个面向无gloss手语翻译的统一框架:先用细粒度手语—文本对齐学习语言化手语表征,再与Qwen3-8B联合预训练,随后用仅取自目标域训练集的检索库提供实例级翻译线索,并以结合翻译质量与检索效用奖励的RUG-RFT抑制有害依赖;在CSL-Daily、PHOENIX-2014T、How2Sign、OpenASL四个基准上取得新的最优结果,并在CSL-Daily全部指标上首次由无gloss方法超越有gloss方法。
Figure 1: Motivation. Hierarchical pretraining and retrieval augmentation improve sign-to-language learning. (a) , (b) Comparison of different pretraining strategies. The solid and dashed lines denote the previous state-of-the-art performance under the gloss-free and gloss-based settings, respectively, corresponding to Geo-Sign ( Fish and Bowden, 2026 ) and CV-SLT ( Zhao et al., 2024 ) . (c) Comparison of the semantic distance between generated and ground-truth (GT) texts with and without RAG. Semantic distance is measured using the independent sentence encoder paraphrase-multilingual-MiniLM-L12-v2 . Bars report the mean cosine distance over all samples, with error bars denoting ± \pm SEM. Samples are drawn from the CSL-Daily dev set.
arXiv深度剖析
分层预训练把大规模手语预训练拆成两步:先用双向InfoNCE对比目标与CoCa式骨架到文本目标学习语言化手语表征,再把对齐后的骨架编码器、GELU-MLP投影器与LoRA适配的Qwen3-8B联合预训练。 此前无gloss预训练多围绕T5式编码器—解码器或仅预训练编码器,本文把预训练组织方式改为面向decoder-only LLM的分阶段对齐,并明确以缓解跨模态优化失衡为目标。 在CSL-Daily上,分层预训练达到BLEU-4 29.72、ROUGE-L 58.78,而端到端预训练为9.53与38.70,仅预训练编码器为3.20与22.51;消融显示预训练把SFT基线的ROUGE-L从55.03提升到58.78、BLEU-4从23.46提升到29.72。
检索增强SFT用仅由目标域训练集构建的手语—文本检索库,以注意力加权的帧级手语相似度检索语义相关样本及其译文作为实例级线索,并在训练中施加检索dropout。 已有检索式手语翻译主要面向有gloss设定,本文把检索增强扩展到无gloss设定,并强调检索知识始终来自目标域、验证与测试样本只作查询。 在CSL-Daily上,加入检索把ROUGE-L从58.78提升到60.20、BLEU-4从29.72提升到31.22;检索质量分析显示检索F1与翻译性能随检索数量先升后降,说明过多低相关上下文会干扰翻译。
RUG-RFT在GRPO框架下把句子级质量奖励与检索效用奖励组合,后者用冻结参考策略下的教师强制条件似然差衡量检索带来的置信度增益,只保留正效用并做尺度归一。 标准SFT只优化token级似然,不提供检索是否有益的显式监督;本文把检索效用作为可优化信号,同时抑制对误导性上下文的依赖。 在CSL-Daily上,仅质量奖励为BLEU-4 31.97、仅检索效用奖励为31.66,两者结合达到32.91与ROUGE-L 62.34;chrF从26.93升到28.42、BERTSim从82.10升到82.96,说明增益不限于BLEU/ROUGE;失败案例显示SFT被错误检索带偏而RFT恢复正确译文。
在四个下游基准上系统评测,SignRAG在无额外预训练数据与有外部预训练数据两种设定下均优于现有无gloss最优方法,并在CSL-Daily上超过有gloss方法。 作者称这是首个在CSL-Daily全部报告指标上超过有gloss方法的无gloss方法,并给出模型规模从0.6B到4B、8B时BLEU-4由22.72升至28.58与32.91的扩展趋势。 CSL-Daily上SignRAG-RFT(含外部预训练)为ROUGE-L 62.34、BLEU-4 32.91,高于Geo-Sign的57.97与27.42;OpenASL上为46.91与26.62,高于Uni-Sign的43.22与23.14;How2Sign上为38.5与16.7,高于SSVP-SLT的38.4与15.5;PHOENIX-2014T未使用额外预训练,为53.07与28.63。
启示与展望
该工作面向无gloss手语翻译,适用于有大规模手语—文本预训练语料且目标域训练集可构建检索库的场景;检索库仅由目标域训练集构成,验证与测试样本只作查询,训练时排除查询自身及与查询译文相同的条目。作者指出PHOENIX-2014T因缺少大规模德语手语预训练数据而未使用额外预训练,英文数据集上的增益相对中文数据集更温和。效率方面,在线推理延迟从42.69 ms/样本升至61.98 ms/样本,吞吐从23.42降至16.13样本/秒,峰值显存从23.28升至29.03 GiB/GPU;离线检索在CSL-Daily的18.4K库上为23.88 ms/查询,在OpenASL的95,888库上为705.85 ms/查询。完整训练流程约413.99 GPU小时。
百万级检索尚未验证:作者明确表示未报告BOBSL(约120万句)的直接检索结果,并避免把当前测量外推到百万规模,粗到细检索能否保持穷举检索的精度也未作断言。检索效用奖励依赖冻结参考策略下的似然差,其在不同语言与数据规模下的稳定性仍需更多验证。此外,英文数据集增益较温和,作者将其部分归因于数据集难度、评测协议差异以及YouTube-ASL预训练数据不完整,这些因素对结论外推的影响值得关注。
