RT-SFT 用往返翻译把单语语料变成伪平行数据,在四个风格域上超过少样本上下文学习
相关研究与后续进展核心概要
该工作提出 RT-SFT:利用神经机器翻译往返翻译(经枢轴语言)作为大规模、无需任务训练的“去风格”归一化器,把单语目标风格语料转成伪平行语料,再用 LoRA 微调指令微调大模型作为风格化器,并在测试时对查询施加同一归一化以保持分布一致;在四个风格域上,RT-SFT 以较大幅度优于少样本上下文学习等现有方法,并报告了面向术语与命名规范严格的专家风格域的有效检索增强方法。
Figure 1: Our proposed workflow for finetuning large language models (LLMs) for text style transfer (TST) using only non-parallel data in the target domain. A bilingual general-domain parallel dataset is used to train a pair of neural machine translation (NMT) models capable of translating between English and a pivot language. We then obtain RT-normalized texts of the original in-domain texts by roundtrip translating the in-domain set with the NMT models. This enables supervised finetuning of LLMs for TST, where we finetune LLMs for RT-normalized-domain to target-domain transfer using the synthetic parallel corpus.
arXiv深度剖析
把归一化从推理时的补丁变成数据生成工具:往返翻译经枢轴语言可剥离风格信号而保留内容,从而由单语目标风格语料生成伪平行语料。 以往做法是用轻量、任务专用的复述器只在测试时做归一化,再配一个相应较小的风格化器;这里改用已在数亿句通用领域句对上训练好的神经机器翻译系统作为现成的、大规模的去风格归一化器,无需任何任务专用训练。 依据为摘要中陈述的观察与流程:神经机器翻译在数百百万通用领域句对上训练,保留内容而回归通用措辞;往返翻译产生伪平行语料。原文未给出具体语料规模、语言对或人工评估细节。
RT-SFT 在四个风格域上以较大幅度超过少样本上下文学习等当前最优方法。 相对少样本上下文学习这类无需训练的方法,RT-SFT 通过 LoRA 微调指令微调大模型获得风格化能力,并在同一归一化下保持测试查询与训练分布一致。 摘要报告“across four style domains”且“by considerable margins”,但未在可见文本中给出具体指标、基线清单或统计检验。
对术语与命名规范严格的专家风格域,报告了有效的检索增强方法。 把检索增强引入风格迁移,用于处理专家域中必须遵守的术语与命名约定,这是通用风格迁移方法通常不专门处理的一类约束。 摘要仅称“report on effective retrieval augmentation methods”,未给出检索源、检索粒度或消融结果。
启示与展望
该结果面向需要目标风格改写且只有单语目标风格语料可用的场景,适用于能提供可靠枢轴语言往返翻译的语种与领域;对术语与命名规范严格的专家风格域,方法还包含检索增强这一配套手段。它把归一化定位为训练数据生成步骤,因此其收益取决于所用机器翻译系统是否确实保留内容并回归通用措辞。
可见文本为摘要级内容,缺少具体评价指标、基线清单、四个风格域的名称、语料与语言对规模、人工评估与统计显著性,因此无法判断“较大幅度”的具体量级。检索增强的检索源、粒度与消融也未在可见文本中说明。往返翻译在内容保留与风格剥离之间的权衡、以及枢轴语言选择的影响,仍是需要进一步观察的开放问题。
