无需模型:文本熵率过滤在六代QLoRA迭代微调中带来+42%唯一三元组、+30%词表并降低19%重复
核心概要
该工作提出一种完全基于原始文本、无需任何模型的非参数Kontoyiannis熵率估计器h_k作为训练数据过滤器,在Llama-3.1-8B的六代QLoRA全合成单谱系崩溃实验中,h_k过滤使唯一三元组增加42%、词表增加30%、重复降低19%(均p<0.001),而依赖模型对数概率的过滤基线在任何指标上均无显著文本多样性收益(p>0.23);并在4个领域、2种温度、2组生成器-评分器模型对、1520篇生成文档上验证h_k可作为跨领域熵代理(β=0.924,R²=0.746)与崩溃检测器(ρ=+0.454,p<0.0001)。
Figure 1 : Filtering on text-only entropy preserves diversity; logprob-based filtering does not. (a) Kontoyiannis entropy rate H ^ K \hat{H}_{K} across six fine-tuning generations of Llama-3.1-8B-Instruct under three training-data conditions: unfiltered (rapid collapse), H L H_{L} -filtered (intermediate), and H ^ K \hat{H}_{K} -filtered (slowest decline). Shaded bands: ± 1 \pm 1 SEM ( n = 80 n=80 documents per generation). (b) Percentage change relative to the unfiltered baseline at generation 6 for three text-diversity metrics (Distinct-3, Vocabulary size, Rep-4). Error bars: bootstrap 95% CIs. H ^ K \hat{H}_{K} -based filtering yields highly significant improvements on all three metrics ( ∗ ∗ ∗ p < 0.001 {}^{***}p<0.001 ), whereas H L H_{L} -based filtering is non-significant on all three.
arXiv深度剖析
提出并验证了一种无需任何模型、仅从原始文本通过匹配长度统计计算的非参数Kontoyiannis熵率估计器h_k,可作为训练数据过滤器缓解迭代微调中的模型崩溃。 现有缓解方法要么需要模型对数概率、外部预言机,要么需要持续获取真实人类数据;该工作表明仅凭原始文本的熵率估计即可实现过滤,且在全合成单谱系设定下表现优于最成熟的依赖模型访问的对数概率过滤基线。 在Llama-3.1-8B上进行六代QLoRA崩溃实验,h_k过滤带来+42%唯一三元组、+30%词表、-19%重复(均p<0.001),而对数概率过滤在任何指标上均无显著收益(p>0.23)。
h_k可作为跨领域熵代理与崩溃检测器,在多种生成条件下保持稳定关联。 将信息论熵率估计从理论工具扩展为可跨领域使用的文本多样性代理与崩溃信号,覆盖4个领域、2种温度、2组生成器-评分器模型对、1520篇生成文档。 跨领域熵代理回归β=0.924、R²=0.746;崩溃检测相关性ρ=+0.454、p<0.0001。
结果表明信息论方法用于崩溃缓解是高效的,并为维持多智能体多样性提示了新方向。 将崩溃缓解的依赖从模型内部信号转向纯文本统计,降低了对外部预言机、模型对数概率或持续真实数据的依赖。 基于上述六代QLoRA实验与跨4领域、2温度、2模型对、1520篇文档的验证结果。
启示与展望
该结果适用于全合成、单谱系的迭代微调设定,即在没有真实人类数据回流、仅用模型自身生成数据反复训练的场景下,h_k过滤可作为一种轻量、无需模型访问的数据筛选手段。对需要在训练管线中维持文本多样性、又无法获取模型对数概率或外部预言机的团队,这一方法提供了可操作的替代方案;其跨领域熵代理与崩溃检测特性也适用于对生成文档进行多样性监控与早期崩溃预警。
当前仅基于摘要,无法确认h_k估计器的具体匹配长度参数、过滤阈值选择、计算开销,以及六代实验中每代的样本规模与数据构成;跨领域验证中4个领域的具体名称、2种温度取值、2组生成器-评分器模型对的身份也未在摘要中给出。此外,摘要未说明该方法在混合真实数据或非单谱系设定下的表现,这些是读者在采用前需要进一步核实的开放问题。
