跳到主要内容
返回时间线
arXiv来源发表:

分层一致性蒸馏:用前沿大模型生成K个逻辑翻译并按熵分层筛选伪标签,微调小模型后在Pass@K与等价逻辑相似度上取得一致提升

相关研究与后续进展

核心概要

该工作提出基于微调的分层一致性蒸馏方法,用前沿大模型为每个输入生成K个逻辑翻译并按语义等价聚类,再依据熵水平分别采用多数投票(低熵)、LLM-as-a-Judge(中熵)或统一化/弃权(高熵)筛选伪标签,用以微调一个更小的模型,实验显示在Pass@K与作者新提出的等价逻辑相似度指标上均取得显著且一致的提升。

Source-provided article image: Stratified Consistency Distillation for Natural Language Formalization
Figure 1 ·

Figure 1: Synthetic dataset generation pipeline.

arXiv

深度剖析

提出分层一致性蒸馏流程,把自然语言到逻辑公式的翻译从提示工程转向微调范式:先由前沿大模型对同一输入采样K个逻辑翻译,再按语义等价性聚类。 此前方法主要依赖提示工程,难以跨领域与跨输入格式扩展;该工作借鉴其他模型适配与对齐任务中微调的成功经验,将一致性信号转化为可训练的伪标签。 论文摘要层面描述了完整的三步流程(生成K个翻译并聚类、按熵分层选择、微调小模型),并报告实验在Pass@K与等价逻辑相似度上均有提升。

设计按熵水平分层的伪标签选择策略:低熵用多数投票,中熵用LLM-as-a-Judge,高熵用统一化或弃权。 将模型间一致性程度作为选择依据,使不同不确定程度的样本走不同处理路径,而不是对所有样本采用单一聚合规则。 摘要明确列出三种熵层级对应的三种处理方式,属于方法层面的设计说明;具体阈值与各层样本比例未在摘要中给出。

提出新的等价逻辑相似度(Equivalent Logical Similarity)指标,与Pass@K一起用于评估逻辑翻译质量。 在既有Pass@K之外补充了针对逻辑等价性的度量,使评估不局限于最终求解是否通过。 摘要称该指标为作者新提出,并报告两项指标上均有显著且一致的改进;指标的具体定义与计算方式未在摘要中展开。

实验显示微调后的小模型在Pass@K与等价逻辑相似度上均获得显著且一致的提升,表明一致性蒸馏可推进逻辑翻译。 把提升来源定位为蒸馏得到的伪标签监督,而非推理时的提示设计,从而指向可跨领域、跨输入格式扩展的路径。 摘要以“significant and consistent improvements”概括实验结果,未给出具体数值、数据集名称或基线对比细节。

启示与展望

该工作面向需要把自然语言转换为逻辑公式的神经符号推理场景,适用于希望以微调小模型替代逐任务提示工程的研究者与工程团队;其方法设定是先用前沿大模型生成K个翻译并聚类,再按熵分层筛选伪标签,最后微调更小的模型,因此收益前提是能够调用前沿大模型进行批量采样。摘要所述的提升是在Pass@K与等价逻辑相似度两项指标上,适用于逻辑翻译质量的评估语境。

摘要未给出K的取值、熵分层的具体阈值、所用数据集与基线、以及Pass@K与等价逻辑相似度的具体数值,因此提升幅度与适用条件仍需查阅正文;等价逻辑相似度的定义与计算方式也需在正文中确认。此外,高熵情形下的“统一化/弃权”如何影响最终训练样本分布,以及伪标签错误在微调中的传播程度,属于读者可继续关注的问题。

来源