跳到主要内容
返回时间线
arXiv来源发表:

用一对小型专用模型在推理时调整大模型 logits,可在不重训前沿模型的前提下移除金融预测中的前视偏差

核心概要

该工作针对大语言模型因在长时间序列数据上训练而在金融预测任务中产生前视偏差、且从头重训前沿模型以设定知识截止点代价过高的问题,提出一种快速、有效且低成本的替代方案:在推理阶段用一对较小的专用模型——一个在应被遗忘的信息上微调、另一个在应被保留的信息上微调——来调整大型基础模型的 logits 以引导生成,并报告该方法能有效移除逐字知识与语义知识、纠正偏差,且优于此前的方法。

Source-provided article image: A Fast and Effective Solution to the Problem of Look-ahead Bias in LLMs
Figure 1 ·

Figure 1 : MUSE Results: Target is the model to which unlearning is applied. Retrain is the best—but most costly—result of retraining from scratch. Closer to Retrain is better.

arXiv

深度剖析

提出一种在推理阶段引导生成的方法,通过一对较小的专用模型调整大型基础模型的 logits,从而在不重训前沿模型的情况下处理前视偏差。 相对于依赖从头重训前沿模型并设定特定知识截止点的做法,该方案把知识控制从训练阶段移到推理阶段,因而被描述为快速、有效且低成本。 摘要层面给出方法机制与定位,未提供具体实验设置、数据集或量化指标。

该方法被报告能有效移除逐字知识与语义知识,并纠正偏差。 摘要同时强调逐字层面与语义层面的知识移除,说明其目标不止于表面文本的抑制。 属于作者在摘要中的自述结论,缺少可核对的数值与对照细节。

该方法被报告优于此前的方法。 把该方案与既有方法放在同一比较框架下,主张其在效果上更优。 摘要仅给出比较性结论,未列出基线名称、评测任务或效应量。

启示与展望

该结果面向需要在金融预测任务中开展回测、又不愿或无法从头重训前沿模型的研究者与从业者,其设定是:在推理阶段对大型基础模型的 logits 施加由一对小型专用模型给出的调整,一个模型对应应被遗忘的信息,另一个对应应被保留的信息。它使知识截止点的控制从训练环节前移到生成环节,从而为低成本地构造可用于回测的模型行为提供了一条路径。

由于当前读取范围仅为摘要,缺少数据集、基线方法、评测指标与效应量等细节,无法判断“有效移除逐字与语义知识”“纠正偏差”“优于此前方法”的具体程度与适用条件。读者可关注:该方法在不同模型规模与不同金融任务上的表现、遗忘与保留两类专用模型之间的权衡、以及推理时调整 logits 对模型其他能力的附带影响。

来源