跳到主要内容
返回时间线
arXiv来源发表:

进化式LLM特征发现让信用风险分类从随机水平提升到69.0%并暴露零样本模型的单类偏置

相关研究与后续进展

核心概要

作者提出一个进化框架,用LLM迭代生成并精炼自然语言二值特征(rubric),再由LLM对样本打分、训练逻辑回归等透明分类器;在AG News、GoEmotions与HELOC三个基准上,进化特征比单次生成rubric平均提升+2.9个百分点,并在三个任务中的两个上超过零样本LLM直接分类,其中HELOC上零样本LLM仅50.7%(接近随机且强烈偏向单一类别),而进化特征达到69.0%且各类别预测均衡、决策逻辑可审计。

Source-provided article image: Evolving LLM-Generated Features for Interpretable Classification
Figure 3 ·

Figure 3 : Cross-validation accuracy over evolutionary iterations. Solid lines show best-accepted CV score; shaded regions show the range across 3 seeds. Evolution makes decisive improvements early in the search on tasks where the initial rubric is suboptimal.

arXiv

深度剖析

提出以LLM同时充当变异算子与适应度评估者的进化式特征发现流程:每轮用当前rubric抽取二值特征、做交叉验证,再依据分类错误、每类激活率与特征消融分数,让生成器保留关键特征、替换低效特征并针对混淆类别对提出新特征。 此前的LLM特征生成方法(如Singh等、Balek等)产出一次性静态特征集,不随训练中观察到的错误模式调整;本文把特征集本身作为可迭代优化的对象,且优化的是透明分类器所用的特征,而非喂给LLM分类器的提示词。 方法在三个基准上以相同数据划分对比TF-IDF、单次生成rubric与零样本LLM分类,并在3个独立分层划分上报告均值与标准差;消融分数与每类激活率作为显式反馈信号写入进化提示词。

进化特征在三个基准上取得最佳平均准确率(63.8%),较单次生成rubric平均提升+2.9个百分点,最大增益出现在GoEmotions(+6.3个百分点)与HELOC(+3.7个百分点)。 单次生成rubric平均为60.9%,零样本LLM分类平均为59.7%;进化特征在三个任务中的两个上同时超过零样本LLM并保持完全可解释。 结果以均值±标准差形式报告,进化特征在GoEmotions上方差明显更低(1.6对6.2),提示搜索在初始rubric质量随划分波动时仍产出更稳健的特征集。

在HELOC信用风险任务上,零样本LLM仅50.7%准确率、接近随机,且跨随机种子有77%–85%的预测落在“at_risk”一类,导致该类召回0.80–0.84而另一类仅0.14–0.26;进化特征达到69.0%,两类F1均为0.64–0.71。 该失败在总体准确率上不可见,只有按类别审计才暴露;可解释特征层使这种系统性单类偏置成为可检查对象,而黑箱基线无法提供同等审计入口。 对比基于相同数据划分与多个随机种子,并给出每类召回与F1区间;进化出的HELOC rubric为10条自然语言阈值规则,附有逻辑回归系数。

进化在标签边界无法从类别名推断(GoEmotions的7类Ekman情绪映射)或LLM缺乏领域推理能力(HELOC的结构化数值信用数据)时收益最大;当类别自解释且分离良好(AG News)时,零样本LLM以89.7%领先,进化反而未超过初始rubric(81.3%对82.7%)。 这给出了该方法适用条件的经验刻画,而非笼统宣称进化总是更好;同时指出收敛多发生在前5个被接受的rubric内,建议10–15轮迭代即可。 收敛轨迹显示GoEmotions首个被接受rubric即带来+10至+12个百分点提升后进入平台期,HELOC交叉验证从0.65–0.69升至0.69–0.74后趋平;成本上训练约需5,000次LLM调用,但推理时每样本仅1次调用,与零样本特征方法相同。

启示与展望

该框架适用于需要可审计决策逻辑的分类任务,尤其是标签边界无法从类别名推断、或LLM零样本领域推理不可靠的场景;输入可以是自然语言文本,也可以是序列化为文本的结构化数据。对希望获得逐条可核对决策依据的从业者(如信贷审核、受监管行业的模型评估者),它提供了从自然语言特征定义、二值特征取值到逻辑回归系数的端到端检查路径。作者建议10–15轮迭代即可覆盖大部分收益,且推理阶段每样本仅需一次LLM调用,与零样本特征方法运营成本相同。

特征取值由LLM评判器抽取,抽取误差会直接进入分类器训练所用的特征矩阵,因此抽取准确率需要与端任务准确率分开验证;本文仅使用单一LLM,跨模型泛化仍是开放问题;二值特征表示对细粒度任务构成瓶颈;在金融与医疗数据上的更广泛评估、以及将生成与L1正则化选择解耦的特征池架构,是作者提出的后续方向。此外,HELOC解释在形式上对齐《平等信贷机会法》所要求的不利行动通知,但其法律有效性还需公平性、代理歧视与领域专家审计,超出本文范围。

来源