arXiv 2026年10月6日作者提出一个进化框架,用LLM迭代生成并精炼自然语言二值特征(rubric),再由LLM对样本打分、训练逻辑回归等透明分类器;在AG News、GoEmotions与HELOC三个基准上,进化特征比单次生成rubric平均提升+2.9个百分点,并在三个任务中的两个上超过零样本LLM直接分类,其中HELOC上零样本LLM仅50.7%(接近随机且强烈偏向单一类别),而进化特征达到69.0%且各类别预测均衡、决策逻辑可审计。作者提出一个进化框架,用LLM迭代生成并精炼自然语言二值特征(rubric),再由LLM对样本打分、训练逻辑回归等透明分类器;在AG News、GoEmotions与HELOC三个基准上,进化特征比单次生成rubric平均提升+2.9个百分点,并在三个任务中的两个上超过零样本LLM直接分类,其中HELOC上零样本LLM仅50.7%(接近随机且强烈偏向单一类别),而进化特征达到69.0%且各类别预测均衡、决策逻辑可审计。进化式LLM特征发现让信用风险分类从随机水平提升到69.0%并暴露零样本模型的单类偏置作者提出一个进化框架,用LLM迭代生成并精炼自然语言二值特征(rubric),再由LLM对样本打分、训练逻辑回归等透明分类器;在AG News、GoEmotions与HELOC三个基准上,进化特征比单次生成rubric平均提升+2.9个百分点,并在三个任务中的两个上超过零样本LLM直接分类,其中HELOC上零样本LLM仅50.7%(接近随机且强烈偏向单一类别),而进化特征达到69.0%且各类别预测均衡、决策逻辑可审计。作者提出一个进化框架,用LLM迭代生成并精炼自然语言二值特征(rubric),再由LLM对样本打分、训练逻辑回归等透明分类器;在AG News、GoEmotions与HELOC三个基准上,进化特征比单次生成rubric平均提升+2.9个百分点,并在三个任务中的两个上超过零样本LLM直接分类,其中HELOC上零样本LLM仅50.7%(接近随机且强烈偏向单一类别),而进化特征达到69.0%且各类别预测均衡、决策逻辑可审计。