跳到主要内容
返回时间线
arXiv来源发表:

CISE 用共形区间奖励约束自演化搜索,在材料科学三项任务中返回的候选全部为高保真真阳性

相关研究与后续进展

核心概要

该工作提出 Conformal Interval-Driven Self-Evolution(CISE),用条件共形推断与逐迭代在线密度比估计为每个候选构建奖励区间,以保守的区间奖励驱动演化反馈、并仅在所有必需性质区间完全落入可行域时返回候选,在材料科学三项自演化搜索任务中,CISE 返回的候选在高保真评估下全部为真阳性,而基线返回更多候选但包含假阳性。

Source-provided article image: Reliable Self-Evolution with Imperfect Proxy Rewards
Figure 1 ·

Figure 1: Overview of CISE. Offline, we fit the conditional proxy-error quantile using 𝒟 fit \mathcal{D}_{\mathrm{fit}} , 𝒟 cal \mathcal{D}_{\mathrm{cal}} provides calibration scores, and 𝒟 src \mathcal{D}_{\mathrm{src}} provides the source reference for density-ratio estimation. During evolution, unlabeled probes are used to estimate the current distribution shift, which is incorporated into conditional conformal inference to construct candidate-specific reward intervals. These intervals guide subsequent evolution and candidates are returned only when the entire interval satisfies the task constraint.

arXiv

深度剖析

提出 CISE,用条件共形推断为每个候选构建候选专属的奖励区间,并配合逐迭代在线密度比估计来应对迭代间的分布变化。 相对于直接使用低成本代理奖励进行自演化搜索的做法,该方法把点估计奖励替换为统计校准的区间,使反馈信号本身带有不确定性刻画。 方法描述与理论部分给出固定迭代次数下的覆盖性结果,其成立依赖显式的独立性与协变量漂移假设。

CISE 在演化反馈中使用保守的区间奖励,并且只在所有必需性质区间完全落在各自可行域内时才返回候选。 这改变了自演化搜索的筛选准则:从“代理分数高即入选”变为“区间整体可行才入选”,从而抑制代理奖励把不可行候选打高分造成的假阳性。 该机制在材料科学三项自演化搜索任务上进行了评估,报告的结果是 CISE 返回的候选在高保真评估下全部为真阳性。

在材料科学三项自演化搜索任务中,CISE 返回的候选全部为真阳性,而基线返回更多候选但包含假阳性。 结果把评价重点从候选数量转向候选精度,说明在下游验证预算有限时,更小但更精确的候选清单具有实际价值。 证据来自三项任务的实验对比,摘要层面报告的是真阳性与假阳性的定性差异,未给出具体样本量或数值指标。

启示与展望

该工作面向的是高保真评估代价过高、只能使用低成本代理奖励的自演化搜索场景,尤其是需要同时满足多项性质约束的候选发现任务,材料科学的三项任务是其评估载体。其覆盖性结论在显式的独立性与协变量漂移假设下成立,因此适用性取决于这些假设与目标领域迭代分布变化的匹配程度。对读者而言,这意味着当验证预算有限、且假阳性代价高于漏掉部分候选时,CISE 式的区间筛选思路最值得借鉴;它提供的是更小更精确的候选清单,而非更大规模的候选产出。

摘要层面未给出三项材料科学任务的具体样本量、候选数量、高保真评估指标与效应量,因此“全部为真阳性”的规模与统计稳健性仍需在正文中确认。固定迭代覆盖性结果依赖独立性与协变量漂移假设,这些假设在真实迭代搜索中的偏离程度、以及在线密度比估计的稳定性,是读者需要继续关注的问题。此外,保守区间奖励可能减少返回候选的数量,其与搜索效率之间的权衡在摘要中未展开,属于可进一步观察的方向。

来源