336个前瞻状态配对预测显示:科学解释的预测增益未被确认,但结构化卡片把Tox21重复漂移降低约六成
核心概要
该研究提出“预测信用”协议,用共享干预、预测者与结果的配对预测,在336个前瞻状态(受控学习、12个Tox21端点、24个OpenML任务)中比较描述、匹配解释与供体解释,结果v5冻结判定为不确定、Tox21与OpenML为confirmation_no_go,匹配点精度增益未获确认,但结构化卡片在Tox21把重复漂移降低64.5%与59.1%,研究者撰写的机制正对照把点MAE降低2.60个百分点。
深度剖析
论文提出并执行“预测信用”协议:让同一预测者在同一干预、同一结果上分别接收公开描述、当前状态的匹配解释卡、以及来自另一状态的供体解释卡,用配对差值衡量解释带来的预测增益与局部对齐。 以往的解释评估多针对模型行为可模拟性或忠实性,这里把评估对象换成研究智能体对已执行实验结果的数值预测,并把描述基线、匹配与供体三种上下文放在同一损失下比较。 协议在三个前瞻研究中冻结记录:受控v5共120状态、Tox21共72状态、OpenML共144状态,合计336个前瞻状态与3,708个前瞻调用;所有分配调用按ITT分析,失效响应以确定性回退计入。
冻结判定未支持自然解释的预测信用:v5为不确定,Tox21的预注册ROC AUC区间分数伤害检验未达标(D-M=-.0026,95%区间[-.0174,.0104]),OpenML的联合形成、点等价与可重复性规则也未达标。 与“解释有助于预测”的既有正面报告相比,这里在预注册门槛下给出的是未确认结论,并把未确认定位在供体分辨率与检验门槛上。 Tox21冻结门槛要求两个对比均达.005且单侧下界为正、至少8个端点与4个动作联合为正、每个预算为正、总体完整且各层完整性≥.95,实际仅5/12端点与3/6动作双对比为正,且对比在标签预算间变号。
结构化预测卡主要改变的是重复一致性与不确定性表达,而不是点精度:Tox21中匹配卡与供体卡把Pro重复漂移从.01004降到.00357与.00411(降幅64.5%与59.1%),Flash重放降幅为60.6%与59.2%,但匹配卡点MAE反而从.01823升到.02020。 这把“输出更一致”与“预测更准”分开报告,说明卡片带来的协调效应可以与预测增益脱钩。 Pro与Flash两套结果来自同一批72个Tox21状态;Flash重放为432次调用且各层完整性为1.0,但冻结联合状态为replication_not_supported,唯一未过的是区间分数等价。
已知信号能被预测者吸收:研究者撰写的机制正对照把点MAE从描述基线的6.391降到3.795(相对描述降低2.596个百分点,95%区间[2.314,2.880]),相对配对错误机制降低4.355个百分点;精确信号校准在144/144状态胜出,点值Spearman相关为.99996。 这为协议提供了敏感性上界:当解释包含强且已知的机制信息时,预测确实改善,从而把自然解释的未确认与“预测者完全不使用解释”区分开。 正对照为40个新状态、240次有效Flash预测,结果在提示冻结前计算并对外隐藏;校准为1,440次调用,冻结状态为assay_sensitive。
启示与展望
该协议面向研究智能体基准与科学预测评估:可用于给实验理由打分、比较不同解释接口、以及为成本感知的实验选择提供排序依据。适用场景是干预已执行、结果可测、且能构造匹配与供体解释的设定;受控学习、Tox21分子端点与OpenML表格任务给出了三类示例。对希望复用该框架的读者,冻结记录支持基准再分析与方法比较,正对照与精确信号校准则说明当解释携带强已知信息时协议能检测到增益。
自然解释的预测信用在测试的供体分辨率下仍未确认,因此尚不清楚在更强对齐的供体、更细的机制文本或不同预测者下是否会出现增益。OpenML全卡分配把名义80%区间加宽约21%,覆盖率49.3%对描述与内容的51.4%,区间宽度与覆盖之间的张力仍是开放问题。两次Flash运行在同一批刺激上给出不同的全卡漂移幅度(.00108与.00426),提示接口与运行间差异值得进一步刻画。此外,本总结依据的是论文全文文本,未包含图表与附录中的全部细节,个别数值的完整区间在文本中未完整呈现。
