多智能体假设生成中,首轮自我批判带来34.5个百分点机制分歧,而等价判定规则本身决定多样性测量
相关研究与后续进展核心概要
该研究在多智能体假设生成流程中,固定起始假设并重放下游流程,用LLM评判配对假设是否描述同一机制:从0轮到1轮自我批判带来34.5个百分点的额外机制分歧,而1轮到5轮仅增加1.3个百分点;在受控扰动下,三种等价规则对保义改写均不变,但当起始事件被替换时,LLM评判将83%的配对判为不同机制,TF-IDF为0%、嵌入为8%,仅改变评判标准即可使该比例从38%升至96%。
Figure 1: Multi-agent workflow for mechanistic hypothesis generation used in this study. An unexpected experimental finding initiates evidence retrieval. Candidate hypotheses are generated in parallel and iteratively refined through self-critique loops between proposer and critic agents. The resulting hypotheses are then consolidated into a final report.
arXiv深度剖析
自我批判深度的主要效应出现在首次引入批判时:相对匹配的同深度重跑,0到1轮产生34.5个百分点的额外机制分歧,1到5轮仅增加1.3个百分点,0到5轮合计39.8个百分点。 以往对迭代精炼的评估多依赖金标准或任务指标,而开放假设生成缺乏这种参照;该工作以同深度重跑作为变异基线,把批判深度效应与运行间随机性分离。 四个专有实例、每个批判深度重复五次,共60次运行、420个运行对比较、4,863个匹配假设对;跨三种评判模型该模式一致,0到1轮额外分歧为34.5至37.3个百分点。
三种等价规则对保义编辑(仅改写措辞、或使用经审核的生物学别名改写因果链)均判为同一机制,但在替换起始事件时出现分化:LLM评判将83%的配对判为不同机制,嵌入为8%,TF-IDF为0%。 该工作用意图已知的受控扰动对比较方法进行审计,而非仅报告方法间的一致性,从而揭示全局相似度方法在单个因果关键组件改变时可能不敏感。 扰动变体经确定性结构校验后保留;在选定阈值下三种方法原始配对一致率为85%至89%,且没有任何阈值能使方法间完全一致。
LLM评判的判定依赖提示规范:仅改变定义“同一机制”的评判标准,替换起始事件的判异比例即从无标准提示的38%升至完整标准的83%、分步标准的96%;分步标准也将中间步骤替换的判异比例从13%提高到21%。 这把评判标准从隐含设定变为显式实验变量,说明同一模型在不同标准下对因果差异的敏感度不同。 三种提示变体在相同受控扰动对上比较,固定评判模型、温度、采样与输入渲染;同序重复不改变任何判定,反转呈现顺序改变5.6%的受控配对判定。
配对等价判定是两项评估问题的共同测量基础:它既决定自我批判效应的估计,也决定生成假设集合的多样性计数。 以往工作中偏好排序与去重使用不同比较规则,该工作指出两者共享同一“同/异”判定,因而测量选择会同时影响两类结论。 形式化定义将分歧定义为匹配对中被判为不同机制的占比,将多样性定义为按等价规则聚类后的簇数,并在同一批假设上比较三种规则。
启示与展望
该结果适用于在无实验真值时评估多智能体机制假设生成的工作流:给定意外实验发现,流程生成从起始事件经中间生物步骤到该发现的因果链,并在合并前经自我批判修订。它面向需要报告精炼效应或输出多样性的系统开发者与评估者,在固定起始假设、仅改变批判深度并重放下游流程的设置下成立。所提出的受控扰动审计可用于比较不同等价规则与评判标准,帮助选择与报告测量方式。
生成假设没有生物学真值,因此结果刻画的是工作流输出与评估方法的行为,而非批判是否提升科学正确性,或某种分组是否对应生物学上正确的机制。测量多样性仍对评估者设计敏感:TF-IDF与嵌入结果依赖相似度阈值,LLM同/异判定随评判模型、提示规范与呈现顺序变化;由于评判者与生成者属于同一大类LLM,跨评判模型的一致性不能排除自偏好或对表面属性的敏感性等共同偏差。受控扰动只覆盖有限的语义与因果变化,更系统的扰动集与独立制定的评判标准将有助于判断评估者捕捉哪些因果区分及其稳健性。此外,事后评估依赖大量LLM配对比较,随假设集增大计算成本上升。
