arXiv 2026年10月6日该研究在多智能体假设生成流程中,固定起始假设并重放下游流程,用LLM评判配对假设是否描述同一机制:从0轮到1轮自我批判带来34.5个百分点的额外机制分歧,而1轮到5轮仅增加1.3个百分点;在受控扰动下,三种等价规则对保义改写均不变,但当起始事件被替换时,LLM评判将83%的配对判为不同机制,TF-IDF为0%、嵌入为8%,仅改变评判标准即可使该比例从38%升至96%。该研究在多智能体假设生成流程中,固定起始假设并重放下游流程,用LLM评判配对假设是否描述同一机制:从0轮到1轮自我批判带来34.5个百分点的额外机制分歧,而1轮到5轮仅增加1.3个百分点;在受控扰动下,三种等价规则对保义改写均不变,但当起始事件被替换时,LLM评判将83%的配对判为不同机制,TF-IDF为0%、嵌入为8%,仅改变评判标准即可使该比例从38%升至96%。多智能体假设生成中,首轮自我批判带来34.5个百分点机制分歧,而等价判定规则本身决定多样性测量该研究在多智能体假设生成流程中,固定起始假设并重放下游流程,用LLM评判配对假设是否描述同一机制:从0轮到1轮自我批判带来34.5个百分点的额外机制分歧,而1轮到5轮仅增加1.3个百分点;在受控扰动下,三种等价规则对保义改写均不变,但当起始事件被替换时,LLM评判将83%的配对判为不同机制,TF-IDF为0%、嵌入为8%,仅改变评判标准即可使该比例从38%升至96%。该研究在多智能体假设生成流程中,固定起始假设并重放下游流程,用LLM评判配对假设是否描述同一机制:从0轮到1轮自我批判带来34.5个百分点的额外机制分歧,而1轮到5轮仅增加1.3个百分点;在受控扰动下,三种等价规则对保义改写均不变,但当起始事件被替换时,LLM评判将83%的配对判为不同机制,TF-IDF为0%、嵌入为8%,仅改变评判标准即可使该比例从38%升至96%。