跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

多智能体假设生成中,首轮自我批判带来34.5个百分点机制分歧,而等价判定规则本身决定多样性测量

该研究在多智能体假设生成流程中,固定起始假设并重放下游流程,用LLM评判配对假设是否描述同一机制:从0轮到1轮自我批判带来34.5个百分点的额外机制分歧,而1轮到5轮仅增加1.3个百分点;在受控扰动下,三种等价规则对保义改写均不变,但当起始事件被替换时,LLM评判将83%的配对判为不同机制,TF-IDF为0%、嵌入为8%,仅改变评判标准即可使该比例从38%升至96%。