12个LLM智能体在三个领域的端到端搜索中一致偏好特定来源,偏好可压过需求满足度,隐藏来源或补全信息可削弱该偏好
相关研究与后续进展核心概要
该研究在三个领域用12个智能体模型开展端到端搜索,发现每个模型都偏好某些来源、回避另一些来源且彼此高度一致;当来自偏好来源的商品少满足一项需求、而更优商品来自非偏好来源时,前者约三分之二的情况下仍被选中,反向情形几乎不发生;隐藏来源信息会削弱偏好,重新标注为偏好来源会提高选中率;训练奖励更优商品可使来源成为需求满足的捷径,缺失信息会触发对来源的成见,补全缺失信息或用提示对抗成见可降低来源偏好。
Figure 1: Overview. Top: agent setting (§ 2 ). Bottom: measuring source preference (§ 3 ).
arXiv深度剖析
在三个领域的端到端搜索中,12个智能体模型均表现出对特定来源的偏好与回避,且各模型对哪些来源受偏好高度一致。 此前对来源偏好的考察多不在端到端搜索设定下,也未系统比较多个模型在多个领域的一致性;该工作把来源偏好放到端到端搜索中,并在同一位置、同样满足需求的条件下比较不同来源的商品。 基于12个智能体模型、三个领域的对比实验,比较对象为位置相同且满足相同需求的不同来源商品。
来源偏好可以压过需求满足程度:来自偏好来源但少满足一项需求的商品约三分之二的情况下被选中,而更优商品来自非偏好来源时几乎不被选中。 这给出了偏好与需求满足度之间的直接权衡证据,说明选择结果并非仅由需求满足度决定。 以“少满足一项需求”与“更优”两种商品的对照选择率作为量化指标,报告约三分之二与几乎不发生两种情形。
标识商品来源的信息本身即影响选择:隐藏来源会削弱偏好,把商品重新标注为偏好来源会提高其选中率。 表明来源偏好不只来自商品内容,来源标识本身即可独立改变选择行为。 通过隐藏来源信息与重新标注来源两类干预,观察选择率的变化。
研究检验了两条偏好来源路径:奖励更优商品的训练可使来源成为需求满足的捷径,缺失信息可触发对来源的成见;补全缺失信息或用提示对抗成见可降低来源偏好。 把来源偏好归因于训练捷径与信息缺失触发的成见两条机制,并给出补全信息与提示两类可降低偏好的干预。 以训练奖励设置与信息缺失条件作为机制检验,并以补全信息、对抗成见的提示作为干预验证。
启示与展望
该研究面向以LLM智能体代用户进行端到端搜索的场景,覆盖三个领域与12个智能体模型,适用于商品购买、酒店预订、论文引用等由智能体代为选择来源的任务。其结论为:来源偏好普遍存在且跨模型高度一致,可压过需求满足度,并可通过隐藏来源、补全缺失信息或使用对抗成见的提示来削弱。对构建智能体搜索系统的读者,这提示在评估与部署时应把来源标识与信息完整性作为影响选择结果的变量加以考虑。
文本为摘要层面,未给出各领域的具体来源、12个模型的名称、样本规模与统计检验细节,因此偏好强度在不同领域与模型间的差异程度仍待正文确认。训练捷径与信息缺失成见两条路径的相对贡献、补全信息与提示干预在不同条件下的稳健性,以及隐藏来源与重新标注实验的具体操作方式,均属需要进一步阅读正文才能判断的开放问题。
