跳到主要内容
返回时间线
arXiv来源发表:

11个大模型在开放式信息征询中表现出不同的信息价值偏好,并由此产生宽深差异明显的征询轨迹

核心概要

该研究用IBM-Rank-30k的142条论证作为共享信息空间,把11个开源指令微调大模型对候选信息是否值得追问的判断(以肯定标签概率作为信息征询分数)接入同一套顺序征询模拟,在固定选择规则、固定应答者行为、不生成自然语言问题的条件下,刻画模型特有的信息征询偏好如何塑造征询轨迹的广度与深度,并检验交互历史、候选集规模、应答标签与提示措辞的影响。

Source-provided article image: On Open-Ended Information Seeking for Information Elicitation Agents
Figure 1 ·

Figure 1: Illustration of the experimental elicitation setup and example trajectories.

arXiv

深度剖析

同一信息空间与同一征询目标下,不同大模型给出的信息征询分数差异显著但并非随机:多数模型两两相关在.20至.60之间,P4与其他模型的相关较低(.09–.22),而与语义相似度的相关对所有模型都较低(.14–.34)。 此前工作多把信息寻求建模为降低对未知目标不确定性的问题选择,或按对下游决策的贡献定义信息价值;这里把开放式征询中的“哪条信息值得追问”作为模型自身的判断来测量,并显示该判断不能由语义相关性解释。 11个开源指令微调模型、5个模型家族、跨参数规模;共享信息空间为IBM-Rank-30k中随机抽取的142条论证(71个话题各2条),每条论证在全部71个话题目标下评估,无交互历史;评估为确定性前向传播,未跨随机种子重复。

把信息征询分数接入固定选择规则的顺序模拟后,仅更换打分模型即可产生明显不同的广度—深度行为:话题切换率从.295(P4)到.560(Q14),不同话题数从23.4到44.7,同话题连续运行长度从1.76到3.35;多数模型选中的论证质量高于随机基线。 该模拟把候选信息的评估与问题生成、应答者行为分离,使模型特有的偏好可以在其他组件固定的情况下被单独观察,并显示局部偏好会累积成轨迹层面的模式。 每个条件100条轨迹、每条100步、3个随机种子,共30,000步;候选集大小k=7,假设确认概率固定为0.5,应答独立于假设、话题、历史与分数;以随机选择作为轨迹基线。

候选集规模k从3增至13会扩大征询广度(L8从29.7到40.0个话题,Q14从35.4到48.2,M8从26.7到35.2),但不消除模型间排序差异;可用候选的最大论证质量随k上升而收益递减(约.935到.984再到.997),选中论证质量上升更缓,选中最大质量候选的比例总体下降。 把候选集规模刻画为“机会约束”:它同时改变可用信息的范围与质量,而模型偏好仍决定哪些机会被追求。 对三个模型家族的代表模型在k=3、5、7、9、11、13下比较;论证质量使用IBM-Rank-30k的人工标注加权平均分作为外部属性,而非征询目标或偏好度量。

当提示明确说明重复信息价值较低时,与已确认信息高度相似的候选得分大幅下降(Q14从.823到.257,M14从.865到.634,M24从.931到.708),并传导到选择率(Q14从.211到.042,M14从.180到.053,M24从.167到.049);若换成不提及重复的中性提示,这些下降基本消失。 冗余敏感性不需要单独的去重、相似度阈值或候选过滤机制,而是通过同一套信息征询分数起作用;同时表明仅提供交互历史并不足以让模型折价重复信息,判断如何被表述才是关键。 每一步对同一候选分别在含与不含话题相关历史下打分;相似度用cross-encoder/stsb-roberta-large度量并按高/低相似分组,区分重叠信息此前被确认或未被确认;附录D给出相似度达.97的候选—历史对;提示消融覆盖Q7、Q14、M8、M14、M24。

启示与展望

该工作面向把征询决策委托给基础模型的代理式征询场景,适用于需要持续判断“哪条信息值得追问”的开放式对话,如招聘、新闻与口述史。它使研究者可以在固定选择规则下比较模型特有的信息征询偏好,并观察这些偏好如何累积为轨迹层面的广度与深度;对实践者而言,候选集规模k被刻画为可调的机会约束,扩大k会同时增加可用信息的范围与质量但收益递减,而冗余折价可以通过在评估中明确说明重复信息价值较低来实现,无需额外的去重或过滤模块。结果适用于以候选—目标评估为接口、应答行为被抽象掉的受控设置。

信息征询分数被解释为模型特有的偏好而非可直接跨模型比较的信息价值测量,因为肯定标签概率未必跨模型校准;应答者以固定概率独立确认,未建模真实人类应答行为,也未施加观点一致性约束;模拟不生成自然语言问题,因此问题措辞与对话动态的影响未被覆盖;标签替换为Valuable/Not valuable时多数模型排序相关性高于.70(五个高于.88),但G12为.459,且附录C显示标签差异可传导到轨迹层面,M8变化较大;候选集规模分析只报告了三个家族的代表模型;结论基于IBM-Rank-30k的争议话题论证,向其他信息空间与真实交互迁移仍需检验。

来源