跳到主要内容
返回时间线
arXiv来源发表:

集成式信息论任务选择框架让 LLM 多智能体通信结构优化在良性对抗场景下均优于随机训练

核心概要

该工作提出一种基于集成的信息论任务选择框架,用集成卡尔曼反演近似贝叶斯更新来估计候选任务对图参数分布的改变量,并通过嵌入代表性选择、代理建模与批量汤普森采样提升可扩展性,在良性与对抗设置及多种任务格式下验证,一致优于随机训练,实现更有效的任务选择与更高的整体成本效率。

Source-provided article image: Active Learning for Communication Structure Optimization in LLM-Based Multi-Agent Systems
Figure 1 ·

Figure 1: Accuracy-cost scaling on MMLU (adversarial). More randomly selected training tasks help only modestly, while active learning achieves higher accuracy despite lower cost.

arXiv

深度剖析

提出以任务对图参数分布的改变量来度量任务信息量的信息论选择准则,用于 LLM 多智能体系统的通信结构优化。 既有方法通常依赖随机采样的训练任务,而任务在难度与领域上差异显著、对更新通信结构的信息量并不相等,导致优化不稳定且对特定训练集高度敏感;该工作把任务选择从随机采样转为主动识别最有价值任务。 摘要层面给出方法动机与设计,并以跨良性、对抗设置及多种任务格式的验证说明其一致优于随机训练。

采用集成卡尔曼反演作为对应贝叶斯更新的高效、无导数近似,使信息量估计器适用于黑盒且带噪的多智能体系统。 将贝叶斯更新近似与集成方法结合,避免对系统内部求导,从而适配只能观测输入输出的多智能体环境。 摘要明确说明该估计器尤其适合黑盒与带噪多智能体系统,并给出其作为贝叶斯更新近似的定位。

通过嵌入代表性选择构建紧凑候选池,并将信息量选择与代理建模、批量汤普森采样结合以增强可扩展性。 在信息论选择之外引入候选池压缩与批量采样机制,使框架在更大任务空间下仍可运行。 摘要列出这三项组件作为可扩展性设计,并说明其与信息量选择的组合方式。

在良性与对抗设置以及多种任务格式下验证,框架一致优于随机训练,并展现更高的整体成本效率。 相较随机训练基线,该框架在任务选择有效性与成本效率两方面同时取得改进。 摘要报告跨设置与任务格式的一致性优势,但未给出具体数值、样本量或统计检验细节。

启示与展望

该框架面向 LLM 多智能体系统的通信结构优化,适用于任务难度与领域差异显著、且系统只能以黑盒方式观测并带有噪声的训练场景;其设计目标是在此类条件下主动挑选信息量更高的任务,以替代随机采样训练。摘要所述验证覆盖良性与对抗设置以及多种任务格式,说明其适用范围不限于单一任务形态。对希望降低通信结构优化训练成本、或需要在不稳定任务分布下获得更稳健更新的研究者与工程实践者,这一框架提供了可复用的任务选择思路。

摘要未报告具体性能指标、token 节省幅度、任务数量或统计显著性,因此成本效率优势的幅度仍待正文确认。集成卡尔曼反演作为贝叶斯更新的近似,其近似误差在不同噪声水平与图参数维度下的表现,是需要进一步观察的问题。候选池压缩与批量汤普森采样各自对最终效果的贡献比例,摘要未作拆分。对抗设置的具体构造方式与任务格式种类,摘要亦未展开,这些都会影响结论可外推的范围。

来源