跳到主要内容
返回时间线
arXiv来源发表:

REST 给潜空间思维加四项可微损失,在 7 个基准上把准确率最高提升 7.5 个百分点

核心概要

该工作指出仅用最终答案交叉熵训练潜空间递归 LLM 系统会让思维表征出现四类失效,提出 REST 把因果性、最小性、可分离性与稳定性四项性质转成可微损失加到交叉熵上,在数学、科学、医学与代码生成的 7 个基准上、相同训练数据与潜空间预算下,多智能体平均提升 3.5 个百分点、单智能体平均提升 3.3 个百分点,最佳配置分别达 7.5 与 6.5 个百分点,并把收敛到最终答案的比例从 73% 提高到 95%。

AI-generated editorial illustration: Principled Thoughts for Latent Recursive LLM Systems

深度剖析

论文识别出仅用交叉熵训练潜空间思维的四类失效:替换散度、信息损失、思维碰撞与生产者不确定性,它们都会降低正确答案的概率。 此前工作多把监督信号定义在思维所替代的文本上,例如 CODI 对齐文本诱导的隐状态、SIM-CoT 从思维解码回文本,而这里把问题定位到思维之间的关系与输出分布本身。 论文给出理论分析,并在训练后的系统中观察到交叉熵思维在不同问题间坍缩、且保留与输出无关的输入信息。

REST 把因果性、最小性、可分离性、稳定性四项性质各自写成可微损失项,与交叉熵相加,不改变架构、推理时不增加参数。 作者称这是首次把有效思维表征的理论性质转成潜空间递归 LLM 系统的损失项,并把该递归系统从多智能体扩展到单智能体自循环。 每个损失项都从性质定义推导而来,附录给出与公理的对应关系及有界误差分析;训练只更新外层链接,基座模型与内层链接保持冻结。

在 7 个基准、相同训练数据、算力与潜空间预算下,REST 在单智能体与多智能体设置中都优于仅用交叉熵的基线。 多智能体平均提升 3.5 个百分点、单智能体平均提升 3.3 个百分点,最佳配置分别达 7.5 与 6.5 个百分点;在 Light 系统中因果性或最小性在三项数学基准上追平或超过最强的冻结单模型。 结果跨 Qwen、Llama、Gemma 组成的 Light 与 Scaled 两套系统、三个训练种子取平均,并与 CODI、SIM-CoT 作为辅助损失项的适配版本对比。

REST 的思维编码了更多生产者输出所需的信息,解码后更容易还原智能体意图,使潜空间通信更易审计。 交叉熵思维更多编码生产者输入而非输出,REST 则相反,且这一效应沿潜空间链条越往后越明显。 论文报告 REST 平均多解码 15.4% 的 token,收敛到最终答案的比例为 95% 对 73%;案例分析显示省下的 token 主要是重复文本,多智能体场景下多出的 token 是真实推导。

启示与展望

这项工作面向已经在运行潜空间递归或多智能体潜空间通信的研究者与工程团队,适用场景是基座模型冻结、只训练智能体之间传递链接的设置,训练数据、算力与潜空间预算与基线保持一致。它使思维表征本身成为可训练对象,并让解码思维更容易被检查,因此对需要审计智能体间通信的系统尤其相关。论文也把该递归构造从多智能体扩展到单智能体自循环,说明同一套损失项在两种拓扑下都可用。

论文自述受算力限制,未穷举所有性质组合与超参数,稳定性用了较廉价的近似;训练只更新外层链接,把 REST 扩展到内层链接或智能体本身留作后续工作。表征分析基于每个配置的一次代表性运行,而非完整的种子与权重网格,因此几何结论的稳健程度仍需更多运行确认。此外,潜空间预算增大时交叉熵基线在部分基准上掉分而 REST 保持,这一现象目前是单次运行的结果,值得进一步观察。

来源