跳到主要内容
返回时间线
arXiv来源发表:

HyperGuide 用双曲空间中的虚拟 token 引导 LLM 单轨迹推理,在竞赛数学与代码生成上以更少 token 达到或超过搜索与验证器基线

相关研究与后续进展

核心概要

HyperGuide 将推理视为在双曲空间(Poincaré 球)中嵌入的状态树上的移动,先训练状态编码器、再训练引导头预测从当前状态出发的最小代价转移方向,并把该方向作为虚拟 token 在每个推理步骤后插入解码器,使推理沿单条自回归轨迹进行而无需扩展或重排候选;在竞赛数学与代码生成实验中,其准确率与搜索式和验证器式基线相当或更高,同时生成的 token 显著少于这些基线,与少样本提示大致相当。

AI-generated editorial illustration: HyperGuide: Hyperbolic Guidance for Efficient Multi-Step Reasoning in Large Language Models

深度剖析

提出 HyperGuide 框架,把多步推理建模为双曲空间中状态树上的移动,用 Poincaré 球上的状态编码器加引导头预测最小代价转移方向。 与在推理时扩展并评估大量分支的搜索方法、以及仍需在推理时对候选排序的价值模型相比,HyperGuide 把分支比较的代价前移到训练阶段,推理时不再需要扩展或重排候选。 摘要给出方法构成(状态编码器、引导头、虚拟 token 注入)与实验领域(竞赛数学、代码生成),并报告与搜索式和验证器式基线的准确率与 token 用量对比;具体数据集、模型规模与数值未在文本中给出。

预测出的方向以虚拟 token 形式在每个推理步骤后插入解码器,使推理沿单条自回归轨迹推进。 这使推理过程不需要展开候选分支,也不需要重排候选,从而绕开了搜索式与验证器式方法在推理时的分支评估开销。 摘要明确描述该注入机制及其目的(“without expanding or reranking candidates”),并称生成 token 量显著低于搜索与验证器基线、与少样本提示大致相当。

监督信号采用序数(ordinal)而非二值形式,偏好既可靠又简短的续写,从而把生成导向成功且简洁的解。 相较二值监督只区分对错,序数监督同时编码可靠性与长度偏好,使引导方向兼顾正确性与简洁性。 摘要陈述监督为序数而非二值及其预期效果;未给出监督信号的具体构造方式或消融结果。

在竞赛数学与代码生成任务上,HyperGuide 的准确率与搜索式和验证器式基线相当或更高,同时 token 用量显著更少。 在保持或提升准确率的同时降低推理 token 消耗,说明把分支比较前移到训练阶段可以在不牺牲准确率的前提下减少推理开销。 摘要报告了准确率与 token 用量的方向性结论,但未列出具体基准名称、样本量、模型或数值。

启示与展望

该工作面向需要在推理时比较多条续写后果的多步推理场景,适用于竞赛数学与代码生成这类可判定成功与否的任务;其设计目标是让推理沿单条自回归轨迹完成,从而把分支比较的代价从推理阶段移到训练阶段。对希望降低推理 token 成本、又不愿放弃搜索式准确率的工程实践者,这一思路提供了可参考的替代路径:训练一个双曲空间状态编码器与引导头,并在每个推理步骤后注入方向性虚拟 token。适用前提是任务能够提供用于训练引导信号的步骤级监督,且推理过程可被组织为状态树上的转移。

文本为摘要级信息,未列出具体基准数据集、基线实现、模型规模、样本量与准确率、token 数的具体数值,因此无法判断效果幅度与统计稳健性。序数监督的具体构造、状态树如何构建、双曲嵌入维度与训练成本等细节均未说明。摘要称结果覆盖竞赛数学与代码生成,其他推理任务上的表现仍属开放问题。此外,摘要未说明与少样本提示在准确率上的逐项对比,也未给出失败模式或误差分析,这些都需要在正文中确认。

来源