SynLat 用句法对齐单元做文本-隐空间混合压缩,在约 44% 压缩率下保留 94.0% 的未压缩准确率
核心概要
SynLat 把思维链压缩重新表述为表示保真度的分配问题:用成分句法把推理轨迹切成有序不重叠的句法对齐单元(SAU),由答案条件化的教师模型为单个压缩条件化学生模型生成渐进式 KEEP/LATENT 目标,隐单元映射到共享离散码本;推理时学生模型仅凭问题和压缩等级生成文本与隐符号混合的思维链。在两个 Qwen3 学生规模、Standard- 与 Long-CoT 任务组、三个压缩等级共 12 个任务组聚合中,SynLat 全部达到或超过最强基线,其中 11 个严格领先;MEDIUM 下总体领先 3.6/2.6 个百分点,HIGH 下扩大到 7.0/5.5 个百分点。
Figure 1: Compression-decision boundaries for the same reasoning sentence. Token and fixed-window units can fragment local relations, whereas step-level units can bind distinct relations; Syntax-Aligned Units preserve coherent relations while keeping them separately assignable to text or latent form.
arXiv深度剖析
把预算受限的思维链压缩形式化为“表示保真度分配”问题:哪些内容保留为文本、哪些转为隐表示,而不是单纯删除或改写可见 token。 此前的显式压缩(TokenSkip 剪 token、R1-Compress 压块、步熵过滤、公式保留)都在可见文本内操作;纯隐式方法(COCONUT、CODI)则完全替换轨迹,需在无文本锚点下承载完整推导,且 SIM-CoT 报告隐式推理规模化时隐状态可能同质化。SynLat 把压缩决策落在文本与隐表示之间的分配上。 论文以问题形式化加方法设计加受控实验共同支撑,属于概念重构加实证验证的组合。
提出以句法对齐单元(SAU)作为压缩决策单位:把成分句法树的嵌套重叠跨度扁平化为有序、不重叠、可完整重建原轨迹的单元,使局部关系不被切碎又能被单独指派为文本或隐形式。 token 与固定窗口边界会切碎短语、公式和局部推导,步级边界又会把需要不同压缩动作的内容绑在一起;SAU 提供轨迹特异的单元。表 2 在约 44% 达成 CR 下显示 SAU 保留 94.0% 的 NONE 准确率,固定 5-token 窗口低 2.6 点,加保护的窗口仍低 1.8 点,步级单元低 4.4 点。 消融实验在 Qwen3-8B 上对五个基准做宏平均,并同时报告单元平均长度、成分切分率与公式切分率,SAU 平均长度 3.6、公式切分率 5.9,为最低。
设计答案条件化的渐进式 KEEP/LATENT 规划与“先规划后生成”的两阶段迁移,使单个压缩条件化学生模型在推理时只需问题和压缩等级即可生成混合思维链。 教师模型依据剩余文本锚点与上下文判断哪些单元可从答案角度恢复,而非只看局部重要性;压缩条件共享渐进可替换顺序,高压缩只新增 LATENT 单元而不回退。在固定 SAU 上,答案条件化规划在 MEDIUM/HIGH 保留 94.0%/89.3% 的 NONE 准确率,强于最强的无答案替代方案 92.0%/86.2%;去掉动作规划监督使三个压缩等级的平均准确率从 73.1 降到 70.6。 规划与训练消融为专门的 Qwen3-8B 研究,跨五个基准宏平均,并给出对照数值。
在匹配输出预算下,SynLat 在全部 12 个任务组聚合中达到或超过最强被评估基线,11 个严格领先,且优势随压缩增强而扩大。 MEDIUM 下总体领先 3.6/2.6 个百分点(Qwen3-8B/14B),HIGH 下扩大到 7.0/5.5 点;Qwen3-8B 在 HIGH 下 Standard-CoT 领先 4.7 点、Long-CoT 领先 8.5 点。基线在少数设置上优于 SynLat:Qwen3-8B 的 MATH-500 LOW、Qwen3-14B 的 ProofWriter LOW 与 StrategyQA MEDIUM。 主结果在两种学生规模、五个基准、三个压缩等级上报告准确率与达成 CR,主结果对独立训练与生成种子取平均,比较固定数据、计算与评测。
启示与展望
该结果面向需要在受限输出预算下部署长思维链推理的场景,适用于具备成分句法解析能力、且可离线构建教师目标的语言与任务。方法在 Qwen3-8B 与 Qwen3-14B 两种学生规模、MATH-500、StrategyQA、OlympiadBench、WorldTree V2、ProofWriter 五个基准上验证,LOW/MEDIUM/HIGH 目标为 25%/50%/75% 的 SAU 替换率,实际达成 CR 约为 23%/44%/65%。对希望复用该思路的读者,可迁移的部分是“以句法单元作为分配单位”和“答案条件化渐进规划加两阶段迁移”这两条设计原则;隐单元使用共享有限码本,由冻结 SpanBERT 编码、IncrementalPCA、归一化与球形 mini-batch k-means 构建,学生模型接收的是带可训练嵌入的特殊 token 而非离线跨度向量。
读者仍会关注:SAU 构造依赖成分句法解析质量,解析器在公式密集或非英语轨迹上的行为未在文中展开;码本由任务无关语料拟合,其规模与覆盖对隐单元可恢复性的影响未给出敏感性分析;LOW/MEDIUM/HIGH 的目标是单元替换率而非输出 CR,任务级达成 CR 存在波动,跨任务比较需按论文的达成 CR 选择协议解读;主结果对独立训练与生成种子取平均,但种子间方差未在正文给出;教师模型为冻结的 Qwen3-235B,教师能力上限对目标质量的影响属于开放问题。
