跳到主要内容
返回时间线
arXiv来源发表:

Braco 把视觉 token 压缩从“挑token”改成“换表示”,在 23–64 倍压缩下达到 95.2% 归一化精度并把 prefill FLOPs 降 84.2%–86.7%

核心概要

该工作把极端视觉 token 压缩重新表述为 token 参数化问题,将“基变换与结构化截断”(决定保留子空间/可压缩性)与“坐标组织”(决定优化与跨模态对齐/可学习性)分离,并据此设计四步轻量编码器 Braco(变换基截断、输入无关的基坐标嵌入、随预算变化的正交重参数化、来自轻量池化的学习式空间残差 token),实验显示 Braco 在 23–64 倍压缩下形成更优的精度—效率前沿、在 144 倍压缩下仍具竞争力,达到 95.2% 精度并把 prefill FLOPs 相对未压缩上界降低 84.2%–86.7%,相比此前方法在精度持平或提升的同时实现最高约 36% 端到端加速,压缩器延迟/FLOPs 分别低 16.6 倍/78.8 倍。

AI-generated editorial illustration: Beyond Selection: Token Parameterization for Extreme Visual Token Compression

深度剖析

论文提出以 token 参数化视角看待极端视觉 token 压缩,把压缩拆成两部分:基变换与结构化截断决定“保留哪个子空间”(可压缩性),坐标组织决定“同一子空间内坐标如何排布”(可学习性),并形式化为统一泛函。 此前工作多把压缩等同于 token 选择(剪枝/合并)或学习式重采样;这里把“保留什么”和“如何表示保留内容”作为两个可分别诊断的设计轴。 论文给出可压缩性(能量保留与任务方向可读性)与可学习性(统计条件数与几何兼容性)的显式泛函,并在附录中给出推导与阈值条件;诊断在冻结 token 网格与 CelebA 线性探针上进行。

据此设计的 Braco 由四步组成:DCT 低频块截断的变换域主干、输入无关的基坐标嵌入、随预算变化的正交坐标组织(小预算用系数坐标、较大主干用逆 DCT 粗网格)、以及轻量稀疏池化得到的空间残差 token。 与纯低通变换编码(如 Fourier-VLM 的逆 DCT 重建)不同,Braco 额外恢复变换后丢失的 token 身份,并用空间残差补回低通截断丢弃的局部证据。 消融显示:9 token 时混合 c2s5 达 93.2 归一化精度,高于纯主干 c3s0 的 89.8 与纯残差 c0s9 的 92.0;16 token 时把 DCT 主干换成 spatial/Haar 损失 2.3–3.0 个精度点,换掉所选坐标组织损失 2.5–3.1 点,换掉 Polar Fourier 嵌入损失 0.8–0.9 点。

端到端评测中,Braco 在匹配的极端 token 预算下形成更优的精度—效率前沿:相对 576-token Vanilla,把全流程 prefill FLOPs 从 8.67T 降到 1.09–1.37T,同时在 4–25 token 区间保留 91.2–95.2 的 Vanilla 归一化精度。 在 25、16、9 token 上取得所评测方法中最高的归一化精度,4 token 时与 QueCC 相差 0.2 以内;与 QueCC 相比在 16/9 token 精度相差 0.1 以内而延迟降低约 36%。 主表在 GQA、MMBench(EN/CN)、MME、POPE、ScienceQA、TextVQA、MMVet 上报告逐项分数与归一化精度,所有基线共享重训练/评测流程与匹配预算;压缩器层面 Braco 以 16.6 倍更低模块延迟、78.8 倍更少压缩器 FLOPs 达到 QueCC 级精度。

在更大输入与更小 LLM 上,Braco 保持有效:2880 输入 token 的 Vicuna-7B 设置下保留 98.1 归一化精度,把全流程 FLOPs 从 40.57T 降到 3.45T、延迟从 261.08ms 降到 44.36ms;Qwen2.5-3B 上在 729/1024 输入 token 保留 93.1/92.6 精度,3645 token 保留 90.8 精度。 论文指出 576-token 设置主要检验精度能否在极小保留预算下存活,而视觉接口变大后同样的保留预算会移除更大的未压缩 prefill 负担,从而带来更大的端到端节省。 表 8 给出 Vicuna-7B 与 Qwen2.5-3B 在 576/2880/729/1024/3645 输入 token 下的逐基准分数、FLOPs 与延迟;训练时间表显示 Braco 不慢于 QueCC。

启示与展望

该结果面向视觉编码器—LLM 流程中的单图多模态推理,适用于需要在几十个视觉 token 内完成部署的移动推理、低延迟交互代理与长上下文多模态场景;对希望在不重训下游 LLM 的前提下替换视觉接口的工程实践,论文提供了可独立度量的轻量压缩器与随预算变化的坐标规则。论文还给出无标签校准流程:在视觉接口训练分布上估计交叉点,或在目标域变化时用少量无标签样本重新估计,从而把主干—残差分配、坐标组织与结构化基适配到新编码器或分辨率。

论文自述主要评测范围是 LLaVA 系列流程与标准单图基准,坐标选择针对已测编码器与分辨率校准,新主干、视频输入、密集定位任务、领域特定分布、不规则区域特征或动态视觉 token 可能需要小规模校准扫描;关键 Braco–QueCC 与 Braco–TokenPacker 设置报告了三随机种子精度对比,其余精度对比使用单一训练检查点。此外,加载文本中部分表格与图(如批量扩展延迟、部分成本分解)以空值形式出现,因此这些具体数值无法在此总结中复述,读者若关心批量扩展与阶段成本细节需查阅原文附录。

来源