跳到主要内容
返回时间线
arXiv来源发表:

QuLoC 用光子量子电路门控低秩分量,在 Qwen3.5-4B 上把压缩后平均准确率相对提升 9.73%

相关研究与后续进展

核心概要

该工作提出 QuLoC——一种光子量子辅助的大语言模型压缩算法,用量子电路输出在训练中门控保留的低秩分量,并通过局部功能重建与端到端知识蒸馏恢复性能,训练后门控系数被吸收进低秩因子,使压缩模型可在经典硬件上推理而无需运行量子电路;在 Qwen3.5-4B 上,其平均准确率相对当前最优基线提升 9.73%,在 LLaMA-7B 的不同参数压缩比下也取得相当或更高的平均下游准确率。

Source-provided article image: QuLoC: Photonic Quantum-Assisted Low-Rank LLM Compression
Figure 1 ·

Figure 1 : Photonic quantum-assisted low-rank compression of large language models. (a) Photon-counting measurements from an ensemble of four-mode photonic quantum circuits are used to build a reusable pool of quantum response features. (b) Lightweight classical mappings transform these features into input-independent gates that modulate the low-rank projection factors during training. The compressed student is optimized through layer-wise reconstruction followed by end-to-end teacher–student distillation. After training, the gates are folded into the low-rank factors, enabling inference entirely on classical hardware.

arXiv

深度剖析

提出 QuLoC:用光子量子电路的输出作为门控信号,在训练阶段调节 SVD 低秩压缩中保留的分量。 相对于仅依赖 SVD 低秩分解的压缩路线,这里把量子电路输出引入为训练期的门控机制,而非仅做经典低秩截断。 摘要给出算法构成与门控机制描述,并在 Qwen3.5-4B 与 LLaMA-7B 上报告结果;未提供电路规模、门控参数数量等细节。

通过局部功能重建加端到端知识蒸馏恢复压缩后的模型性能。 把压缩后的性能恢复拆成两步:先做局部功能重建,再做端到端蒸馏,以缓解低秩压缩带来的下游性能下降。 摘要明确列出这两步流程,并以 Qwen3.5-4B 上 9.73% 的相对平均准确率提升作为效果证据。

训练后门控系数被吸收进低秩因子,压缩模型在推理时无需执行量子电路,可直接跑在经典硬件上。 使量子辅助仅停留在训练阶段,避免推理期引入量子硬件依赖,这是该方法可部署性的关键设计。 摘要直接陈述该吸收步骤与经典推理能力;未给出吸收后模型规模或推理开销的量化数据。

在 Qwen3.5-4B 上相对当前最优基线取得 9.73% 的平均准确率相对提升,并在 LLaMA-7B 的不同压缩比下达到相当或更高的平均下游准确率。 把验证从单一模型扩展到更大模型与多种压缩设置,支持方法在不同压缩比下的适用性。 证据来自多个下游任务的平均准确率对比;摘要未列出具体任务清单、压缩比数值与逐任务结果。

启示与展望

该工作面向需要在压缩后保持下游任务表现的大模型部署场景,适用于使用 SVD 低秩压缩且可承担训练期量子电路调用的流程;训练完成后模型在经典硬件上推理,因此推理侧不需要量子设备。摘要指出结果可支持把光子量子辅助压缩推广到更大模型与更复杂智能体任务,说明其目标读者是关注压缩与量子辅助训练的模型工程与量子计算交叉方向研究者。

摘要未说明量子电路的规模与结构、门控系数的数量与训练开销、所用下游任务清单、具体压缩比数值以及逐任务结果,也未给出与基线在相同压缩比下的逐项对照;这些是读者在评估 9.73% 相对提升与 LLaMA-7B 上“相当或更高”结论时仍会关注的问题。此外,摘要提到结果可推动更大模型与更复杂智能体任务的探索,但未给出这类扩展的实验证据。

来源