跳到主要内容
返回时间线
arXiv来源发表:

把量子电路变成每个词元的“私人定制”:HyperQ 在冻结扩散语言模型上的宽度实验

核心概要

HyperQ 在冻结的 11 亿参数掩码扩散语言模型(LLaDA-1.1B)的每个 transformer 块中并联一个量子残差分支,由轻量级电路超网络根据每个词元的隐藏状态连续生成该词元专属的 IQP 电路坐标(旋转角、耦合强度与测量轴),在固定环加弦边集上执行后把期望值经低秩投影残差加回查询-键-值张量;由于该受限两体 IQP 族的期望值存在精确闭式表达、评估代价随量子比特数线性增长,16、32、64 比特电路可在该骨干内训练,六个下游基准平均分从 47.65 升至 52.80 再升至 54.30,64 比特时分别高出冻结骨干 4.71 分和经典低秩适配版本 3.67 分,而微调仅用 20,000 条提示-响应对(经典基线为 200,

AI-generated editorial illustration: Circuit Hypernetworks for Quantum-Augmented Diffusion Language Models

深度剖析

提出“词元条件化电路发射”这一架构:不再为整个任务搜索一个固定电路,而是让超网络把每个词元的隐藏状态映射为同一稀疏电路骨架上的连续坐标,使每个词元拥有自己的电路。 此前的量子-Transformer 结合多停留在参数高效适配或固定宽度的电路插入,且电路通常独立于语言模型、面向固定任务;这里把电路坐标直接条件化到语言模型隐藏状态上,并作为残差分支并联在冻结的融合查询-键-值投影旁。 方法层面给出完整构造:低秩适配器实现超网络,输出单比特旋转角、边上的两体耦合角与每比特读出轴;分支接在所有 transformer 块上,骨干全程冻结,仅训练分支与低秩投影,训练信号只有掩码扩散目标。

通过把发射电路限制在固定边集(一环层加一弦层,每比特度数恒为四)上的严格两体 IQP 族,同时获得可负担的读出与不随宽度衰减的初始化梯度。 一般 IQP 内部含所有权重子集,通用 -比特纯态精确模拟需要 个振幅;这里只保留权重不超过二的生成元并把两体项放在固定边集上,使读出有精确闭式、总代价为 ,且坐标梯度方差在指定独立参考初始化下为 ,因度数固定为四而在 16、32、64 比特上保持不变。 给出闭式期望值表达式与梯度方差表达式,并在 至 比特用暴力态矢量计算核验;同时说明该结论只刻画指定电路族与参考初始化下的电路坐标梯度,不刻画冻结骨干,也不保证一般意义上的可训练性。

在 11 亿参数冻结骨干上完成 16/32/64 比特的宽度扫描,观察到随寄存器变宽而持续提升,且发射电路优于手设电路与离散 motif 搜索。 已有量子增强模型各自在固定资源水平上评估、且使用不同评测套件,无法回答“增加量子比特是否让语言模型更好”;这里在同一骨干、同一评测套件下做宽度扫描,并报告 HyperQ 是这批量子增强模型中首个报告标准六基准下游套件的。 六基准(ARC-e、HellaSwag、PIQA、BoolQ、RACE、GSM8K)平均分 47.65→52.80→54.30;64 比特时 54.30,对比冻结骨干 49.59 与同骨干经典低秩适配 50.63;16 比特时 47.65 仍低于冻结骨干,增益只在寄存器变宽后出现;发射电路在每个宽度都优于固定 ansatz 与 3-motif/6-motif 搜索,且 32 比特时单次前向的 52.80 高于最佳三电路集成 52.24。

把发射电路编译为固定门数与深度的可执行线路,并在 156 比特超导处理器上做有界配对验证,同时保持掩码扩散的任意顺序解码能力。 逐词元电路若需完整态矢量或无约束编译,在十亿参数模型内不可行;这里用同一套逐词元编译管线同时服务模型评估与硬件转译,边集固定使路由可按宽度做一次而非按词元做一次。 在 ibm_quebec 上以 Qiskit Runtime EstimatorV2 执行,读出与解析值的平均绝对偏差随宽度从 16 比特升至 32、64 比特,散粒噪声底为 ;在每基准 256 条固定子集上,平均分分别下降若干点,GSM8K 损失最大、PIQA 最小;作者明确声明不主张量子优势,硬件评估不涉及原生硬件训练。

启示与展望

这项工作面向在冻结掩码扩散骨干内做参数高效适配的研究者与工程实践:它说明在 16 至 64 比特、11 亿参数骨干、20,000 条提示-响应对的设定下,逐词元连续发射电路可以训练、可以编译到超导硬件执行,并随宽度提升下游平均分。它使后续工作可以在此基础上追问更宽寄存器、其他电路族、其他骨干(如自回归模型)以及原生硬件训练是否延续同一趋势;硬件部分是有界的配对验证,用于确认发射电路可在噪声设备上执行并保留大部分下游表现。

作者自己划出的边界值得继续观察:梯度方差结论只针对指定电路族与参考初始化下的电路坐标,不解释下游精度为何随宽度上升,也不保证一般可训练性;宽度扫描只覆盖 16、32、64 三个点,不构成超出该范围的外推规律;读出在全部测试宽度上仍可经典高效模拟,因此这是架构层面的结果而非计算优势,作者也明确不主张量子优势。硬件侧,读出误差随宽度上升,配对子集每基准仅 256 条,且未评估原生硬件训练。此外,与早期量子增强模型的直接比较因评测套件不同而不可行,HyperQ 是这批模型中首个报告标准六基准套件的;WikiText 困惑度是唯一未领先的列。若读者只看到首页摘要而未读到方法与表格,上述关于电路族、闭式读出、梯度条件与硬件配对协议的细节都不在其中,这会影响对结论适用范围的判断。

来源