跳到主要内容
返回时间线
arXiv来源发表:

DNAlign 用零空间投影把安全扰动限制在有害子空间,在多个 LLM 主干上降低有害输出且保持流畅与事实效用

相关研究与后续进展

核心概要

该工作提出 DNAlign,一个把控制论优化与零空间投影结合的轻量对齐框架:将 LLM 视为动态系统并施加可控扰动以引导生成走向安全行为,投影模块把扰动限制在由中性隐藏状态导出的有害相关子空间内以保留通用知识与回答质量,并用人类偏好数据训练的价值函数自适应优化控制信号;在多个 LLM 主干上的评测显示其持续减少有害输出,同时保持流畅性、连贯性与事实效用,整体表现优于先前的对齐基线且未牺牲生成多样性。

Source-provided article image: DNAlign: Dynamic Null-Space Safe Alignment for LLMs
Fig. 1 ·

Fig. 1: Comparison of LLMs with/without DNAlign alignment. Unedited models forget security-related knowledge, while our proposed framework preserves safe responses.

arXiv

深度剖析

提出 DNAlign 轻量对齐框架,将控制论优化与零空间投影结合,把 LLM 当作动态系统并引入可控扰动来引导生成趋向安全行为。 相对既有安全对齐方法,该框架以控制信号而非高成本重训练或会破坏核心知识的方式实现安全引导,针对的是安全与效用之间的持续权衡。 摘要层面陈述的框架设计;原文指出既有方法要么计算成本高,要么无意中破坏模型核心知识并导致良性任务上的流畅性与事实准确性下降。

设计投影模块,将扰动限制在由中性隐藏状态导出的有害相关子空间内,从而保留通用知识与回答质量。 这是该框架的关键组件,把安全干预的作用范围限定在与有害内容相关的子空间,而非全局改动模型行为。 摘要将其描述为关键组件,并说明其作用机制来自中性隐藏状态导出的子空间;具体实现细节在所提供的文本中未展开。

使用在人类偏好数据上训练的价值函数自适应优化控制信号,使对齐结果贴合人类安全偏好。 把偏好学习纳入控制信号的优化回路,使扰动强度与方向可随偏好目标自适应调整。 摘要陈述该价值函数在人类偏好数据上训练;训练规模、数据构成与优化细节未在所提供文本中给出。

在多个 LLM 主干上的广泛评测显示,该框架持续减少有害输出,同时保持流畅性、连贯性与事实效用,整体表现优于先前对齐基线且未牺牲生成多样性。 相对先前对齐基线,报告的是整体性能更优,并且明确强调生成多样性未被牺牲。 摘要层面的多主干评测结论;具体基准、指标数值与统计细节未在所提供文本中列出。

启示与展望

该框架面向需要安全且可靠部署 LLM 的场景,适用于希望在减少有害输出的同时不牺牲流畅性、连贯性、事实效用与生成多样性的实践者;其设计意图是在多个 LLM 主干上通用,并以轻量方式替代高成本对齐流程。所提供文本为摘要级内容,未给出具体基准名称、评测指标数值、模型清单与超参数设置,因此适用边界应按“多主干评测显示一致趋势”来理解,而非按某一具体模型或某一具体危害类别来理解。

所提供文本仅含摘要与 arXiv 页面导航信息,缺少图表、基准明细、指标数值与消融结果,因此无法在此判断不同主干间的差异幅度、投影子空间的构造细节以及价值函数训练数据的规模与来源。读者若关心这些方面,需要回到原文正文与随附代码;此外,摘要所述“优于先前对齐基线”的具体比较条件与评测协议,也需在正文中确认。

来源