arXiv 2026年10月5日该工作提出 DNAlign,一个把控制论优化与零空间投影结合的轻量对齐框架:将 LLM 视为动态系统并施加可控扰动以引导生成走向安全行为,投影模块把扰动限制在由中性隐藏状态导出的有害相关子空间内以保留通用知识与回答质量,并用人类偏好数据训练的价值函数自适应优化控制信号;在多个 LLM 主干上的评测显示其持续减少有害输出,同时保持流畅性、连贯性与事实效用,整体表现优于先前的对齐基线且未牺牲生成多样性。该工作提出 DNAlign,一个把控制论优化与零空间投影结合的轻量对齐框架:将 LLM 视为动态系统并施加可控扰动以引导生成走向安全行为,投影模块把扰动限制在由中性隐藏状态导出的有害相关子空间内以保留通用知识与回答质量,并用人类偏好数据训练的价值函数自适应优化控制信号;在多个 LLM 主干上的评测显示其持续减少有害输出,同时保持流畅性、连贯性与事实效用,整体表现优于先前的对齐基线且未牺牲生成多样性。DNAlign 用零空间投影把安全扰动限制在有害子空间,在多个 LLM 主干上降低有害输出且保持流畅与事实效用该工作提出 DNAlign,一个把控制论优化与零空间投影结合的轻量对齐框架:将 LLM 视为动态系统并施加可控扰动以引导生成走向安全行为,投影模块把扰动限制在由中性隐藏状态导出的有害相关子空间内以保留通用知识与回答质量,并用人类偏好数据训练的价值函数自适应优化控制信号;在多个 LLM 主干上的评测显示其持续减少有害输出,同时保持流畅性、连贯性与事实效用,整体表现优于先前的对齐基线且未牺牲生成多样性。该工作提出 DNAlign,一个把控制论优化与零空间投影结合的轻量对齐框架:将 LLM 视为动态系统并施加可控扰动以引导生成走向安全行为,投影模块把扰动限制在由中性隐藏状态导出的有害相关子空间内以保留通用知识与回答质量,并用人类偏好数据训练的价值函数自适应优化控制信号;在多个 LLM 主干上的评测显示其持续减少有害输出,同时保持流畅性、连贯性与事实效用,整体表现优于先前的对齐基线且未牺牲生成多样性。