PersonaDose 把“人格强度”变成可请求的分数:在三个模型家族上把核心特质表达提高 17.8–33.2 分,并在 14–22/28 个可达目标上把误差压到 4.7–6.2 分
核心概要
该工作提出“人格剂量”任务,用特质描述加一个请求的平均强度分数来控制语言模型,做法是在人格响应上专门化一个共享的、由描述条件化的 FLAS 控制器,再用测得的特质表达曲线把流时间标定到分数单位;在 Llama-3.1-8B、Qwen3-8B、Gemma-3-4B 上,PersonaDose 在 Persona Vectors 的 75 连贯性下限处把核心特质表达相对对比式激活加法(CAA)提高 33.2、18.3、17.8 分,标定选出的设置在留出问题上保持表达优势,七个已训练特质上的标定请求在每模型 28 个目标中 14–22 个可达目标上取得 4.7–6.2 分的平均命中误差。
深度剖析
把激活干预的强度参数翻译成行为分数:特质描述决定“表达什么”,流时间决定“表达多强”,训练时并不把响应与请求的目标强度配对,标定在训练之后用测得的剂量—反应曲线把请求分数反解为流时间。 此前的激活干预(CAA、RepE、表征工程等)只暴露一个没有内在行为含义的强度系数,同一系数在不同特质和模型上诱导的表达水平不同;该工作把“可达的行为范围”与“在该范围内请求的精度”分开,并给出以行为单位表达的接口。 论文给出形式化定义(响应曲线、连贯性下限、强度命中),并在三个模型家族上按同一评分协议(GPT-4.1-mini 独立打分特质表达与连贯性,0–100 分)评估;标定用等渗回归加分段线性反解,落在拟合范围外的目标在测试前即标记为不可达。
人格响应专门化显著扩大高连贯性下的表达范围:在平均连贯性 75 处,PersonaDose 的核心特质表达为 75.1、82.3、86.0,而 CAA 为 41.9、64.0、68.2,对应增益 33.2、18.3、17.8 分;通用 FLAS 为 13.3、46.2、42.7。 增益集中在方向基线几乎无法在高连贯区间表达的特质上:Llama 上 sycophantic 从 9.7 升到 90.5、impolite 从 1.6 升到 72.3;Qwen 与 Gemma 上最大改进在 evil,分别从 3.3 升到 71.5、从 21.2 升到 68.9。 表 1 与表 2 给出三模型、五方法的峰值表达对比,附录 D 给出全部七个特质的逐特质结果;强度扫描使用全部 20 个问题、每问题 10 条响应,区间用 2,000 次问题自助重采样。
表达优势在留出问题上保持,但标定所用的连贯性下限并不在每个特质上都迁移:用十个标定问题选出的设置,在十个不相交测试问题上得到平均表达 75.6、80.3、84.8(CAA 为 43.5、63.3、68.0),配对增益 32.1 [26.4, 37.8]、17.0 [10.4, 23.7]、16.8 [12.4, 21.5],平均连贯性 75.5、83.2、79.4,仅 1/3、2/3、3/3 的特质在测试集上仍守住下限。 把“标定选择”与“测试评估”分离,说明表达增益可迁移,而连贯性约束需要按特质在留出问题上重新检查,这是此前只报告扫描峰值的工作没有分开的两件事。 留出评估固定标定策略,配对自助区间共享问题抽样;论文明确指出扫描峰值在同一批问题上既选强度又评估强度,留出测试把这两步分开。
标定后的中间强度请求在留出问题上可被实现,但覆盖范围与精度是两件事:七个已训练特质上平均命中误差为 6.1、6.2、4.7 分,可达请求为 22/28、20/28、14/28,其中同时达到测试连贯性下限的为 19/28、20/28、13/28;Qwen 控制器继续训练后留出表达从 78.7 升到 93.7(配对增益 15.0 [7.3, 23.3]),重新标定后支持 11/12 个连贯请求,而标定 CAA 为 8/12。 把“控制器学到的行为范围”与“在该范围内请求的准确度”作为两个独立指标报告,并展示控制器更新会改变标定映射(同一 sycophancy 60 在初始与继续检查点上选中不同强度),因此更新后需要重新测量曲线。 表 4、表 5、表 6 与附录 F、G 给出逐格流时间、表达、绝对误差与连贯性;论文同时说明两套 MAE 覆盖的请求集合不同,因此不构成配对精度优势,且次级评判者的 MAE 区间包含零。
启示与展望
该结果面向需要在受控研究环境中按强度研究人格特质的实验者:同一模型内七个特质共享一个控制器,切换特质不需要加载不同适配器,不同基座模型各有独立控制器;请求分数指定的是跨问题与跨采样响应的平均表达,标定只在拟合范围内有效,范围外目标在测试前即被标记为不可达。它使“按分数请求强度”在 Llama-3.1-8B、Qwen3-8B、Gemma-3-4B 上可操作,并提示控制器更新后应重新测量映射曲线。
评估覆盖七个已训练特质、短响应与 PV 评判分数,未建立对未见特质或长对话的泛化;可达强度层数因特质而异,optimistic 在每个模型上只有一个可达目标,Gemma 的 hallucinating 没有可达目标;被评估的强度非负,低于未干预表达水平的目标可能落在范围外;连贯性衡量可读性,不衡量事实正确性或安全性;扫描峰值在同一批问题上选强度并评估,留出测试虽分离两步,但标定连贯性下限未必在每个测试特质上成立;自助区间以固定控制器为条件,不涵盖训练或评判者变异;两套命中误差覆盖不同请求集合,不构成配对优势;控制器继续训练同时改变多项训练选择,其效果不能归因于单一改动。
