Socio-Foundation 以三阶段分层蒸馏让 8B 模型在个体行为模拟上比 Qwen3-8B 提升 11 分
核心概要
该工作提出 FONTS 五维个体模拟能力分类,并据此构建约 1000 万条实例的训练语料库与三阶段后训练流程 Socio-Foundation:先用 DAPO 训练任务专家,再按能力维度经离策略蒸馏合并为五个能力专家,最后用多教师同策略蒸馏统一为单一模型;在自建 IndiEval 上平均分 61.7,比 Qwen3-8B 基线高 11.0 分,并在三个分布外基准上优于基线。
Figure 1: Three approaches to individual simulation. (a) General-purpose models may flatten distinct personas. (b) Task-driven post-training yields fragmented skills. (c) Individual simulation Foundation model integrates complementary capabilities.
arXiv深度剖析
提出 FONTS 分类,把个体模拟拆成 persona fidelity、outcome realization、behavioral naturalness、trajectory coherence、social grounding 五个互补能力维度,并据此从 40 多个数据集中筛选 14 个、整理出约 1000 万条实例的训练语料库。 此前个体模拟任务分散在角色扮演、用户模拟、认知建模等不同设定中,缺少共享的能力结构;FONTS 用一套维度形式化这些任务共同的行为要求,使异构任务可以按能力而非按数据集组织。 分类由自下而上的标注聚类(19 个标签、8 个初步簇)与参照 McAdams 和 Pals 新大五人格框架的自上而下合并两步得到,附录给出 44 条数据集/任务条目与 10 条补充基准条目的逐条标注,并说明同一数据集在不同任务解释下可归入多个维度。
提出三阶段后训练流程:用 DAPO 在隔离环境中训练任务专家,按能力归属经离策略蒸馏合并为五个能力专家,再用多教师同策略蒸馏(MOPD)在模型自生成前缀上统一为单一学生模型。 相比直接把多任务数据混合微调或直接合并专家权重,该流程把“专精”与“整合”解耦,先让相互冲突的行为目标各自成熟,再在能力层聚合,最后用同策略前缀减少蒸馏与自回归推理之间的分布错配。 消融显示完整流程平均分 61.7 最高;把末段同策略蒸馏换成能力专家离策略蒸馏降至 59.3,能力专家权重平均为 56.8,任务专家权重平均为 54.5,任务专家 SFT 与任务专家 OPD 分别为 59.5 与 54.2,池化数据 SFT 为 43.0,反向 KL 的 OPD 为 50.9;去掉任一能力专家都会降低总平均分,其中去掉 N 专家降幅最大。
构建 IndiEval 评测套件,把 13 个基准条目上的 29 个原生指标归入 FONTS 五维,并保留各基准原有评测协议;Socio-Foundation 在 29 个指标中的 24 个上优于 Qwen3-8B,平均分 61.7 对 50.7。 此前个体模拟评测分散在各任务自有指标上,难以横向比较;IndiEval 在不改动原生协议的前提下提供跨任务的能力维度视图,并区分域内与分布外两部分。 主表覆盖 13 个评测条目共 6297 个案例,域外部分为 AgentSense 与 UserLM-LiC;另有 Mistakes、HiToM、τ-USI 三个基准作为额外分布外评测,Socio-Foundation 分别取得 57.00、62.00、69.31,均高于 OSim 8B 与 Qwen3-8B 两个对照。
在重复评测稳定性分析中,对固定检查点做五次重复评测,LifeChoices 准确率、HUMANUAL 响应/状态对齐与 MirrorBench GTEval 的逐次标准差低于 0.6 个百分点,而同一基准内 PI、RNR 等指标波动更大。 该分析把评测流程按自动打分、LLM 打分、交互式评测三条路径分类,并用固定人类参考对话作为对照来观察辅助打分环节的波动,为解读小幅分数差异提供参照。 五次重复共 6500 次案例评测、覆盖 1300 个不同测试案例,检查点、评测种子、提示、测试用例与打分配置固定;人类参考 RNR 五次得分为 90.0、92.0、90.0、90.5、91.0,均值 90.700、标准差 0.837。作者明确说明该分析不用于判定模型差异的统计显著性。
启示与展望
该结果面向以 LLM 复现特定个体在社交情境中沟通、决策与回应的研究与应用,包括人格化对话、用户行为预测、社会科学实验与多智能体角色扮演。方法层面,流程在 Qwen3-8B 骨干上以 rank-32 LoRA 实现,训练使用 bfloat16、16384 token 上下文与关闭思考模式,任务专家用 DAPO 训练 200 步,能力专家每维 200 次更新,最终学生 200 步训练预算,DeepSeek-V4-Flash 同时充当辅助对话模型与奖励/评判模型。评测层面,IndiEval 保留各基准原生协议,平均分对 F/O/N/T/S 五维等权,维度内先按数据集内指标平均、再按数据集等权;域内与域外(AgentSense、UserLM-LiC)共同计入平均分,Mistakes、HiToM、τ-USI 不计入。重复评测稳定性分析针对固定检查点,用于为小幅分数差异提供参照。
FONTS 维度与数据集的对应关系由作者标注与聚类得到,同一数据集在不同任务解释下可归入不同维度,附录也说明这些归属是作者的能力组织而非原数据集作者的类别标签,因此维度边界在不同使用场景下可能被重新划分。评测平均分对五维等权,而各维覆盖的数据集条目数为 8/3/3/2/3,维度内数据集数量差异会影响平均分的构成。重复评测稳定性分析只覆盖 LifeChoices、HUMANUAL、MirrorBench 三条路径,作者明确说明它不构成全部 IndiEval 任务的代表性样本,也不用于判定模型差异的统计显著性;要分离评判模型自身波动,还需对冻结的响应或对话轨迹重新打分。此外,主表与消融表中的部分指标在不同模型上出现 0.0 等极端取值,其成因在正文中未逐一展开。
