1,813 对英美变体贯穿审计:六套预训练语料、21 个后训练数据集与十个检查点都偏向美式英语
核心概要
该研究构建了 1,813 对匹配的美式英语—英式英语变体资源并提出免训练的 DiAlign 区域对齐估计方法,据此审计六个预训练语料、21 个后训练数据集、九个分词器与十个模型检查点以及两种提示条件下的生成结果,发现美式英语在数据暴露、表示与生成三个阶段均被系统性偏向,且英式英语提示只能部分改变这一默认。
深度剖析
研究把“English (US) 为何成为默认”当作贯穿 LLM 开发流程的结构性偏差来测量,用英式英语作为受控参照,在数据暴露、表示、生成三个阶段追踪同一方向的不对称。 此前关于英语变体的工作多集中在单一任务或单一环节(如词性标注、情感分析、检索),该研究把同一组匹配变体从语料频率一路带到分词、预测代价与生成,形成跨阶段的一致证据链。 作者自述这是首个覆盖 LLM 开发主要阶段的流程级结构性偏差研究;证据来自六个预训练语料、21 个后训练数据集、九个分词器、十个检查点与两个问答数据集的生成实验。
数据暴露阶段:六个预训练语料与 21 个后训练数据集全部偏向美式英语,正字法差异比词汇差异更强。 把“英语内部”的变体差异纳入数据审计议程,而不只审计语言构成、领域与质量。 预训练侧六个语料的正字法美式占比常超过 70%,Wilcoxon 符号秩检验显示六者均显著偏离均等;后训练侧覆盖 11,574,254 条样本、28,860,119 次显式变体出现,其中 76.17% 为美式,21 个数据集从 Databricks Dolly 15k 的 65.29% 到 WizardLM Evol-Instruct v2 的 89.72% 不等。
表示阶段:美式变体通常被分词器更紧凑地编码,且在句级 token 数相同的严格对照下,十个检查点都给英式反事实更高的逐 token 预测代价。 把分词效率、分词器来源谱系与模型自身分配的概率放在一起考察,说明紧凑切分与模型偏好是两个可分离的现象。 词汇类变体的 fertility 差距最大可达约 16%–19%;StableLM-2 的分词器与 GPT-4 在两组变体上 token 边界一致率为 100%,全部 100,256 个共享基础 token 保持相同 rank/id;预测代价分析含 85,150 条配对损失记录,所有配对 bootstrap 95% 置信区间均不含零,且五个模型家族的后训练检查点损失差距都更大。
生成阶段:中性英语提示下美式英语仍是主导默认,英式英语提示会向英式偏移但不能稳定消除该默认,且偏移幅度随模型与语域变化。 把上游的数据与表示不对称与下游实际输出行为连接起来,并显示输出层提示无法改变上游已确立的不对称。 在 Natural Questions 与 ELI5 两个语域、十个模型上,中性英语提示下多数输出被 DiAlign 判为美式;例如 Llama-3.3 在 ELI5 的英式提示下降到约 30% 美式分类输出;响应长度与美式对齐的相关性整体很弱。
启示与展望
该框架面向希望审计或设计区域语言行为的语料构建者、分词器设计者与模型评估者,适用于具备可靠来源的成对参照分布这一设定;作者说明 DiAlign 可扩展到其他英语变体乃至其他语言,只要能为两个变体各构建足够大且可比的参照语料。研究以英式英语作为受控参照,是为了让同一组对比能从语料统计一路贯穿到分词、预测代价与生成,从而支持跨阶段比较。
作者明确指出,跨阶段的一致性刻画的是结构性模式,因果分解需要重平衡数据重训、替换分词器或匹配的后训练干预等受控实验。参照变体目前限于英式英语,更广的英语变体与英语之外的扩展取决于能否构建合适的参照语料。分词器面板中 Llama-3.3 与 StableLM-2 属于继承或扩展美国来源的分词器工件,作者据此把它们与独立分词器分开报告。预测代价实验限于五个同时有公开基座与后训练检查点的模型家族,DeepSeek-V3 与 Velvet-2B 只进入分词器与来源分析。生成实验使用两个开放域问答语域与固定 50 词目标,长对话、专业领域、混合变体输入与创造性生成仍待检验。
