将语言主导性探测从跨语言迁移到26种阿拉伯语变体后,MSA并未成为LLM内部的主导表征,方言表征呈高度重叠
核心概要
该研究把Shani与Basirat(2025)的语言主导性探测框架从跨语言场景迁移到25种阿拉伯语方言与MSA,在BLOOM、mGPT及另外三个模型上逐层分析隐藏表征,发现归一化互信息显著低于跨语言情形、方言空间高度重叠,且逐层主导性得分接近均匀基线,因此没有证据表明MSA或任何方言构成内部主导参照点。
Figure 1: Layer-wise NMI values for cross-lingual vs. cross-dialectal representations for mGPT (left) and BLOOM (right). Dialectal NMI is lower and remains low over a wider middle-layer range. Cross-lingual representations were computed using Parallel Universal Dependencies (PUD) treebanks ( Zeman et al., 2017 ) (following Shani and Basirat (2025) ), cross-dialectal representations were computed using the MADAR corpus ( Bouamor et al., 2018 ) .
arXiv深度剖析
在26种阿拉伯语变体上,MSA并未表现出内部表征主导性:逐层主导性得分接近均匀基线1/|V|,且真实方言对齐弱于竞争方言的token比例在各层大致稳定在约30%,未出现跨语言场景中的中间层尖峰。 此前关于MSA偏置生成的讨论常把输出偏好直接读作内部主导的证据;该工作用对称的、不预设主导变体的探测设计,把“输出偏好”与“内部表征几何”明确分开检验。 基于MADAR平行语料的对齐token后验比较,对每一层汇总所有(token,竞争方言)对;同一探测在跨语言复现中能产生中间层尖峰,说明该工具在效应足够强时可检出方向性对齐。
阿拉伯语方言在隐藏空间中高度重叠但未被抹除:mGPT平均NMI约0.1、BLOOM约0.2,低NMI区间在中间层区间两端各多延伸1–3层;同时混淆矩阵仍保留清晰对角线,监督线性探针准确率在0.15–0.25之间,约为随机水平3.84%的4–6.5倍。 把语言主导性分析推进到高度相近的方言连续体这一细粒度场景,并同时使用无监督聚类与有监督探针两种诊断,显示低可分性不等于信息缺失。 BLOOM与mGPT各使用每变体400句平行样本(为原框架每语言样本量的四倍),并在附录中报告POS过滤、句首前缀移除与PCA维度敏感性分析,主要趋势保持一致。
方言可分性随深度的变化位置依赖架构:Meta-Llama-3.1-8B-Instruct保持相对稳定的方言可分性,Qwen2.5-7B出现早期急剧下降并在末层附近小幅回升,ArabianGPT-08B-V2的NMI直到较晚层仍较高随后急剧塌缩。 原框架主要在多语言模型上讨论中间层塌缩;该工作把多语言预训练模型与阿拉伯语原生预训练模型并置比较,显示以阿拉伯语为主的训练并不必然使方言更均匀可分,而可能把方言压缩推迟到更晚层。 在BLOOM与mGPT之外补充三个模型,每变体100句平行样本;作者说明该模型集合意在对比多语言与阿拉伯语原生预训练,而非穷尽评测现有阿拉伯语模型。
MSA偏置生成不能由内部MSA主导来解释:在所用探测框架下,MSA表现为众多变体之一,而非隐式的内部翻译枢纽;作者据此提出偏置可能来自生成流程的其他环节,如预训练与指令微调数据中MSA占比过高、MSA拼写相对标准化而方言拼写不规范,或RLHF与高频token路径塑造的解码偏好。 为“输出偏好是否等于内部路由”这一常见推断提供了反例式检验,并明确把生成偏置与表征几何列为需要分别分析的两个问题。 结论建立在逐层主导性统计、token级似然比分布与消融实验之上;作者同时说明区分上述替代解释超出本文范围,且结果应视为探索性而非关于阿拉伯语表征的定论。
启示与展望
该结果适用于以MADAR平行旅行语料为输入、在BLOOM、mGPT、Qwen2.5-7B、Meta-Llama-3.1-8B-Instruct与ArabianGPT-08B-V2上逐层提取隐藏状态的探测设置,其结论是关于这些模型在该语料上的内部表征几何,而非关于所有阿拉伯语模型或所有文本领域的普遍陈述。对从事方言NLP、表征探测与多语言模型分析的研究者,这提供了一个可复用的对照:当观察到生成偏置时,应把输出偏好与内部表征结构分开检验,而不是把前者当作后者的证据。作者也指出,若要把阿拉伯语变体更精确地定位在方言—语言连续体上,需要在相近语言家族上计算同样的可分性曲线。
读者仍需留意若干开放问题。语料限于MADAR旅行领域,每变体400句(BLOOM、mGPT)与100句(其余模型)属中等规模,作者提示部分结果可能反映写作者个体差异而非方言层面规律;规则式POS标注可能带来标注误差。主导性探测本身是对称的、不预设主导变体,因此“未检出主导”与“主导不存在”之间的区分依赖该探测的灵敏度,而灵敏度只在跨语言复现中得到间接验证。此外,生成偏置的其他候选来源(预训练与指令微调数据中MSA的占比、拼写标准化程度、RLHF与解码偏好)在本文中未被分离检验,作者明确将其列为超出范围的问题。
