跳到主要内容
返回时间线
arXiv来源发表:

近50万个名字与12个分词器显示:名字能否成为单个token,会改变模型对奖学金、招聘、临床与贷款判断中的概念可及性

核心概要

该研究提出NameTrace框架,在近50万个名字和12个LLM分词器上测量名字的直接词元支持,并在同一族裔-性别分层内匹配原子名与短碎片名,发现原子名在奖学金、招聘、临床评估和贷款四个任务轴上的任务对齐概念可及性系统性更高,该差异在全部八个分层中持续存在、可迁移到未见名字,且沿任务方向的隐状态干预会改变后续受限选择。

AI-generated editorial illustration: Who Gets a Token, and What Does It Carry? Unequal Name Support and Concept Access in Large Language Models

深度剖析

名字的直接词元访问高度选择性且与人口统计元数据相关:在7,469个高频高置信名字中,男性关联名字的任一tokenizer原子访问率为49.8%,女性关联为25.7%;族裔分组从NH Black关联的17.6%到NH White关联的47.2%,亚裔/太平洋岛民关联为46.4%。 此前关于名字偏好的研究多停留在行为层面或小规模词表观察,这里把词元层面的可比性作为独立变量,在近50万名字与12个分词器上系统量化,并给出调整频率与长度后的比值比。 逻辑回归显示对数频率每增加一个标准差对应2.94倍原子访问几率,长度对应0.51倍;男性关联相对女性关联为3.36倍,Hispanic与NH Black关联相对NH White关联分别为0.47与0.42倍,亚裔/太平洋岛民关联为1.55倍;交叉分层从NH Black女性关联的12.1%到NH White男性关联的64.8%。

在族裔-性别分层内匹配的原子名与短碎片名之间,原子名在四个任务轴上的任务对齐概念可及性更高:奖学金/潜力加权差距0.131,招聘/能力0.072,临床关注0.059,贷款/可信度0.051。 以往名字公平性评估通常只看最终回答,这里在中间层用模型自身在任务形容词轴上的概率分布做行为前测量,且形容词按任务对齐权重连续加权,因此临床关注轴上即使通用情感极性反转(如worried、ill)仍出现正向差距。 200对匹配名字(400个名字)分为100对开发集与100对未见评估集,匹配频率、字符长度、人口关联强度、元数据置信度与弱正字法线索;四个任务轴在强、边缘、弱证据条件下均给出正向池化差距与95%置信区间。

该支持关联差异在全部八个族裔-性别分层中持续存在,并跨模型家族出现,但幅度与方向依架构、层深与训练阶段而变。 这说明差异不是由组间构成差异驱动,而是同一分层内部名字表面支持不同所致;同时把架构与训练阶段作为结果的一部分,而非仅报告单一模型的平均效应。 模型×分层单元中奖学金22/24、招聘24/24、临床23/24、贷款15/24为正;Qwen在四轴全为正,Llama幅度较小但方向一致,Ministral在招聘与临床为正、奖学金接近零、贷款为负;八模型扩展中23/32模型-任务均值为正、20/32置信区间为正;基础与后训练对比显示Qwen、Gemma的可及性剖面被重定向,Llama基本保持。

开发名字上估计的支持先验能预测未见名字的差距,且沿测量出的任务方向编辑名字表示会改变后续受限二选一决策。 前者说明支持关联模式具有跨名字的系统结构而非个别名字效应,后者说明该内部方向不只是可读出,还对后续计算具有杠杆作用,两者共同把词元层差异与下游选择连接起来。 减去开发先验后池化留出差距从0.131降至0.004(奖学金,减少96.6%)、0.072降至0.008(招聘,88.3%)、0.059降至0.003(临床,88.2%)、0.051降至0.014(贷款,72.9%);36个模型-任务-证据单元中先验与留出差距相关Pearson 0.94、Spearman 0.93,符号一致率94.4%;干预的前向减反向对比为Qwen 0.153、Llama 0.155、Ministral 0.094,Qwen与Llama全部200对、Ministral 195/200对按预期方向移动,且Qwen与Llama超过无关轴、极性打乱与随机子空间对照。

启示与展望

该工作面向模型评估与开发:分词器设计者可据此查看哪些名字表面获得直接词元支持,评估者可在目标分词器下检查每个名字并把名字表面支持作为独立评估变量,与人口元数据、频率和长度并列,必要时按支持分层或做敏感性分析。结论适用于高频、单字、ASCII名字且元数据关联可靠的情形,测量对象是名字表面作为词元输入的处理方式,而非具体个人或群体的特征;任务轴可扩展到新的应用概念,只要定义对齐与对立两极的形容词。

名字特定的预训练曝光未被直接观测,因此作者把词元支持表述为在主要可观测属性上匹配的名字之间的可测量预测因子,而非孤立的因果处理;中间层可及性可能被后续计算保留、削弱或改写,输出边界处招聘与临床关注甚至出现符号反转,因此内部可及性与最终开放式行为之间的关系仍是开放问题;效果幅度、任务覆盖与层定位随架构变化,Ministral在贷款轴上为负,八模型扩展中OLMo在贷款、Gemma-3-4B在招聘、Aya与Ministral在临床关注上为负;名字元数据是名字表面的聚合关联而非个人身份标签,其他命名习惯、语言、文字系统与文化语境是自然延伸;此外,若读者只看到快速解析而缺少图表与附录细节,部分分层与层定位的具体数值需要回到原文核对。

来源