Tiny Aya L2-Thinker 用三类数据混合把母语推理率从 12.8% 提到 93% 以上,六项基准中五项精度仅降两到三点
相关研究与后续进展核心概要
该工作基于 32K 上下文的 Tiny Aya 基座,用英文推理数据、约 44 种语言各约 5,000 条自动翻译的多语言推理数据以及多语言非推理数据三类“支柱”混合训练出 Tiny Aya L2-Thinker,在 60 种语言、六项基准上把母语推理率从 12.8% 提升到 93% 以上,五项基准精度下降不超过两到三点,开放写作基准略有提升,但竞赛级数学基准 PolyMath 精度下降更明显。
深度剖析
仅用英文推理数据训练时,模型即使用户要求也只在 12.8% 的情况下用用户语言推理;加入约 44 种语言各约 5,000 条自动翻译的多语言推理数据后,该比例升至 86.1%,且精度同时提升。 此前工作显示母语推理往往以精度下降为代价,或需依赖复杂昂贵的训练来避免这一代价;这里用相对极小的多语言推理数据量实现了语言切换与精度同向改善。 对照来自同一基座、同一底层数据但用英文推理的 Tiny Aya En-Thinker 孪生模型,母语推理率由语言识别模型对每条推理轨迹判定;数据规模与比例变化在文中明确给出。
多语言非推理数据(目标语言的问题与答案、无推理轨迹)使模型把母语推理能力迁移到训练中未见过推理示例的语言。 把“会不会解题”与“用哪种语言推理”拆成可分别由不同数据来源习得的两件事,并指出非推理数据因在以往多语言指令模型中被使用而更易获得。 文中报告训练覆盖 45 种语言,并称有证据表明该能力可迁移到未展示推理示例的语言;具体迁移评测细节指向论文。
在 60 种语言、六项基准(MGSM、PolyMath、Macaron-MCQ、GlobalPIQA、Marco-Bench-MIF、MIST-OEG)上,母语推理率从接近零升至 93% 以上,五项基准精度下降至多两到三点,开放写作基准 MIST-OEG 略有上升,英文提示下仍用英文推理并在多数基准上与英文推理模型持平。 以往评测多集中在数学与科学题,且只覆盖少数高资源语言;这里把评测扩展到文化常识、指令跟随与开放式写作,并按语言资源量分四档考察。 与同基座同数据的英文推理孪生模型直接对比,母语推理率由语言识别模型逐条判定;PolyMath 作为竞赛级数学基准是精度下降更明显的例外。
按语言资源量分档比较时,Tiny Aya L2-Thinker 是唯一在三项指标上随资源下降仍保持稳定的模型:母语推理率在最高两档接近上限 99%,最低两档仅降至 94.3% 与 94.5%,平均思考 token 少于 5,000;对比的 Magistral-Small-24B 母语推理率从 72% 跌至 5%,M-Thinker-7B 各指标均退化且轨迹长度约翻倍。 把效率(推理 token 数)与重复度纳入与母语推理率、精度并列的评估维度,而不只看准确率。 四档资源分层基于各语言网络文本量;重复度以轨迹内短文本序列重复频率衡量,并与推理长度作散点比较,显示二者同向上升。
启示与展望
该结果适用于以数据混合为核心、基于 32K 上下文 Tiny Aya 基座训练的多语言推理模型,训练覆盖 45 种语言、评测覆盖 60 种语言,并按网络文本量分四档资源层级;对希望让非英语用户读懂并核验推理轨迹的开发者与研究者,可直接复用其发布在 Hugging Face 的模型与多语言推理数据。方法本身以数据构成为杠杆,因此其结论最直接适用于同类基座与同类数据可得性的场景;竞赛级数学是文中明确标注的例外,作者将其归因于未经过强化学习阶段,并把以数学为重点的强化学习列为后续方向。
各数据支柱的详细分析与最终数据配比的确定过程在文中指向论文,因此从本文可确认的是三类支柱的构成与总体效果,而非具体配比数值。PolyMath 上精度下降更明显,作者以未经过强化学习阶段作为推测性解释,并指出翻译训练轨迹可能引入伪影,这一解释尚待验证。重复度与推理长度的同向关系基于所测模型的散点比较,效率问题作者也明确表示尚未解决。此外,推理轨迹可被用户读懂,并不等于它真正影响了最终答案,作者把让轨迹更有意义、更高效、更可解释列为后续工作。
