arXiv 2026年5月29日作者提出“通用 Transformer”:内部参数全部固定,仅通过合适的输入嵌入编码目标模型描述,即可模拟给定类别中的任意 Transformer;他们给出嵌入维度足够大时的显式稀疏构造,证明随机初始化的 Transformer 几乎必然具有通用性,并在括号匹配与多跳推理任务上做了实证验证,提示 Transformer 的表达能力可能很大程度存在于输入表示而非学习到的权重中。作者提出“通用 Transformer”:内部参数全部固定,仅通过合适的输入嵌入编码目标模型描述,即可模拟给定类别中的任意 Transformer;他们给出嵌入维度足够大时的显式稀疏构造,证明随机初始化的 Transformer 几乎必然具有通用性,并在括号匹配与多跳推理任务上做了实证验证,提示 Transformer 的表达能力可能很大程度存在于输入表示而非学习到的权重中。固定参数的通用 Transformer 通过输入嵌入模拟同类任意模型,并在括号匹配与多跳推理任务上得到验证作者提出“通用 Transformer”:内部参数全部固定,仅通过合适的输入嵌入编码目标模型描述,即可模拟给定类别中的任意 Transformer;他们给出嵌入维度足够大时的显式稀疏构造,证明随机初始化的 Transformer 几乎必然具有通用性,并在括号匹配与多跳推理任务上做了实证验证,提示 Transformer 的表达能力可能很大程度存在于输入表示而非学习到的权重中。作者提出“通用 Transformer”:内部参数全部固定,仅通过合适的输入嵌入编码目标模型描述,即可模拟给定类别中的任意 Transformer;他们给出嵌入维度足够大时的显式稀疏构造,证明随机初始化的 Transformer 几乎必然具有通用性,并在括号匹配与多跳推理任务上做了实证验证,提示 Transformer 的表达能力可能很大程度存在于输入表示而非学习到的权重中。