arXiv 2026年10月2日作者提出 Faynt,一组 10M 与 75M 参数的 Transformer 策略,每个检查点即可控制《任天堂明星大乱斗DX》全部 26 名角色;经强化学习后,10M 模型在与十四个专家及多角色版本的 244 场同角色对局中赢下 240 场(98.4%),对每个版本均保持胜绩,并在与私下提供的零延迟 Slippi-AI 模型的 68 场对局中全部获胜;训练流程包含约 84 万条人类录像的预训练、排名与结果课程、75M 到 10M 蒸馏以及限定于 Fox 镜像对局的强化学习,同时开源权重、两套基准与自动锦标赛平台。作者提出 Faynt,一组 10M 与 75M 参数的 Transformer 策略,每个检查点即可控制《任天堂明星大乱斗DX》全部 26 名角色;经强化学习后,10M 模型在与十四个专家及多角色版本的 244 场同角色对局中赢下 240 场(98.4%),对每个版本均保持胜绩,并在与私下提供的零延迟 Slippi-AI 模型的 68 场对局中全部获胜;训练流程包含约 84 万条人类录像的预训练、排名与结果课程、75M 到 10M 蒸馏以及限定于 Fox 镜像对局的强化学习,同时开源权重、两套基准与自动锦标赛平台。Faynt 用单一检查点控制《任天堂明星大乱斗DX》全部26名角色,10M 模型在同角色对局中赢下244场中的240场作者提出 Faynt,一组 10M 与 75M 参数的 Transformer 策略,每个检查点即可控制《任天堂明星大乱斗DX》全部 26 名角色;经强化学习后,10M 模型在与十四个专家及多角色版本的 244 场同角色对局中赢下 240 场(98.4%),对每个版本均保持胜绩,并在与私下提供的零延迟 Slippi-AI 模型的 68 场对局中全部获胜;训练流程包含约 84 万条人类录像的预训练、排名与结果课程、75M 到 10M 蒸馏以及限定于 Fox 镜像对局的强化学习,同时开源权重、两套基准与自动锦标赛平台。作者提出 Faynt,一组 10M 与 75M 参数的 Transformer 策略,每个检查点即可控制《任天堂明星大乱斗DX》全部 26 名角色;经强化学习后,10M 模型在与十四个专家及多角色版本的 244 场同角色对局中赢下 240 场(98.4%),对每个版本均保持胜绩,并在与私下提供的零延迟 Slippi-AI 模型的 68 场对局中全部获胜;训练流程包含约 84 万条人类录像的预训练、排名与结果课程、75M 到 10M 蒸馏以及限定于 Fox 镜像对局的强化学习,同时开源权重、两套基准与自动锦标赛平台。