Faynt 用单一检查点控制《任天堂明星大乱斗DX》全部26名角色,10M 模型在同角色对局中赢下244场中的240场
相关研究与后续进展核心概要
作者提出 Faynt,一组 10M 与 75M 参数的 Transformer 策略,每个检查点即可控制《任天堂明星大乱斗DX》全部 26 名角色;经强化学习后,10M 模型在与十四个专家及多角色版本的 244 场同角色对局中赢下 240 场(98.4%),对每个版本均保持胜绩,并在与私下提供的零延迟 Slippi-AI 模型的 68 场对局中全部获胜;训练流程包含约 84 万条人类录像的预训练、排名与结果课程、75M 到 10M 蒸馏以及限定于 Fox 镜像对局的强化学习,同时开源权重、两套基准与自动锦标赛平台。
Figure 1: Faynt policy architecture. Dashed connections supply current controller categories directly to the output heads. The main-stick head also conditions on the next joint-controller category, using the recorded target during imitation training and a sample during play. AttnRes denotes Full Attention Residuals.
arXiv深度剖析
单一检查点即可覆盖全部 26 名角色,并在同角色对局中取得 244 场 240 胜(98.4%),对十四个专家与多角色版本均保持胜绩。 以往同类发布多为按角色或按阵容分别训练的策略,这里用一个检查点统一覆盖全部角色,并在各版本所支持的阵容上逐一取得胜绩。 摘要报告的是同角色对局计数(240/244)与对每个版本的胜负记录;对手保留 21 或 24 帧动作延迟,而 Faynt 不额外加延迟,作者明确表示尚未分离这一差异的影响。
在初始 152 场基准上,监督训练的 10M 模型胜率 69.7%,高于预训练 75M 的 45.4%,尽管其整体留出控制器预测损失更高。 这一结果把模型规模、监督损失与对局胜率之间的关系摆在一起:更大的模型与更低的预测损失并未带来更高的胜率。 基于 152 场基准的胜率对比,并指出用于监督检查点选择的加权验证损失与四个预训练及监督策略的胜率排序一致。
监督后训练后,两个模型每分钟承受伤害更少、更早建立更大领先,并在丢掉第一条命后更常获胜。 把后训练的效果从单一胜率扩展到伤害、早期领先与落后局面下的翻盘表现等对局过程指标。 摘要层面的行为指标描述,未给出各指标的具体数值或统计检验。
在 NVIDIA T4 上对录制对局状态做优化推理,10M 平均每次决策 5.2 ms,75M 为 8.7 ms,不含模拟器执行与通信。 给出两种规模策略的实际推理延迟,使部署成本可与模型规模一并权衡。 在录制对局状态上测得的平均延迟,明确排除模拟器执行与通信开销。
启示与展望
这项工作面向《任天堂明星大乱斗DX》的竞技对局,适用于希望在同一检查点下覆盖全部 26 名角色、并在既有版本阵容上做同角色比较的研究者与工程实践者。开源的权重、两套基准与自动锦标赛平台,使后续工作可以在相同条件下复现胜率比较、检验蒸馏与课程设计的迁移效果,并把推理延迟纳入部署权衡。
对手保留 21 或 24 帧动作延迟而 Faynt 不额外加延迟,作者明确表示尚未分离这一差异的影响,因此胜率差距中有多少来自延迟条件仍待厘清。监督 10M 胜率高于预训练 75M 却伴随更高的留出控制器预测损失,这一现象与加权验证损失排序一致,但其适用范围需要更多设置来确认。伤害、早期领先与翻盘指标目前只有方向性描述,缺少具体数值。本次读取范围仅为摘要,正文中的图表、超参数细节与统计信息未纳入,相关结论有待原文核对。
