跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

Faynt 用单一检查点控制《任天堂明星大乱斗DX》全部26名角色,10M 模型在同角色对局中赢下244场中的240场

作者提出 Faynt,一组 10M 与 75M 参数的 Transformer 策略,每个检查点即可控制《任天堂明星大乱斗DX》全部 26 名角色;经强化学习后,10M 模型在与十四个专家及多角色版本的 244 场同角色对局中赢下 240 场(98.4%),对每个版本均保持胜绩,并在与私下提供的零延迟 Slippi-AI 模型的 68 场对局中全部获胜;训练流程包含约 84 万条人类录像的预训练、排名与结果课程、75M 到 10M 蒸馏以及限定于 Fox 镜像对局的强化学习,同时开源权重、两套基准与自动锦标赛平台。