MirroS 与清华北大团队提出 AgentGarten:用共享神经渲染器把代码世界变成实时可交互环境,智能体仅 4 轮就学会搭掩体、10 轮学会用斜坡
核心概要
AgentGarten 把模拟器或游戏引擎与一个共享的实时神经渲染器耦合起来:引擎维护持久状态并执行程序定义的交互规则,渲染器通过 Adversarial Forcing 蒸馏出四步块因果模型,把引擎导出的深度或法线条件实时转成视觉观测;在捉迷藏中,仅凭渲染画面行动的预训练智能体在第 4 轮用挡板搭出掩体、第 10 轮用斜坡翻墙,并在另外四个世界中通过逐轮撰写 playbook 提升成绩。
深度剖析
提出代码世界框架:场景程序在模拟器或游戏引擎中运行,维护持久状态并执行显式交互规则,共享神经渲染器从统一接口导出的结构化条件生成视觉观测,因此渲染误差不会累积进状态,同一段状态轨迹可以在不同外观参考或相机下重新渲染。 与把状态隐含在生成历史中的视频世界模型不同,这里状态转移不接收渲染观测作为输入;与依赖 3D 资产与复杂渲染管线的模拟器不同,新环境可以用代码编写,无需为每个场景制作专门视觉资产。 论文给出形式化定义(式 1、式 2)并说明条件为彩色深度或表面法线,二者均可由引擎直接导出或从真实视频估计(ViPE、Depth Anything 3、NormalCrafter)。
提出 Adversarial Forcing 蒸馏方法,把预训练双向视频模型转成少步、块因果的实时渲染器:在自 rollout 上做分布匹配,用精确重放让后续损失更新历史编码,并加入真实数据对抗目标与精确 R1/R2 正则。 精确重放采用逐块 SDPA 执行,与采样轨迹逐位一致,而 SGF 式全序列 FlexAttention 重放存在 3.99% 相对误差;精确 R1/R2 利用冻结骨干避免对融合注意力核做二次反向,无需随机扰动近似。 表 1 显示逐块 SDPA 重放误差为 0(逐位一致),前向时间从 2.95 s 降到 2.79 s,峰值显存变化 0.2%;图 7 对比显示 Self Forcing 长 rollout 出现重复表面纹理并丢失细节,Adversarial Forcing 保持自然纹理。
在单张 NVIDIA H100 上实现实时推理:手写 Triton 核融合注意力周边逐元素操作,CUDA 图捕获消除启动开销,可选蒸馏微型解码器在 10 ms 内重建像素帧,整体吞吐超过 35 帧/秒。 不依赖 torch.compile 以避免分钟级冷启动编译延迟;用有界 KV 缓存(5 个 sink 加 44 个近期隐帧)与顶对齐旋转位置重映射支持超出训练时长的 rollout。 表 2 给出一个 16 帧服务块的分解:条件编码 10.6 ms、Transformer 四步去噪与缓存发布 414.4 ms、微型解码器与主机传输 8.8 ms,总墙钟 438.8 ms,吞吐 36.5 帧/秒。
用预训练基础模型智能体在代码世界中做逐轮练习:智能体只通过渲染观测感知世界,每轮结束后把经验写成 playbook 供下一轮新对话中的智能体继承,在捉迷藏与另外四个世界中成绩随轮次提升。 与从随机权重自对弈强化学习不同,这里智能体已具备关于物体、工具和几何的抽象知识,主要挑战是把抽象知识落地为闭环感知运动执行;playbook 在独立智能体之间传递,每条经验必须写到另一个读者能核验的程度。 捉迷藏中 hider 第 4 轮用挡板搭掩体、seeker 第 10 轮用斜坡翻墙,对照 2019 年自对弈研究约 2500 万与 1 亿训练回合;表 4 显示陪伴狗参与度分数 13→19、单车道桥双方到达时间 71→41 秒、牧羊四只羊全部入栏、采石场装载机第 4 轮得 90.9 分。
启示与展望
该框架面向需要可检查状态与可编程交互规则、同时希望获得真实感视觉观测的具身智能体训练与评测场景。它使新世界可以写成代码并经同一渲染器呈现,因此环境数量与难度能够随智能体一同扩展;对研究者而言,这意味着可以在不制作专门视觉资产的前提下构造导航、操作、工具使用与多智能体交互任务,并让预训练智能体在只看到渲染画面的条件下练习。捉迷藏结果适用于顺序一躲一找、智能体提交短 Python 程序行动、且不接收物体坐标或对手私有观测的设定;四个附加世界各自有独立动作、时限与计分,仅在任务文件中告知智能体。
捉迷藏与四个世界的成绩来自一次记录运行,轮次数量有限,尚不清楚在更多随机种子与布局下结果如何波动。论文明确指出捉迷藏中 4 轮与 10 轮同 2019 年研究的 2500 万与 1 亿训练回合反映的是两种不同学习范式,而非直接的样本效率比。条件接口只传递几何,旋转对称物体的自转、材质、颜色与物体身份不由几何决定,只能靠视觉历史携带,长时间遮挡或超出记忆窗口的重访后可能丢失。未来工作提出用更抽象紧凑的状态表示(如结构化文本或高维隐特征)作为条件接口,但如何与代码世界状态对齐并适配预训练视频模型仍是开放问题。此外,本总结依据的是论文正文与附录,未包含图 1 至图 11 的逐帧内容,因此对视觉质量与涌现行为的描述以正文文字与表格为准。
