跳到主要内容
返回时间线
arXiv来源发表:

Ctrl-CWM 用世界模型想象未来规划人群:在多数人群真实感与碰撞指标上超过 CrowdES,并在仿真中实现避让与吸引的运行时控制

核心概要

作者提出 Ctrl-CWM,一个多智能体可控人群世界模型:先在真实行人视频上通过轨迹预测学习并冻结编码器以保留人体运动动力学,再用 actor 提出位移、critic 对想象人群轨迹排序、规划器结合 critic 分数与用户代价选择动作,从而在无需重训练的情况下实现人群生成与运行时控制;在 ETH–UCY、SDD、GCS 上,它在多数人群真实感与碰撞指标上优于 CrowdES,并在避让与吸引场景中取得最高平均合规度。

Source-provided article image: Controllable Crowd Generation through World-Model Planning
Figure 2 ·

Figure 2: Overview of Ctrl-CWM. Trajectory prediction trains the state encoder h θ h_{\theta} on real-world pedestrian data, which is then frozen. The actor π ψ \pi_{\psi} and critic V ϕ V_{\phi} are learned over imagined rollouts on this representation, and CEM adds a user cost to the critic score for run-time control.

arXiv

深度剖析

Ctrl-CWM 把世界模型的想象式规划原则迁移到人群仿真,用单一模型同时完成人群生成与运行时控制。 既有学习型方法要么控制局限于预定义人群与智能体参数,要么依赖梯度引导与样本筛选;本文改为在想象未来上规划,用户代价可在仿真中引入新目标而无需重训练。 方法层面给出状态、动作、actor、critic 与 CEM 规划器的完整定义,并在 ETH–UCY、SDD、GCS 上以共享到达过程对比 ORCA 与 CrowdES。

通过轨迹预测预训练并冻结编码器,可把真实行人运动动力学迁移到后续行为学习。 相对随机初始化编码器,预训练把运动学误差从 1.205 降到 0.465,多样性从 0.157 升到 0.285;预测头在 ETH–UCY 上取得 0.21/0.31 m 平均 ADE/FDE,在 GCS 上为 5.89/10.26 px(best-of-20)。 消融实验在相同行为学习流程下替换预训练编码器,并单独评估预测头;作者说明该对比本身不能确定冻结优于微调。

critic 引导的想象式规划在保持真实感的同时降低碰撞,用户代价负责驱动控制目标。 相对仅用 actor 生成,critic 引导规划把 DTW 从 0.970 降到 0.925、碰撞率从 0.931% 降到 0.756%,运动学误差仅从 0.432 升到 0.465;仅用用户代价的变体合规度更高(0.858 对 0.824),但在全部八项真实感与准确度指标上更差。 组件消融在同一避让协议与激活后评估窗口下比较;移除碰撞或运动学监督分别把合规度降到 0.645 与 0.772。

在运行时避让控制中,Ctrl-CWM 在全部测试区域配置上取得最高平均合规度。 多区域场景下平均合规度为 0.950,CrowdES 为 0.579,ORCA 为 0.087;圆盘与矩形区域同样领先。 每场景 10 次试验、评估最后三分之二片段,所有方法使用相同到达过程;作者指出基线使用初始化时的障碍物,因此干预时刻不同,并非在线目标激活的匹配对比。

启示与展望

该工作面向需要在仿真中动态改变人群目标的研究者与工程实践者,例如机器人导航训练、自动驾驶场景生成与城市设计评估。结果适用于以显式空间代价表达目标的设定:避让区域与吸引目标通过用户代价加入规划,改变目标或区域即可改变规划目标,而无需重训练模型或修改静态场景地图。作者报告默认规划参数(候选数、CEM 迭代数与规划时域)在约 10 ms 每次调用下平衡合规度、延迟与 DTW,并给出权重与发射器人口的敏感性扫描,说明控制强度与发射设置共同影响观察到的权衡。作者也指出,当前框架要求用户目标以显式空间代价而非高层语义命令给出,未来工作将把语言指令落地为规划目标。

读者仍会关注若干开放问题。避让合规度在权重至少为 25 时可能反映运动减慢或停止而非成功改道,作者明确提示这一点;吸引权重增大时运动学误差与碰撞率显著上升(在最高设置下平均变化为 +7.76 与 +26.5 个百分点),因此高合规度不应被解读为保持真实感或安全。权重与人口扫描每个配置仅一次试验且无变异性估计,作者称其趋势为描述性而非统计显著性。主避让对比中基线使用初始化障碍物,与 Ctrl-CWM 的在线目标激活干预时刻不同,并非匹配对比。此外,预训练对比不能确定冻结优于微调,预测准确度本身也不足以确立控制中所有反事实人群响应的准确性。生成指标中 Freq. 与 Cov. 在单类别数据上重合,排名并非彼此独立的测量。

来源