灵初智能发布Psi-R2.5:用逆向生成量产强Pair Data,HIL+RL后训练把现场成功率提到99%
核心概要
灵初智能发布具身智能模型Psi-R2.5,采用高层规划器(QwenVL3.5-4B)加低层控制器(Wan2.2-IT2V-5B)的双层架构,提出并落地“强Pair Data”标准,通过逆向调用Psi-W0世界模型从真机执行轨迹反向生成人手示教视频,蒸馏出端到端人机数据转换模型,并配套灵巧手HIL人在回路加RL后训练框架,称经几轮迭代后可将成功率提高到99%且只需1-2个工作日,同时以仿真评测嵌入预训练流程和50项真机多任务评测集衡量组合泛化。
深度剖析
提出并落地“强Pair Data”标准:在交互对象一致的基础上实现场景细节逐帧对齐、时序轨迹一一匹配,转换生成的机器人动作序列可直接在真机回放并完整复现任务。 文章称行业普遍依赖“弱Pair Data”,仅满足任务语义相似,场景细节与时序帧序列无法精准匹配;强Pair Data把人类操作动力学域对齐到机器人执行动力学域。 以两项自设验证标准呈现:转换后轨迹可在真机回放复现,以及基于转换数据做后训练可泛化到同类新任务;文中称“绝大多数”转换后的人类示教数据可直接驱动机器人完成任务,但未给出具体样本量或统计口径。
提出逆向生成思路:不再从人类数据拟合机器人数据,而是逆向调用Psi-W0世界模型,基于海量高精度机器人执行轨迹批量生成场景、时序、动作高度匹配的人手示教视频,并据此蒸馏出端到端人机数据转换模型。 相比R2版本用Psi-W0替代传统仿真器、通过强化学习优化人手轨迹但流程繁琐、依赖策略模型与世界模型反复迭代推演的方案,逆向生成被描述为更高效量产强Pair Data的路径。 文章以定性对比说明逆向生成相对Real2Sim仿真重建迁移、图像分割加修补替换机械手等过往方案的优势,并称普通手机、相机拍摄的人手操作视频可一键转化为机器人视觉画面与可执行动作序列;未提供量化对比数据。
配套灵巧手HIL人在回路加RL强化学习后训练框架:依托基础模型底座,仅需少量示教数据即可微调适配复杂业务场景,部署中实时收集失败案例并自动回流迭代。 把后训练与现场数据回流作为商业化落地的核心环节,而非只依赖纯预训练基础模型。 文章称经几轮迭代后模型可将成功率提高到99%,且只需1-2个工作日,并称该方案已部署在实际客户现场;未披露任务类型、试验次数或统计方法。
评测体系上把仿真评测深度嵌入模型预训练全流程,并自研包含50项高难度复杂任务的真机多任务专属评测集,测评全程随机重置任务初始状态。 以随机重置初始状态的方式规避过拟合,用于衡量组合泛化与复杂场景适配能力。 文章给出50项任务这一规模数字与随机重置这一设计,但未报告具体评测分数或与基线的对比结果。
启示与展望
文章面向的是需要把人类示教数据转化为机器人可执行数据的具身智能研发与工业部署场景,尤其是SKU品类繁杂、作业节拍高度定制化的现场。它给出的可复用资产包括:强Pair Data的判定标准(交互对象一致、场景细节逐帧对齐、时序轨迹一一匹配、转换轨迹可真机回放)、逆向生成加蒸馏的端到端转换模型、以及HIL加RL的后训练与失败案例回流流程。对读者而言,这套框架可用于评估自身数据管线是否只停留在“弱Pair Data”,并判断是否需要把评测嵌入预训练流程、是否需要自建真机多任务评测集。
文章未披露强Pair Data的生成规模、转换模型的训练数据量与结构、99%成功率对应的任务类型与试验次数,也未给出50项真机评测集上的具体分数或与基线的对比。ICL部分称“无需更新模型参数、无需二次训练”即可零样本泛化完成全新复杂任务,但技术细节被明确留待后续发布,演示Demo仅在项目主页提供。因此读者仍会关注:逆向生成的人手示教视频在多大范围内保持与真机轨迹的逐帧匹配,以及HIL加RL的成功率提升在不同任务与硬件上是否稳定复现。
