跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

用视觉语言模型自身判断作唯一奖励,离线学出xenobot自然语言干预接口,留出指令准确率80.0%

该工作把已有的干预-结果档案当作固定离线数据集,用视觉语言模型判断档案中的结果是否匹配自然语言描述,并以这一判断作为唯一训练奖励,为无神经系统的合成多细胞构造xenobot学出语言到干预的映射;该映射能泛化到全新指令,在训练时留出的档案数据上达到80.0%准确率,高于66.7%的随机基线,并与直接用真实标签训练的网络相当。