跳到主要内容
返回时间线
arXiv来源发表:

用视觉语言模型自身判断作唯一奖励,离线学出xenobot自然语言干预接口,留出指令准确率80.0%

相关研究与后续进展

核心概要

该工作把已有的干预-结果档案当作固定离线数据集,用视觉语言模型判断档案中的结果是否匹配自然语言描述,并以这一判断作为唯一训练奖励,为无神经系统的合成多细胞构造xenobot学出语言到干预的映射;该映射能泛化到全新指令,在训练时留出的档案数据上达到80.0%准确率,高于66.7%的随机基线,并与直接用真实标签训练的网络相当。

AI-generated editorial illustration: Toward Controlling Biology with Language:Offline Learning of Prompt-Conditioned Interventions for Cells, Organoids, and Biobots

深度剖析

作者展示了一种完全离线的自然语言接口学习方式:把指令映射到档案中已记录为产生所述行为的干预,训练过程中不新增湿实验、也不使用人工验证。 以往把语言接口扩展到生命系统需要成对的语言-干预-结果数据,而每个样本都要单独做一次湿实验,成本高昂;该工作改为复用已有干预及其已观测结果的档案,把视觉语言模型的判断当作唯一训练奖励。 证据来自摘要所述的离线训练流程与留出评估:在训练时留出的档案数据上,新指令的准确率为80.0%,随机基线为66.7%,并与直接用真实标签训练的网络相当。

该语言到干预的映射能够泛化到训练中未出现过的全新指令。 泛化是在留出的档案数据上评估的,而不是在训练时见过的指令上评估,因此说明映射不是简单记忆已见指令。 摘要报告留出准确率80.0%,对照随机基线66.7%,并指出其与直接用真实标签训练的网络表现相当。

该接口面向的对象是xenobot,一种没有神经系统的合成多细胞构造。 把自然语言接口从代码、图像等有闭式语言含义的系统,扩展到没有闭式语言含义的活体干预场景。 摘要明确将xenobot描述为无神经系统的合成多细胞构造,并以此作为该离线学习方法的验证对象。

启示与展望

该结果面向已有干预及其已观测结果档案的场景:把档案当作固定离线数据集,用视觉语言模型判断结果是否匹配描述,从而在不新增实验、不做人工验证的条件下训练语言到干预的映射。它适用于希望以自然语言描述目标行为、再由系统指向档案中已记录干预的研究者与工程实践者,验证对象是xenobot这一无神经系统的合成多细胞构造。标题所提的细胞、类器官与生物机器人可视为该方法意图覆盖的应用范围。

读者仍会关心:视觉语言模型判断作为奖励的可靠性在不同描述与不同结果类型下如何变化;留出评估所覆盖的指令与行为范围有多广;该方法在xenobot之外的细胞、类器官与生物机器人上是否同样成立。本次可获取的是摘要级文本,未包含图表、档案规模与训练细节,因此上述问题属于待原文回答的开放问题。

来源