跳到主要内容
返回时间线
arXiv来源发表:

GenoTrace 用密码子感知水印让基因组模型蒸馏后的学生模型仍可被检测,三种子实验达 94.5% 检出率

相关研究与后续进展

核心概要

该工作提出 GenoTrace——一种密码子感知的绿名单水印扩展,用密码子位置和物种特异密码子用法两个 token 级因子调制教师模型的生成偏置,使生成的合成序列在蒸馏训练更小学生模型后仍可被审计;在 GenomeOcean-500M 到 100M 的三种子实验中,联合配置取得平均审计分 17.88、固定阈值下 94.5% 检出率,在密钥感知 token 替换后保留 49.0% 检出(单种子普通水印对照为 0%),在机制靶向核苷酸编辑组合后保留 47.0%。

Source-provided article image: GenoTrace: Inheritable Watermarks for Genome Foundation Model Distillation
Figure 1 ·

Figure 1: GenoTrace framework. A teacher generates watermarked DNA, a smaller student learns from these sequences, and the auditor scores student outputs without an inference-time watermark processor. The surrounding panels identify output-editing tests and computational quality assays. The schematic’s preservation and constraint labels indicate design objectives; measured outcomes are reported in Section 5 .

arXiv

深度剖析

提出 GenoTrace,将绿名单水印扩展到密码子层面,用密码子位置与物种特异密码子用法两个 token 级因子调制教师模型的生成偏置,从而在合成序列中嵌入可继承的信号。 相对于普通绿名单水印,该构造把基因组序列的密码子结构纳入水印生成过程,使水印与基因组特有的 token 组织方式对齐。 摘要给出方法层面的构造描述,并在三种子 GenomeOcean-500M 到 100M 蒸馏实验中报告联合配置的平均审计分 17.88 与固定阈值下 94.5% 检出率。

水印信号可经蒸馏传递到更小的学生模型,且学生输出可在没有主动水印处理器的情况下被审计。 此前水印研究多关注生成端检测,这里把可检测性延伸到蒸馏后的下游模型输出审计。 三种子蒸馏实验报告 94.5% 检出率;另有实验在五个物种条件数据集以及最高 40 倍的师生规模比上建立继承信号。

水印对密钥感知 token 替换与机制靶向核苷酸编辑具有一定鲁棒性。 在可获得的单种子普通水印对照为 0% 检出的条件下,GenoTrace 在密钥感知 token 替换后保留 49.0% 检出,在组合机制靶向核苷酸编辑后保留 47.0%。 摘要给出上述对照数值,并说明对照为可获得的单种子普通水印比较对象。

组件消融与计算序列质量测定揭示了检测强度与编码覆盖之间的不同工作点。 该工作把检测强度与编码覆盖作为可分别调节的操作点来刻画,而非单一指标。 摘要报告组件消融与计算序列质量测定结果,并指出校准与生物学效用被作为独立的评估要求处理。

启示与展望

该工作面向共享分词器的蒸馏场景,以及所测试的编辑流程;在此设定下,GenoTrace 使教师生成的合成序列在训练更小学生模型后仍可被审计,并在密钥感知 token 替换与机制靶向核苷酸编辑下保留部分检出信号。它适用于需要追踪合成基因组序列在蒸馏链条中流向的研究与工程场景,并已在五个物种条件数据集与最高 40 倍师生规模比上建立继承信号。校准与生物学效用被作者列为独立的评估要求,因此该构造的适用性以这些单独评估为前提。

摘要未给出审计分的分布、阈值选择依据与统计不确定性,也未说明密钥感知 token 替换与机制靶向核苷酸编辑的具体操作细节;组件消融与序列质量测定的具体指标未在摘要中展开。校准与生物学效用被列为独立评估要求,其结论有待相应评估补充。上述为可继续观察的方向,而非对工作的否定。

来源