arXiv 2026年10月6日作者提出 SWIFT,一个把文本生成与水印构建放在同一 vLLM 后端、同一 LLM、同一 GPU 上异步共服务的框架:它用指令引导的候选生成与实体保护产生上下文感知替换,用基于密钥的 Tournament 选择嵌入水印,并用自适应调度器按队列长度与等待时间压力动态调整水印请求准入;在 C4 文本生成上取得最高效用分 4.87、99.65% 检测准确率与 0.905 秒延迟,在替换攻击下保持 97.7% 检测率,在 GSM8K 与 MedMCQA 上不降低任务准确率,并达到 528.7 tokens/s 吞吐与 96.8% 前缀缓存命中率。作者提出 SWIFT,一个把文本生成与水印构建放在同一 vLLM 后端、同一 LLM、同一 GPU 上异步共服务的框架:它用指令引导的候选生成与实体保护产生上下文感知替换,用基于密钥的 Tournament 选择嵌入水印,并用自适应调度器按队列长度与等待时间压力动态调整水印请求准入;在 C4 文本生成上取得最高效用分 4.87、99.65% 检测准确率与 0.905 秒延迟,在替换攻击下保持 97.7% 检测率,在 GSM8K 与 MedMCQA 上不降低任务准确率,并达到 528.7 tokens/s 吞吐与 96.8% 前缀缓存命中率。SWIFT 将水印构建与 vLLM 推理引擎共服务,在文本生成上取得 4.87 效用分与 99.65% 检测准确率,延迟 0.905 秒作者提出 SWIFT,一个把文本生成与水印构建放在同一 vLLM 后端、同一 LLM、同一 GPU 上异步共服务的框架:它用指令引导的候选生成与实体保护产生上下文感知替换,用基于密钥的 Tournament 选择嵌入水印,并用自适应调度器按队列长度与等待时间压力动态调整水印请求准入;在 C4 文本生成上取得最高效用分 4.87、99.65% 检测准确率与 0.905 秒延迟,在替换攻击下保持 97.7% 检测率,在 GSM8K 与 MedMCQA 上不降低任务准确率,并达到 528.7 tokens/s 吞吐与 96.8% 前缀缓存命中率。作者提出 SWIFT,一个把文本生成与水印构建放在同一 vLLM 后端、同一 LLM、同一 GPU 上异步共服务的框架:它用指令引导的候选生成与实体保护产生上下文感知替换,用基于密钥的 Tournament 选择嵌入水印,并用自适应调度器按队列长度与等待时间压力动态调整水印请求准入;在 C4 文本生成上取得最高效用分 4.87、99.65% 检测准确率与 0.905 秒延迟,在替换攻击下保持 97.7% 检测率,在 GSM8K 与 MedMCQA 上不降低任务准确率,并达到 528.7 tokens/s 吞吐与 96.8% 前缀缓存命中率。