跳到主要内容
返回时间线
arXiv来源发表:

Realtime-Venus 用两个 9B 前端把实时对话与后台任务拆成双循环,在八项视频基准中的六项领先在线模型

核心概要

该工作提出 Realtime-Venus 主动式全双工交互系统,包含分别训练的 9B 模型 Realtime-Venus-Omni(音视频交互)与 Realtime-Venus-Audio(语音交互),二者以共享因果时间线统一连续感知、对话控制、原生语音生成与私有委派请求,并由 Realtime-Venus-Harness 在双循环运行时中异步执行后台能力,在八项视频基准中的六项取得所比较在线模型的最高分,并在多项音频理解、口语问答与全双工重叠语音指标上领先或持平。

AI-generated editorial illustration: Realtime-Venus: A full-duplex interaction system with asynchronous delegation

深度剖析

提出两个分别训练的 9B 全双工前端:Realtime-Venus-Omni 处理音视频交互,Realtime-Venus-Audio 处理纯语音交互,二者都作为完整对话前端,把连续感知、对话控制与原生语音生成整合在同一个自回归交互循环中。 相对 Moshi、Qwen2.5-Omni/Qwen3-Omni、MiniCPM-o 4.5 等已有工作,作者把对话控制、回复生成与私有委派放进共享策略与共享时间线,并称 Realtime-Venus-Omni 是首个在保持视频交互的同时支持异步后端推理与工具调用的全双工全模态模型。 论文给出模型架构(SigLIP2、Whisper-Medium、Qwen3-8B 主干、S3 语音 token 与流式流匹配解码器)、一秒分块调度与 <|listen|>/<|speak|>/<|turn_eos|> 控制 token 的设计说明,并报告在八项视频基准中的六项取得所比较在线模型最高分。

设计 Realtime-Venus-Harness 作为异步能力执行与结果回传框架,把委派请求绑定到发起会话,并在请求开始时固定证据快照,随后路由到注册能力异步执行,再以私有背景通道把结果送回原会话。 相对 ReAct 式交替推理与动作、以及 DuplexSLA、MoshiRAG、DuplexOmni、JoyAI-VL-Interaction 等把工具或检索接入对话的路线,该框架明确区分“执行边界”与“回传时机”:后台用请求边界固定的证据执行,前端用回传时的对话状态解释结果,并由前端决定何时说出已备好的回复。 论文给出 capture、dispatch、return 三阶段流程、工作项生命周期(Queued、Running、Completed、Failed、Delivering、Delivered)、新鲜度检查与播放确认机制,以及注册能力契约与结果归一化格式。

构建耦合全双工与委派行为的数据管线,把场景规划、副语言与声学实现、时间对齐串成统一轨迹,使回授、他人指向语音、背景语音与打断在同一时间线上被区分监督。 相对把重叠语音当作统一停止信号或依赖 VAD 的二值反应,该管线按会话功能标注事件,把“继续说话、等待输入、让出话轮、停止排队输出、修订回复”与委派决策(保留、取消、修订、重试、替换)关联到同一用户意图变化上。 论文报告后训练语料超过 280 万条样本、覆盖九类数据,其中视频组约占 70%、音频组约占 30%,离线理解约占 56%、主动双工约占 37%、委派约占 6%,并说明监督只覆盖回复片段、仅更新 Thinker。

在评测中,Realtime-Venus-Omni 在 StreamingBench 得 70.2%、OVO-Bench 得 64.7%、Daily-Omni 得 81.3%,在八项视频基准中的六项为所比较在线模型最高;Realtime-Venus-Audio 在 MMAU 得 78.0%、MMAU-Pro 得 63.2%、Llama Questions 得 83.8%、Speech CMMLU 得 67.8%,并在 Full-Duplex-Bench v1.5 上对用户打断的响应率为 75%,在回授、他人指向语音与背景语音下的延续率分别为 97%、88%、86%。 相对 MiniCPM-o 4.5,Realtime-Venus-Omni 在 StreamingBench 与 OVO-Bench 上分别提升 2.3 与 4.0 个百分点,OmniPro 探针模式提升 3.4 个百分点;在 Full-Duplex-Bench v1.5 的三项延续指标上超过 Gemini 3.1 Live 与 GPT-4o。 结果以表格形式给出,并区分在线与离线基线、分别报告四类重叠场景;论文同时说明 ProactiveVideoQA 与 WorldSense 上低于 MiniCPM-o 4.5,且未做组件消融。

启示与展望

该结果面向需要连续感知与及时响应的数字与物理环境交互场景,适用于以一秒分块为单位的流式音视频输入,以及需要外部推理或工具执行的会话任务;双循环运行时与注册能力契约的设计使同一委派接口可服务音频与全模态两种前端,训练无关的长视频记忆模块面向小时级会话。对使用者而言,这意味着可以在保持前台对话不中断的前提下把复杂请求交给后台执行,并按会话状态选择何时说出已备好的回复。

论文指出若干仍需观察之处:ProactiveVideoQA 与 WorldSense 上低于 MiniCPM-o 4.5,说明流式理解、主动响应质量与离线视频理解需要分开评估;MMAR 与 MMSU 上并非最高,提示上下文声学推理与细粒度口语理解仍有空间;打断响应率低于 Joy-Duplex、GPT-4o 与 Gemini 3.1 Live,说明强延续不等于强打断处理;工具使用上参数准确率与 Pass@1 低于 GPT-Realtime,且不同指标成功标准不同,不能解读为中间阶段失败率;委派基准为内部构建,两个前端分别表现为漏委派与过度委派两种不同模式;记忆增强的收益依赖主干与评测设置;论文亦说明结果未隔离各训练组件的贡献,需要受控消融,未来工作将探索更细粒度分块、更长上下文与多步并发工具执行。

来源