跳到主要内容
返回时间线
arXiv来源发表:

DuplexAgent用六个可编辑模块协调全双工语音与委派智能体,并以递归改进循环把固定核心协作分从54.6提升到85.3

核心概要

该工作提出DuplexAgent,把全双工语音交互模型与推理LLM、编码智能体之间的协作写成Policy、Intake、Hold、Worker、Deliver、Memory六个可编辑模块,并给出Duplex-Harness-RSI闭环:模拟器生成定时对话并归因失败,委派池中的推理LLM充当Exam Planner选择下一轮测试,编码智能体充当Harness Editor修改被诊断指名的模块,经开发门与保护门配对比较后保留;在VoiceChat与Qwen-Realtime上,保留后的harness提升了口语知识、可执行工具调用与固定核心协作分。

Source-provided article image: DuplexAgent-RSI: Recursive Harness Improvement for Full-Duplex Voice Agent Collaboration
Figure 1 ·

Figure 1: Benchmark results for DuplexAgent (blue), compared with other collaboration systems (gray). Higher is better on every panel. Intelligence reports MMSU accuracy, agentic tool use reports BFCL parallel-multiple and FDB-v3 Pass@1, and duplex reports FDB-v1 interrupt TOR. DuplexAgent is stronger on all three capabilities. All collaboration systems use the same delegation LLM. See Tables 4 and 5 .

arXiv

深度剖析

DuplexAgent把全双工语音协作流程显式拆成六个可编辑模块,每个模块拥有明确的输入、决策与可观察效果,使一次失败可以被归因到有界的一部分harness。 既有系统实现了交接、确认与投递控制的可用实例,但这些决策通常耦合在系统专用启发式里;本文把路由、任务解释、挂起期对话、委派契约、投递时机与共享上下文分别写成Policy、Intake、Hold、Worker、Deliver、Memory,并配以任务账本记录任务身份、版本、状态与投递历史。 方法层面给出模块表与Snake-to-Tetris会话示例,说明迟到的Snake结果会被记录但不能使已过时任务重新成为当前任务;实验层面在两种交互模型上分别开展改进campaign。

Duplex-Harness-RSI复用服务用户的委派池做递归改进:Exam Planner依据归因失败与修复档案调整下一轮考试,Harness Editor在声明的可编辑面上提出可检验假设,开发门与保护门以配对胜负决定是否保留。 与一次性汇总编辑、以及缺少逐轮诊断与修复档案的顺序编辑相比,该闭环把诊断、修复与验证连成一条可核对的链路,并保持模拟器、评分规则与保护集不变。 VoiceChat上初始harness与Qwen-Audio-Agent同为54.6,一次性编辑57.4,顺序编辑61.9,十轮检查点85.3,比初始高30.7个百分点、比顺序编辑高23.4个百分点;Qwen-Realtime上初始47.1,八个保留版本后84.8,提升37.7个百分点。

在外部基准上,DuplexAgent把委派决策与交接内容分开,使口语知识与可执行工具调用同时提升,而不是像描述式交接那样二者此消彼长。 MoshiRAG、Gander、Realtime-Venus-Omni、Qwen-Audio-Agent把任务标题或自然语言复述交给委派方,因而在BFCL/FDB-v3这类要求精确函数名与参数的评分对象上持平或下降;DuplexAgent让Worker接收官方schema与用户轮次携带的参数,Memory保留标题或短复述会丢失的标识与约束,Deliver只在说话窗口返回当前结果。 VoiceChat上BFCL均值由53.5升至75.8,FDB-v3由60.2/26.2/16.0升至97.4/57.0/47.0;Qwen-Realtime上BFCL均值由82.0升至90.8,parallel-multiple由66.0升至78.0,FDB-v3参数准确率由47.8升至55.0、Pass@1由39.0升至49.0;口语知识OBQA由54.2升至80.6、由86.3升至92.1,MMSU由36.1升至80.5、由64.8升至82.7。

保留的修复显示各模块学到了具体规则,且被拒绝的宽泛修复说明门控在限制改动范围。 修复档案同时保存被接受与被拒绝的尝试,使Exam Planner与Harness Editor能避免重复无效改动并沿用已见效的修复。 局部考试记录显示:Policy明确直接回答类别使多余调用减少50%;Intake按实时任务状态解析迟到取消使被忽略取消减少81%,替换失败先降65%再降83.3%;Hold提前报告进度使缺失进度更新减少75%;Worker保留单位与精度使错误答案减少66.7%;Deliver仅在用户静默后说话使重叠与隐藏失败各减少100%;Memory组装完整轮次使缺上下文失败减少60%。

启示与展望

该结果面向把全双工交互模型作为对话入口、把推理与编码工作交给异步委派池的语音智能体部署场景,适用于开源与托管交互模型以及一个或多个委派方。harness通过适配器声明原生函数调用、文本委派标记、上下文注入与中间工具输出处理等能力,据此选择兼容的确认与投递路径。模拟器可生成训练或评测对话供其他交互系统使用,外部基准与模拟器协作分回答不同问题并分开报告。改进循环只改写模块指令与可执行规则,交互模型权重保持不变。

改进的收益止于harness:模块修复可以要求说话前静默、或委派前拿到完整问题,但模型对重叠语音的感知与自身对轮次结束的判断仍留在trace中。门控接受或拒绝候选时,这部分剩余仍被记录,说明哪些失败可由模块编辑吸收、哪些留在交互模型的感知与时机里。Qwen-Realtime上Candor暂停TOR由0.278改善到0.231,但synthetic暂停TOR由0.074变为0.147,说明任务表现提升与某一暂停条件下的结果并不总是一致。VoiceChat上irrelevance由95.0降到90.0,说明找回必需调用也引入了一些不必要的调用;固定核心上多余委派由3.9%升到6.6%,被忽略的控制保持5.3%。各模块的百分比来自测试该修复的局部考试,固定核心分数是门控保留的修复的合并结果。Qwen-Realtime campaign在后期出现一段提案不再通过门控的平台期。若读者关心交互模型自身的感知与时机能否被训练改进,本文把这一部分留作后续智能体强化学习的方向。

来源