arXiv 2026年10月5日作者提出 DuplexJev:把 ASR 编码器隐状态经小型连接器送入冻结 LLM,将每个封闭式问题读作选项上的单 token 分布而不做任何解码,8 卡节点约 0.1 秒回答 8 段语音的 80 项决策;用末层连接器时口语问答接近读转录(90% 对 91%),用交叉注意力连接器时性别与情绪准确率均达 90%(分别从 55% 和 28% 提升),口语问答仅降 1 点(83% 到 82%),并以读出答案 token 的交叉熵训练决策、把蒸馏留给内容。作者提出 DuplexJev:把 ASR 编码器隐状态经小型连接器送入冻结 LLM,将每个封闭式问题读作选项上的单 token 分布而不做任何解码,8 卡节点约 0.1 秒回答 8 段语音的 80 项决策;用末层连接器时口语问答接近读转录(90% 对 91%),用交叉注意力连接器时性别与情绪准确率均达 90%(分别从 55% 和 28% 提升),口语问答仅降 1 点(83% 到 82%),并以读出答案 token 的交叉熵训练决策、把蒸馏留给内容。DuplexJev 用单 token 读出替代自回归解码,8 卡节点约 0.1 秒完成 8 段语音的 80 项决策,并让冻结 LLM 同时听出性别与情绪作者提出 DuplexJev:把 ASR 编码器隐状态经小型连接器送入冻结 LLM,将每个封闭式问题读作选项上的单 token 分布而不做任何解码,8 卡节点约 0.1 秒回答 8 段语音的 80 项决策;用末层连接器时口语问答接近读转录(90% 对 91%),用交叉注意力连接器时性别与情绪准确率均达 90%(分别从 55% 和 28% 提升),口语问答仅降 1 点(83% 到 82%),并以读出答案 token 的交叉熵训练决策、把蒸馏留给内容。作者提出 DuplexJev:把 ASR 编码器隐状态经小型连接器送入冻结 LLM,将每个封闭式问题读作选项上的单 token 分布而不做任何解码,8 卡节点约 0.1 秒回答 8 段语音的 80 项决策;用末层连接器时口语问答接近读转录(90% 对 91%),用交叉注意力连接器时性别与情绪准确率均达 90%(分别从 55% 和 28% 提升),口语问答仅降 1 点(83% 到 82%),并以读出答案 token 的交叉熵训练决策、把蒸馏留给内容。