TRACE 用 517 段视频、1240 条记录审计流式视频理解:准确率几乎相同的模型在完成率、无效输出与响应时机上差异巨大
核心概要
TRACE 提出一个条件感知的流式视频理解基准与评测框架,把时间有效性、执行条件与运行结果显式化,在来自 517 段视频的 1240 条记录上以八种配置评测八个公开模型或系统,发现几乎相同的问答准确率可能掩盖完成率、答案有效性与生成工作量的巨大差异,而主动响应表现会分离为响应质量、响应延迟、误报与漏报四个维度。
深度剖析
TRACE 把流式视频评测重新表述为系统级测量问题:任务分数必须在显式执行条件下解读,框架记录视觉状态维护方式、响应发起方式与评测边界,而不是把这些选择当作模型的隐含属性。 此前的流式与在线视频基准(如 StreamingBench、OVO-Bench、OVBench、RIVER)主要确立因果可见性,即未来信息必须被隐藏;TRACE 在此之上进一步要求声明证据何时变得有效、历史如何维护、响应由谁触发。 论文以统一的 Core–Adapter 协议实现:Core 以 1 FPS 按实时节奏投递带时间戳的 RGB 帧并控制问题或指令到达,Adapter 记录实际图像提交、历史重放、丢帧、状态维护、输出与失败;每个配置的状态组织、主动触发方式与部署/评测边界在表 3 中逐项列出。
时间审计不是数据清洗步骤,而是决定评测边界的核心环节:在发布集中有 328 条记录被编辑、52 条被排除,其中 325 条编辑涉及时间或触发字段。 以往基准通常把时间戳当作固定元数据,TRACE 把时间有效性变成显式且经过复核的评测协议组成部分。 在可直接比较的数值时间戳字段上,问答的中位绝对修订为 3.0 秒(127 处字段变更,90 分位 58.2 秒),主动响应为 2.24 秒(150 处字段变更,90 分位 20.76 秒);103 条被编辑的问答记录中有 100 条含时间修订,225 条被编辑的主动响应记录全部修订或新增了触发标注。
相似的任务分数会掩盖不同的系统行为,因此 TRACE 把质量、时机、响应选择、工作量、完成度与可靠性分开报告,而不是压缩成单一总分。 论文用成对案例说明这种分离:LiveCC 与 MOSS-Preview 的问答准确率几乎相同(65.19% 与 65.07%),但完成率(93.88% 与 100.00%)、记录输出 token(146,064 与 42,206)与无效输出率(6.12% 与 1.92%)差异明显;MOSS-VL 与 AURA 的窗口内准确率几乎相同(8.05% 与 7.92%),但误报率(41.1% 与 59.1%)与中位响应延迟(0.33 秒与 1.15 秒)差异明显。 结果来自八个公开模型或系统在八种配置下的标准集评测,失败运行保留在分母中;LiveCC 在共享视频人群上比 AURA 高 4.92 个百分点(95% 置信区间 2.28 至 7.97),同时只漏掉 0.31% 的目标窗口,却有 65.0% 的响应片段属于误报。
执行条件决定一个分数究竟测量了什么:历史组织方式与系统边界不同,同一数值指标并不代表相同的组件、工作量或失败来源。 论文指出 AURA 在问答时于查询时刻重建合法视觉前缀、在主动响应时维护持久增量状态,因此其问答延迟与提交图像数描述的是不同的历史处理路径;JoyAI 的 17.08% 窗口内准确率是在包含记忆与调度组件的完整系统边界上测得。 MiniCPM-O 原生双工配置提供了接口层面的诊断:其口语风格问答输出有 93.52% 无法被唯一解析为选项,问答准确率为 2.40%,主动响应窗口内准确率为 0.51%、漏报率 65.43%,论文将其报告为对所测接口的测量而非接口无关的能力估计。
启示与展望
该工作面向研究流式视频理解评测的研究者与系统开发者,适用于纯视觉、单指令、1 FPS 因果访问的设定:问答任务在指定视频时间引入问题,主动响应任务在目标事件或状态前给出监控指令,标准比较中的主动配置在收到一条监控指令后自行发起响应。它使分数可以连同时间有效性、执行条件与运行结果一起被解读,并提供了可复现的评测人群与修订来源;论文也指出自然扩展方向包括无触发与负事件覆盖、更高视觉采样率、音频与多轮交互以及持续运行测试。
读者仍需留意若干开放问题:当前结论限于所测模型或系统在纯视觉、单指令、1 FPS 任务上的表现;主动任务侧重正触发,因此误报率衡量的是当前无有效响应窗口且后续仍有机会时发出的响应,而非无触发视频上的一般假阳性率;中位响应延迟只在有观测起点的已答窗口上计算,各配置的观测覆盖率从 6.8% 到 70.5% 不等,低覆盖率会限制该中位数对全部已答窗口的代表性;语义判官校准基于 36 条响应、31 个语义项的分层样本,人机二值一致率为 83.3%(Cohen's kappa 0.675),论文说明这属于初步人类比较而非完整真值,且判官不看视频帧,无法发现文本正确但视觉上被否证的答案。
