跳到主要内容
返回时间线
arXiv来源发表:

BAC 用身份绑定框加 LoRA 微调,让 8B 视频模型在人物问答上达到 93.20%

核心概要

该工作基于 LSMDC v2 电影片段构建了自动角色识别与身份绑定空间标注流程,人工校验出 750 个片段、3000 道人物中心问题的基准,并比较五种身份接地表示;结果显示视觉人脸框加文本坐标在各规模上最稳定,据此用 LoRA 微调 Qwen 得到 BAC,其中 BAC-8B 在人物问答上达到 93.20% 总体准确率。

Source-provided article image: Beyond Anonymous Captions: Grounding Character Identity in Video Captioning and Question Answering
Figure 1 ·

Figure 1: Example of identity-aware captioning and person-centric QA using character identities grounded across sampled video frames.

arXiv

深度剖析

论文提出并系统比较了五种把已知角色身份表示给通用 Video-MLLM 的接地策略:纯文本人脸坐标(FTC)、人脸视觉框(FVB)、估计人体视觉框(PVB),以及人脸框加人脸坐标(FVB+FTC)、人体框加人体坐标(PVB+PTC)。 以往的身份感知描述工作要么在生成后替换 SOMEONE 标签,要么要求模型自己从参考图推断身份对应关系;这里改为在可靠检测与跟踪可用时直接提供身份绑定的空间线索,并让模型在部分帧缺失线索时跨时间传播身份信息。 在 750 个片段、3000 道题的人工校验基准上,用 Qwen3 约 2B、4B、8B 三个规模做同族对照,配对 McNemar 检验显示 FTC 在所有规模上显著差于每一种视觉接地变体。

显式视觉接地大幅提升人物中心问答:QA 总体准确率从 FTC 的 53.87% 升到 68.90%(2B)、62.57% 升到 79.73%(4B)、59.77% 升到 88.53%(8B)。 该结果把“谁在哪里”的显式空间信息与“谁在做什么”的语义理解分开考察,说明身份关联的瓶颈可以部分由输入表示而非架构改动来解决。 同一批片段、问题、提示与身份标注在各模型间保持一致,生成配置固定;FVB+FTC 在跨规模上给出最一致的描述与问答表现,尤其在 2B 规模。

接地效果依赖目标尺寸:2B 规模下小脸(小于某像素面积)时 PVB+PTC 达 91.8% 而 FVB+FTC 为 80.0%,中等和大人脸时 FVB+FTC 分别达 92.8% 和 96.8%,优于 PVB+PTC 的 91.3% 和 91.1%。 这给出了一个可操作的表示选择规则:人脸过小时用估计人体框补偿,人脸足够可见时人脸框更精确,扩展到全身反而引入不够精确的空间信息。 按人脸面积分箱统计,小脸 85 题、中等 1865 题、大人脸 124 题,并附有定性示例:2222 像素平方、高 52 像素的小脸案例与 391897 像素平方、高 760.5 像素的大脸案例。

用约 32K 身份感知描述片段对 Qwen 做 LoRA 微调得到 BAC,仅用描述任务监督却在人物问答上泛化:2B 从 68.90% 升到 80.33%,4B 从 79.73% 升到 90.13%,8B 从 87.70% 升到 93.20%,均统计显著。 BAC-8B 的 93.20% 在本文评估的前沿模型中仅次于 GPT-5.6 Sol(97.07% 带思考、96.30% 不带思考),并显著高于 Qwen3-VL-235B-A22B 的 86.10%、Gemini 2.5 Flash 的 82.63% 和 Claude Sonnet 4.6 的 76.10%;BAC-4B 的 90.13% 也超过所有被评估的 8–9B 基座模型。 LoRA 只作用于语言模型投影层,视觉编码器与多模态投影器冻结;超参扫描后取最低验证损失的检查点,三个规模训练与验证损失均稳定收敛。

启示与展望

该结果面向电影叙事视频这一受控设定:身份来自预定义演员表与电影片段,基准为 750 个片段、3000 道人物中心问题,训练监督为约 32K 身份感知描述片段。适用对象是需要把角色身份与外观、动作、位置、交互关联起来的视频理解研究者与工程团队,尤其是希望在 2B 至 8B 规模上以输入表示加轻量适配替代架构改动的场景。作者在伦理讨论中说明,工作意在推进角色中心视频理解,而非无约束真实环境中的个人识别,并建议后续应用考虑同意、隐私保护与生物身份信息使用限制。

正文中若干数值以占位形式出现,例如显著性检验的 p 值、人脸面积分箱的像素阈值、LoRA 的学习率、秩、缩放因子与 dropout 取值、以及各规模可训练参数量,这些细节在本次读取的文本中未给出具体数字,需要查阅附录与表格原文确认。人脸面积与正确率的相关性系数同样以区间形式呈现。此外,BAC 仅在描述任务上微调,其在问答上的增益来自何种表征变化,文本未作机制层面的分析;位置类问题(BAC-8B 为 87.54%)与交互类问题(91.28%)低于外观与物体类,空间与关系推理仍是相对困难的方向。

来源