SnapLog 用 ViT 帧嵌入加 K-Means 分割、R(2+1)D 少样本分类,把厨房视频转成事件日志,Top-3 达 90% 与 85%
核心概要
该工作提出 SnapLog 流水线,先用预训练 ViT 逐帧编码并基于帧间相似度矩阵做 K-Means 时序分割与贪心合并,再用预训练于 Sports-1M 的 34 层 R(2+1)D 编码器加线性分类头做广义少样本事件分类,从而把原始视频转成带时间戳的事件日志(可输出确定性日志或保留标签概率分布的含不确定性日志);在 TUM Kitchen 的 16 段布朗尼烘焙视频与 Epic Kitchens-100 的 24 段厨房清洁视频上,分割帧级准确率为 74.3% 与 67.7%,分类在增强加 100 个重叠片段设置下 Top-3 达 90.1% 与 85.4%,并可从 TUM 日志中发现基本合理的布朗尼烘焙流程模型。
Fig. 1. SnapLog extracts logs from video data. Our method, SnapLog, constructs an event log from video data which can then be used downstream by standard process mining algorithms.
· 第 2 页深度剖析
提出把视频转成过程挖掘可用事件日志的两阶段流水线:ViT 逐帧嵌入加相似度矩阵 K-Means 聚类得到原子事件,再用贪心合并算法把过短事件并入相邻事件形成复合事件。 相较依赖完整活动标签字典、侧重目标跟踪的既有视频流程挖掘工作,以及依赖 VLM/LLM 级联、需要云端算力的方案,SnapLog 面向部分已知标签字典与资源受限的本地部署,并给出逐帧可解释的分割。 在 TUM Kitchen 与 Epic Kitchens-100 上以 k∈{3,5,7} 的轮廓系数比较,k=7 时轮廓系数为 0.498 与 0.487,帧级分割准确率为 74.3% 与 67.7%。
用广义少样本分类为分割片段赋活动标签,仅需少量标注样本即可适配新环境。 把少样本视频分类引入视频到日志的抽取,使新活动类别的加入只需训练一个小线性分类头,而无需大规模标注数据或重训骨干网络。 TUM 与 Epic Kitchens 平均每类仅 11 与 7 个片段;四个随机种子下标准差仅 2%–3%;从 10 个非重叠片段改为 100 个重叠片段使 Epic Kitchens 的 Top-3 提升最多 23%。
流水线可输出保留标签概率分布的含不确定性事件日志,而不仅是取最大似然的确定性日志。 把视频抽取固有的标签歧义显式保留下来并传递给下游过程挖掘,与近期关于不确定与概率事件数据的研究相衔接,而非强行做硬判定。 增强加 100 重叠片段设置下 Top-3 准确率为 TUM 90.1%、Epic Kitchens 85.4%,说明真实活动落在少数候选标签内;不确定日志可保留前三个最可能标签并归一化为离散概率分布。
从抽取日志中可发现基本合理的流程模型,验证端到端可行性。 以 Process Explorer 从 TUM 日志得到的直接跟随图为例,展示视频来源日志可用于常规过程发现,而完整的过程发现定量评估被作者列为超出本文范围。 作者报告模型总体呈现正确的布朗尼烘焙步骤与合理连接,同时存在如 Add Water 后接 Get Water、Read Brownie Box 出现在接近末尾等顺序不一致。
启示与展望
该工作面向希望把视频记录纳入过程挖掘的组织,适用于活动在时间上依次发生、每个片段只含一个活动的场景,如制造流水线、厨房操作等;方法设计为在标准非 HPC 硬件上本地部署,适配新环境约需 15–20 段视频的标注量,并同时提供确定性日志与保留标签概率的含不确定性日志,供后续不确定感知的过程分析使用。
分割与分类结果来自两个厨房场景数据集,其他领域与更复杂场景的表现仍需检验;作者指出当前假设每个片段只出现一个活动,且只抽取活动标签与时间信息而丢失空间信息,模块化设计尚未端到端可微;过程发现的定量评估被列为超出本文范围,因此从日志到流程模型的保真度仍属开放问题;此外初始标注仍需人工完成,未来可能引入 VLM 在环以进一步自动化。
