跳到主要内容
返回时间线
arXiv来源发表:

SnapLog 用 ViT 帧嵌入加 K-Means 分割、R(2+1)D 少样本分类,把厨房视频转成事件日志,Top-3 达 90% 与 85%

核心概要

该工作提出 SnapLog 流水线,先用预训练 ViT 逐帧编码并基于帧间相似度矩阵做 K-Means 时序分割与贪心合并,再用预训练于 Sports-1M 的 34 层 R(2+1)D 编码器加线性分类头做广义少样本事件分类,从而把原始视频转成带时间戳的事件日志(可输出确定性日志或保留标签概率分布的含不确定性日志);在 TUM Kitchen 的 16 段布朗尼烘焙视频与 Epic Kitchens-100 的 24 段厨房清洁视频上,分割帧级准确率为 74.3% 与 67.7%,分类在增强加 100 个重叠片段设置下 Top-3 达 90.1% 与 85.4%,并可从 TUM 日志中发现基本合理的布朗尼烘焙流程模型。

Source-provided article image: All Eyes on the Workflow: Automated and Efficient Event Discovery from Video Streams
Fig. 1

Fig. 1. SnapLog extracts logs from video data. Our method, SnapLog, constructs an event log from video data which can then be used downstream by standard process mining algorithms.

· 第 2 页

深度剖析

提出把视频转成过程挖掘可用事件日志的两阶段流水线:ViT 逐帧嵌入加相似度矩阵 K-Means 聚类得到原子事件,再用贪心合并算法把过短事件并入相邻事件形成复合事件。 相较依赖完整活动标签字典、侧重目标跟踪的既有视频流程挖掘工作,以及依赖 VLM/LLM 级联、需要云端算力的方案,SnapLog 面向部分已知标签字典与资源受限的本地部署,并给出逐帧可解释的分割。 在 TUM Kitchen 与 Epic Kitchens-100 上以 k∈{3,5,7} 的轮廓系数比较,k=7 时轮廓系数为 0.498 与 0.487,帧级分割准确率为 74.3% 与 67.7%。

用广义少样本分类为分割片段赋活动标签,仅需少量标注样本即可适配新环境。 把少样本视频分类引入视频到日志的抽取,使新活动类别的加入只需训练一个小线性分类头,而无需大规模标注数据或重训骨干网络。 TUM 与 Epic Kitchens 平均每类仅 11 与 7 个片段;四个随机种子下标准差仅 2%–3%;从 10 个非重叠片段改为 100 个重叠片段使 Epic Kitchens 的 Top-3 提升最多 23%。

流水线可输出保留标签概率分布的含不确定性事件日志,而不仅是取最大似然的确定性日志。 把视频抽取固有的标签歧义显式保留下来并传递给下游过程挖掘,与近期关于不确定与概率事件数据的研究相衔接,而非强行做硬判定。 增强加 100 重叠片段设置下 Top-3 准确率为 TUM 90.1%、Epic Kitchens 85.4%,说明真实活动落在少数候选标签内;不确定日志可保留前三个最可能标签并归一化为离散概率分布。

从抽取日志中可发现基本合理的流程模型,验证端到端可行性。 以 Process Explorer 从 TUM 日志得到的直接跟随图为例,展示视频来源日志可用于常规过程发现,而完整的过程发现定量评估被作者列为超出本文范围。 作者报告模型总体呈现正确的布朗尼烘焙步骤与合理连接,同时存在如 Add Water 后接 Get Water、Read Brownie Box 出现在接近末尾等顺序不一致。

启示与展望

该工作面向希望把视频记录纳入过程挖掘的组织,适用于活动在时间上依次发生、每个片段只含一个活动的场景,如制造流水线、厨房操作等;方法设计为在标准非 HPC 硬件上本地部署,适配新环境约需 15–20 段视频的标注量,并同时提供确定性日志与保留标签概率的含不确定性日志,供后续不确定感知的过程分析使用。

分割与分类结果来自两个厨房场景数据集,其他领域与更复杂场景的表现仍需检验;作者指出当前假设每个片段只出现一个活动,且只抽取活动标签与时间信息而丢失空间信息,模块化设计尚未端到端可微;过程发现的定量评估被列为超出本文范围,因此从日志到流程模型的保真度仍属开放问题;此外初始标注仍需人工完成,未来可能引入 VLM 在环以进一步自动化。

来源