跳到主要内容
返回时间线
arXiv来源发表:

冻结的Sapiens姿态基础模型无需攀岩训练即可检测攀岩支点使用,事件F1达90.2%

核心概要

该工作提出一种无需攀岩专项训练的方法,直接使用冻结的Sapiens姿态基础模型的指尖与脚趾关键点,结合逐帧与标注支点的邻近判定、逐肢互斥和短时持续性规则来检测攀岩者使用了哪些支点及何时使用;在The Way Up数据集(22段视频、10名运动员、两条路线)上,留出划分的事件F1为90.2%,留一参与者交叉验证为89.8%,全部22段视频在任意时间重叠下为79.9%,脚点表现最佳(整体F1 89.8%,留出96.6%),并在相同协议下于每个时间阈值上超过对YOLOv8-pose与ViTPose流程的复现,且严格计时下优势扩大;消融显示稠密基础特征变化门控与身体部位分割均带来负面影响,而由自动预测计算的

Source-provided article image: Training-Free Hold-Usage Detection in Sport Climbing with Foundation Pose Models
Fig. 1 ·

Fig. 1: Training-free hold-usage pipeline. Snowflakes ( ) mark the frozen, off-the-shelf foundation models, which receive no climbing-specific training. A promptable segmenter [ 6 ] returns the climber box, Sapiens [ 5 ] estimates top-down pose with 308 whole-body keypoints of which we keep the fingertips and toes, and the proximity of each tip to the given hold box ( eq. 1 ), after per-limb mutual exclusion and a short temporal pass, yields the usage events.

arXiv

深度剖析

使用冻结的Sapiens姿态基础模型的指尖与脚趾关键点,配合逐帧邻近判定、逐肢互斥与短时持续性规则,即可在无任何攀岩专项训练的情况下检测支点使用事件。 既有方法要么训练任务专用模型,要么复用2D姿态估计器,而后者手部关键点位于手腕、脚部关键点位于脚踝,偏离真正接触支点的指尖与脚趾,且手部在约一半帧中被遮挡;该工作改用基础模型的指尖与脚趾关键点并保持模型冻结。 在The Way Up数据集(22段视频、10名运动员、两条路线)上评估,留出划分事件F1为90.2%,留一参与者交叉验证为89.8%,全部22段视频在任意时间重叠下为79.9%。

在相同协议下,该方法在每个时间阈值上都超过对YOLOv8-pose与ViTPose流程的复现,且严格计时下优势扩大。 提供了与既有姿态估计流程在统一协议下的直接比较,而非仅报告自身绝对指标。 比较基于作者对YOLOv8-pose与ViTPose流程的复现,并在每个时间阈值上报告结果。

消融实验显示,稠密基础特征变化门控与身体部位分割这两个直觉上有帮助的附加组件都会降低性能,支持极简的仅关键点设计。 与常见做法(叠加更多特征或分割信息)相反,该结果指出在该任务上更简单的设计更合适。 通过消融实验比较加入这两个组件前后的表现。

由自动预测计算的标准教练统计与真值高度吻合,使普通单摄像头视频无需仪器即可产生可靠的性能指标。 将检测结果延伸到实际可用的教练指标,而不仅是事件检测本身。 攀爬时间的Pearson r=1.00,节奏为0.94。

启示与展望

该结果面向使用单摄像头视频与已标注支点的攀岩场景,适用于自动评分、动作分析与辅助系统的支点使用检测;方法在The Way Up数据集的两条路线与10名运动员上验证,并以留出划分与留一参与者交叉验证报告泛化表现。对希望避免攀岩专项训练、直接复用现成姿态基础模型的读者,该工作给出了可操作的极简设计路径,并说明自动预测足以支撑攀爬时间与节奏等常规教练统计。

该工作验证于The Way Up数据集的两条路线与10名运动员,向更多路线、攀岩场馆与拍摄条件的推广仍是开放问题;手部在约一半帧中被遮挡,遮挡对检测的影响以及时间持续性规则在不同遮挡模式下的表现值得进一步观察;消融中稠密基础特征变化门控与身体部位分割为何带来负面影响,其机制在文中未展开;此外,支点使用检测依赖已标注支点,支点标注的获取方式与成本对实际部署的影响仍是待解问题。

来源