用二维图像提取心围与体长并结合年龄性别,XGBoost 在未见过的 Surti 山羊上实现 R²=0.7955 的体重预测
核心概要
该研究用 Mask R-CNN 从二维图像中分割山羊并提取心围与体长,再与年龄、性别元数据组合,训练 XGBoost、Random Forest 与 CatBoost 并以 0.5/0.3/0.2 权重集成,在按 Animal ID 分组划分的验证集(37 只)上 XGBoost 取得 R²=0.8514(RMSE=4.26 kg、MAE=3.47 kg、MAPE=16.27%),在完全未见的测试集(37 只)上 XGBoost 表现最佳,R²=0.7955(MSE=29.15 kg²、RMSE=5.40 kg、MAE=4.01 kg、MAPE=16.38%),加权集成则为 R²=0.7713(MSE=32.60 kg²、RMSE=5.71 kg、
深度剖析
研究提出并验证了一条非接触式体重估计流程:先用 Mask R-CNN 把每只山羊从图像背景中分离出来,再从二维图像中提取心围和体长这两项形态测量,并与年龄、性别元数据合并成特征集。 相对依赖称重设备与动物保定的人工称重方式,该工作把体重估计建立在图像可提取的形态信息加基础元数据之上,回应了摘要所述“常规称重需要合适设备并常涉及保定,使农场条件下重复监测困难”的问题。 证据来自摘要中描述的完整流程:Mask R-CNN 分割、图像衍生形态测量、年龄与性别元数据组合,以及三种梯度提升/集成模型在该特征集上的训练。
在按 Animal ID 分组划分的数据集上,XGBoost 在验证集与完全未见的测试集上都取得最高预测性能,测试集 R²=0.7955、RMSE=5.40 kg、MAE=4.01 kg、MAPE=16.38%。 摘要明确说明数据划分“严格在 Animal ID 层面进行(group-wise split)以防止数据泄漏并评估对未见动物的真实泛化”,因此该测试集结果反映的是对未见过个体的预测,而非对同一批动物的拟合。 验证集 37 只、测试集 37 只,均给出 R²、MSE、RMSE、MAE、MAPE 等指标;XGBoost 在两个集合上均优于加权集成。
以 0.5、0.3、0.2 权重分别赋予 XGBoost、CatBoost、Random Forest 的加权集成,在未见测试集上 R²=0.7713、RMSE=5.71 kg、MAE=4.13 kg、MAPE=16.60%,低于单独使用的 XGBoost。 该结果给出了一个具体对照:在此特征集与分组评估设定下,集成并未超过表现最好的单一模型,为后续选择建模策略提供了可比较的基线。 集成与单模型使用同一特征集与同一测试集(37 只),指标可直接对比。
研究结论认为,在严格分组评估下结合视觉与形态测量信息,可为未见过的牲畜提供可靠的非接触式体重估计。 这一结论把方法价值定位在“非接触”与“对未见动物泛化”两点上,指向农场条件下重复监测的可行路径。 结论基于摘要报告的验证集与测试集指标,测试集为完全未见的 37 只山羊。
启示与展望
该结果面向需要在农场条件下对山羊进行重复体重监测的场景,适用于能够获取二维图像并记录年龄、性别信息的个体;摘要显示其评估对象为 Surti 山羊,验证集与测试集各 37 只,且测试集为完全未见的动物,因此其直接适用范围是这一品种与这一数据采集方式下的非接触式估计。
摘要未说明图像采集的设备、距离、角度与光照条件,也未报告 Mask R-CNN 的分割精度,因此心围与体长提取误差对最终体重预测的影响仍是开放问题;此外,摘要未给出数据集总量、年龄与性别分布以及与其他体重估计方法的对比,这些信息会影响对该流程在不同群体中表现的判断。
