BYOL 特征加 Protege 主动学习在 MGCLS 中筛出前 100 名候选,99 个呈弥漫射电特征、55 个确认为星系团相关辐射
核心概要
该工作把自监督深度学习算法 BYOL 提取的源图像特征输入 Astronomaly: Protege 主动学习框架,在 MeerKAT 星系团遗产巡天(MGCLS)的高分辨率(约 7 角秒)、卷积(15 角秒)以及两者拼接的特征上评估管线,用人工标注目录中的示踪源作为引导与基准;结果显示高分辨率特征在早期识别上优于卷积特征、拼接特征整体最优,按 Protege 排序的前 100 个源中有 99 个呈现某种弥漫射电特征、55 个确认为星系团相关弥漫辐射,且仅用 300 个人工标签即可在 62,587 个源中检出 121 个示踪源中的 55 个。
Figure 2. Comparison of data cuts applied to MGCLS sources. Left: Gaussian component-based cut from Lochner & Rudnick (2024). Right: Beam-size cut proposed here. Plots show the number of sources (solid lines) and tracers (dashed lines) remaining in high-resolution (orange) and convolved (blue) versus cut threshold (Gaussian components or beam-size multiples). The vertical lines mark the selected thresholds. It is evident that the beam-size cut retains more tracers for similar subset sizes.
· 第 4 页深度剖析
提出并验证了一条把 BYOL 自监督特征与 Protege 主动学习结合的定向搜寻管线,用于在 MGCLS 中识别弥漫射电辐射候选体。 此前同类工作或依赖大规模标注数据与合成模拟(如 Tuna、OpenCLIP 类方法),或使用传统异常检测而把有价值的源埋没在复杂特征空间中;该工作改为在单一数据集内迭代学习用户偏好,不需要预先定义目标形态。 在 MGCLS 增强产品上用 PyBDSF 提取 62,587 个高分辨率与 40,879 个卷积 cutout,经束斑尺寸筛选后保留 7,051 个(121 个示踪源)与 4,319 个(119 个示踪源);BYOL 用 EfficientNet-B0 训练 100 个 epoch,训练与验证损失曲线收敛;PCA 保留 95% 方差降至 40 与 37 维。
分辨率对检测效率的影响被量化:高分辨率特征在排序前列恢复示踪源更快,卷积特征在更大范围内恢复更多,拼接两种分辨率特征可同时改善早期检出与整体恢复。 以往 Protege 应用未系统比较同一巡天不同分辨率特征,也未测试特征拼接;该工作给出四种配置的累积召回对比。 前 100 名中高分辨率特征恢复 54/121 个示踪源,高分辨率拼接特征为 55/121;前 500 名中高分辨率单独恢复 67/121,拼接后为 75/121;卷积特征前 100 名恢复 43 个,卷积拼接特征恢复 54 个,前 500 名分别为 74/119 与 75/119。
对前 100 名候选的目视检查显示,算法优先选出的是广义弥漫射电辐射而非仅星系团相关辐射:99 个呈弥漫特征,其中 55 个与已知示踪源吻合,其余 44 个包括带喷流或延展瓣的射电 AGN、弯尾或广角尾形态、正面旋涡星系的恒星形成区以及若干未识别的延展结构。 这揭示了仅凭射电形态无法区分星系团相关弥漫辐射与其他延展结构,需要 X 射线、光谱红移等额外信息;作者把这 44 个源视为值得后续观测的候选而非失败。 基于对拼接高分辨率坐标子集前 100 名的目视检查,并与 Kolokythas et al. (2025) 的人工标注目录比对;累积召回曲线仅以示踪源计算,因此可能低估算法在突出弥漫候选体方面的效果。
管线在人工标注成本上给出可操作的量化:标注 300 个源(20 轮、每轮 15 个)后,查看 100 个源即可检出 121 个示踪源中的 55 个,查看 250 个源可检出 61 个,相对于原始 62,587 个源大幅压缩了人工检查量。 该工作把 Protege 的每轮标注批量从 10 提高到 15,并采用二值标注(示踪源记 5、其余记 0),以一致性换取灵活性,为 SKA 规模数据下的探索式搜寻提供参考。 结果来自高分辨率与卷积数据集的累积异常曲线,以及拼接高分辨率坐标配置;作者指出后期迭代收益递减,且高分辨率数据集在 180 标签迭代时累积召回曾短暂低于 120 标签。
启示与展望
该结果面向射电巡天的探索式搜寻场景:当目标稀有、形态多样且无法预先定义时,用少量人工标签在单一数据集内迭代排序候选体。它适用于已有高分辨率与卷积产品的干涉阵列巡天,尤其是 MGCLS 这类星系团样本;对只有单一分辨率或缺少已知示踪源的新巡天,需要重新选择束斑尺寸阈值并重新训练特征。作者指出,若同时具备两种分辨率,拼接特征可兼顾早期检出与整体恢复;若只追求快速锁定最显著的源,单独使用高分辨率特征即可;若追求完整性,则单独使用卷积特征更合适。
示踪源同时用于引导主动学习与评估性能,因此累积召回并非独立测试集上的泛化指标;前 100 名中 44 个非示踪源究竟是新的星系团相关辐射、星系群中的 AGN 弥漫辐射,还是背景天体,需要 X 射线成像或光谱红移等后续观测才能判定。作者还指出,二值标注无法表达模糊案例的中间兴趣程度,梯度式 0–5 标注可能提供更强的学习信号;PyBDSF 默认参数会漏掉低信噪比源并把极延展结构打散成多个岛,影响候选体的呈现方式;高分辨率数据集在 180 标签迭代时累积召回短暂下降,提示标注样本在特征空间中的分布均衡性会影响排序稳定性。此外,本文为快速解析版本,图 1 至图 9 与附录图 A1、A2 的具体内容未随文本载入,涉及这些图的细节只能依据正文描述理解。
