WISE-ATTA 把主动测试时适应的监督预算从“标哪张”转向“何时标”,在 ImageNet-C/R/K/A 上以更少标签取得更低误差
核心概要
该工作提出“预算化主动测试时适应”(budgeted ATTA)设定,即长测试流中只有一部分批次可获得标签,并给出 WISE-ATTA:用在线轻量信号(低熵预测占比)配合滑动历史分位数与预算“欠账”控制器决定何时请求监督,再用相对 EMA 锚模型的预测漂移挑选单个样本标注;在 ImageNet-C 的 CTTA/FTTA 与 ImageNet-R/K/A 上,它以每批 1 个标签达到或优于近期 ATTA 方法,并报告最多减少 50% 标签。
深度剖析
论文把主动测试时适应重新表述为“预算化”问题:标签只覆盖测试流中固定比例(annotation ratio)的批次,每个被选批次只查询 1 个标签,总预算由约束限制。 此前 ATTA 方法默认每个到来的测试批次都可请求监督,只在批内减少标注样本数(如 SimATTA 按熵与聚类选样、EATTA 按预测对特征扰动的敏感性选样);该工作把监督与批次结构解耦,使核心问题从“批内标什么”变为“在时间上何时标”。 论文以形式化设定给出二值动作与总预算约束,并在 ImageNet-C/R/K/A 上按该设定评测;正文说明该设定更贴近人工、算力或延迟受限时监督只能间歇可得的实际情形。
WISE-ATTA 的批次选择用“低熵预测占比”作为批次级适应可靠性代理,并用滑动历史窗口的自适应分位数阈值决定是否标注,阈值由不依赖流长度的预算“欠账”控制器调节。 与按固定节奏均匀标注的既有做法相比,该策略把监督集中到相对近期观测更有信息量的批次;作者报告在固定预算下,预算节奏化选择在 ImageNet-C 的 CTTA 与 FTTA 下总体带来最大误差下降,在 ImageNet-R/K/A 上两个骨干的平均改进分别为若干百分点。 证据来自固定样本选择器、只改变批次选择策略的对照实验(Uniform、Random 两种简单策略),以及附录中按 corruption 分类的完整结果;附录 D 显示历史窗口、预热长度与 slack 在较宽取值范围内平均误差变化不大。
样本选择使用相对 EMA 锚模型的预测漂移:被选批次中查询漂移最大的单个样本,作者把漂移解释为样本预测沿模型近期适应方向的轨迹敏感性。 论文指出熵是单时刻的静态判据,无法区分“仍在适应”与“已稳定”;漂移则刻画预测是否仍在结构化变化。附录 C 的查询行为分析显示 Max-Entropy 集中在近零漂移的极端高熵样本,EATTA 多落在低漂移带,而 WISE-ATTA 落在中等熵、较大漂移的区域。 在相同每批 1 标签预算下,WISE-ATTA 在 ImageNet-C 上取得最低平均误差(CTTA 53.3%、FTTA 51.6%),并优于每批 3 标签的 HILTTA;在 ImageNet-R/K/A 上 RN50-BN 与 ViT-B-16 平均误差分别为 70.9% 与 56.6%。
论文报告了预算分配的时间形态与部署相关分析:标签在流的前段密度更高,且不会提前耗尽预算;在非选中批次跳过更新、不同在线批大小、以及标签延迟条件下仍保持相对优势。 这些分析把“何时监督”的效果落到可观察的分配行为上,并给出延迟场景下的边界:所有方法随延迟增大而系统性退化,ViT-B-16/ImageNet-K 上误差从延迟 0 到 200 由 58.0 升至 93.0。 证据来自把流分成十个等长时间箱的标签计数、附录 F 的轻量变体对照(WISE-ATTA 平均误差仅从 55.7 变为 55.8)、附录 G 的批大小扫描,以及附录 H 的延迟对照表。
启示与展望
该结果面向部署后分布持续漂移、标注预算有限且只能间歇获得监督的图像分类场景,适用于希望在不引入回放缓冲或教师模型的前提下降低标注量的实践者;作者指出方法在非选中批次跳过无监督更新时仍具竞争力,因而也可用于算力受限的轻量部署,并给出了不同在线批大小下的表现。
论文假设每个批次由单一分布偏移主导,作者指出多偏移共存的异质批次是自然延伸;延迟分析显示所有 ATTA 方法随延迟增大而系统性退化,延迟感知的更新加权或批次选择仍是开放方向;此外,正文与附录的若干表格在本次载入的文本中未完整呈现数值,具体逐项对比需回到原文核对。
