跳到主要内容
返回时间线
npj Digital Medicine来源发表:

BenchECG 与 xECG:心电基础模型的标准化基准与基线

核心概要

该工作提出 BenchECG——一个整合八个公开心电数据集、421,171 名患者、1,674,704 条记录与十项任务(分类、分割、检测、回归、生存分析)的标准化基准,并据此评测 ST-MEM、ECG-JEPA、ECGFounder 等公开基础模型;同时提出基于 xLSTM 双向架构、用 SimDINOv2 自监督预训练的 xECG,其在 BenchECG 上取得最高综合得分 0.868±0.0030(微调平均排名 1.50、线性探测平均排名 1.20),是唯一在所有数据集与任务类型上均表现强劲的公开模型,并在长时程任务(睡眠呼吸暂停 AUROC 0.932±0.014、MIT-BIH 心律失常 F1 0.677±0.025)与计

Source-provided article image: BenchECG and xECG: a benchmark and baseline for ECG foundation models

深度剖析

提出 BenchECG:首个面向心电基础模型的综合标准化基准,覆盖八数据集、十任务与多类信号。 相较以往工作任务选择狭窄、数据集不一致,BenchECG 统一了信号特征(1–12 导联、100–500 Hz、秒级到小时级)、人群(欧洲、美国、中国、巴西,健康人到 ICU 患者)与任务类型(分类、分割、检测、回归、生存分析),并明确要求参评模型不得在评测数据集上预训练。 基准由 8 个公开数据集、421,171 名患者、1,674,704 条记录构成,每模型训练 5 次并报告均值±标准差,模型间差异用双侧 Welch t 检验(p<0.05)评估。

提出 xECG:基于 xLSTM 双向架构、用 SimDINOv2 自监督预训练的心电基础模型。 不同于以往以 transformer 为主的自监督心电模型,xECG 采用交替 sLSTM/mLSTM 块(s,s,m,m,s,s,m,m,s)双向处理时序 patch,并首次将 SimDINOv2 的教师-学生自蒸馏(含 patch 级、样本级与编码率正则三项损失)适配到心电时序域。 预训练使用 CODE、Chapman & Ningbo、INCART 约 800 万条心电,100 轮、批大小 512;在 BenchECG 上取得最高综合得分 0.868±0.0030。

xECG 在长时程任务上明显优于 transformer/CNN 基线,且线性探测下特征迁移性更强。 睡眠呼吸暂停任务中 xECG AUROC 0.932±0.014,显著高于 ST-MEM(0.702±0.020)与监督 xLSTM(0.853±0.022);MIT-BIH 心律失常线性探测 F1 0.674±0.013 对比 ST-MEM 0.436±0.036。 上述差异均报告了 p 值(如 p=0.0000001、p=0.000032),基于 5 次独立运行的均值±标准差。

xECG 在计算效率上优于 transformer 基线,并公开代码与权重。 在相同硬件(单张 Nvidia L40S)上,xECG 全基准微调耗时约 5.1 小时对比 ST-MEM 26.1 小时;在 PTB-XL 相同训练步数下约 10 倍更少时间(7 分钟 vs 67 分钟)与约 7 倍更少显存(4.2 GB vs 28.4 GB)。 效率对比在统一硬件与统一训练步数(30 轮、批大小 96,共 5430 步)下进行,并给出参数量(xECG 57.0M、ST-MEM 85.2M 等)。

启示与展望

BenchECG 面向希望在统一条件下比较心电基础模型的研究者与工程团队,适用于公开数据集可覆盖的评测场景;xECG 的强项集中在长时程与多任务泛化,其预训练语料为 CODE、INCART 与 Chapman & Ningbo。该工作为后续在更长信号、更多模态与更广人群上的模型开发与选型提供了可复用的评测框架与基线。

各模型预训练数据规模差异较大(ECGFounder 约 1000 万条、xECG 约 800 万条、ST-MEM 与 ECG-JEPA 约 40 万条),因此难以据此判定哪种预训练方法最优;评测聚焦技术指标,未直接评估临床效用或安全性,需前瞻性验证;固定基准存在被针对性调优的风险,且受公开数据集可得性限制,未必覆盖真实心电实践的全部变异。

来源