目录
1. 引言
2. 原理与方法
2.1 实验数据
2.2 ECG信号预处理与R峰定位
2.3 逐分钟HRV多维特征提取体系
2.4 时序上下文特征增强策略
2.5 分类模型构建与阈值优化
3. 结果与分析
3.1 多模型横向对比结果
3.2 最优模型混淆矩阵分析
3.3 ROC曲线与判别能力评估
3.4 逐记录预测时间序列分析
3.5 记录级呼吸暂停负担估计
4. 讨论
5. 结论
参考文献
摘要:阻塞性睡眠呼吸暂停(Obstructive Sleep Apnea, OSA)是一种高患病率但临床漏诊率极高的睡眠呼吸障碍。传统多导睡眠监测(Polysomnography, PSG)虽是诊断金标准,但受限于设备成本高、操作复杂及患者依从性差等问题。单导联心电图(ECG)凭借其采集便捷、适宜长期穿戴监测的优势,为OSA大规模社区筛查提供了可行路径。本研究基于PhysioNet Apnea-ECG数据库,提出了一套完整的单导联ECG信号驱动OSA分钟级筛查框架。该框架依次涵盖自适应ECG预处理、高精度R峰定位、逐分钟多维HRV特征提取、基于滑动窗口的时序上下文特征增强,以及多种机器学习模型的对比评估。实验采用记录级(record-level)留出法验证策略,严格避免受试者间数据泄漏。结果表明,伪线性判别模型(Pseudo-linear Discriminant)取得了最优的综合筛查性能,测试集准确率达到80.78%,平衡准确率为80.96%,ROC曲线下面积(AUC)为0.8791,验证了上下文特征增强策略在捕捉呼吸暂停周期性心率模式方面的有效性。
关键词:阻塞性睡眠呼吸暂停;单导联心电图;心率变异性;上下文特征;伪线性判别模型;生理信号处理
1. 引言
阻塞性睡眠呼吸暂停以睡眠过程中反复出现的上气道塌陷或完全阻塞为核心病理特征,可引发间歇性低氧血症、睡眠结构破碎及剧烈的自主神经功能紊乱。大量流行病学研究表明,未经干预的重度OSA显著增加高血压、冠状动脉粥样硬化性心脏病、心律失常、脑卒中等心血管事件的发病风险,并严重影响患者日间认知功能与生活质量。
目前,PSG作为临床诊断的金标准,需在睡眠实验室中同步采集脑电、眼电、肌电、心电、血氧饱和度、口鼻气流及胸腹呼吸运动等多导生理信号。然而,PSG检查存在资源消耗大、排队周期长、首夜效应显著等固有缺陷,难以满足大规模高危人群的初筛需求。
ECG信号中蕴含两类与呼吸暂停事件密切相关的病理生理信息:其一,呼吸暂停期间迷走神经张力下降、交感神经活性代偿性增强,表现为心率周期性减速与恢复,即所谓的循环心率变化(Cyclical Variation of Heart Rate, CVHR);其二,通过解析RR间期序列获取的心率变异性指标,能够定量刻画自主神经系统的平衡状态。因此,利用体表ECG进行OSA筛查具有坚实的神经体液调节理论基础。
现有基于ECG的OSA检测研究多聚焦于单分钟HRV统计量,忽视了呼吸暂停事件在时间维度上的连续演变与前后状态依赖关系。针对这一局限,本研究创新性地引入多尺度滑动窗口上下文特征,通过提取相邻分钟HRV指标的局部均值、波动幅度、差分变化及变化趋势,显式建模OSA事件发作前后的短时动态过程。此外,本研究系统对比了多种传统机器学习范式在上下文增强特征集上的效能,旨在为构建高可解释性、低计算成本的穿戴式OSA初筛系统提供理论依据与算法参考。
2. 原理与方法
2.1 实验数据
本研究采用PhysioNet公开库中的Apnea-ECG Database学习集作为数据来源。该数据集包含35条单导联夜间ECG记录(编号a01-a20, b01-b05, c01-c10),采样频率统一为100 Hz,信号分辨率为12-bit。每条记录均附带由睡眠专家依据同步PSG标注的逐分钟标签,其中“A”标识该分钟存在呼吸暂停或低通气事件,“N”标识正常呼吸分钟。
图1:Apnea-ECG Database 数据集
经统计,全集共含17,045个分钟片段,阳性样本(呼吸暂停)6,514个,占比38.22%。经R峰检测与HRV计算质控后,纳入建模的有效分钟片段为15,031个。
本研究的任务形式定义为:以单导联ECG信号为输入,在每分钟尺度上输出二分类判决结果,实现OSA事件的自动分钟级筛查。
2.2 ECG信号预处理与R峰定位
原始ECG信号易受基线漂移、工频干扰及肌电噪声污染,需进行级联滤波预处理。本研究首先采用带通滤波器(截止频率0.5~40 Hz)抑制低频基线漂移与高频噪声,随后应用自适应阈值法增强QRS复合波的陡峭上升沿特征。
对于预处理后的干净ECG信号s[n],采用相位校正的QRS检测算法定位R峰样本点位置。设连续检出的两个R峰分别位于样本点R_iRi与R_{i+1}Ri+1,则对应的第ii个RR间期(单位:毫秒)定义为:
其中,为采样率。进一步地,瞬时心率可通过RR间期换算获得:
(次/分钟)
R波检测,相关内容也可见我主页的如下链接,👇
「ECG信号处理——(10)Pan-Tompkins算法(R峰检测)」2025年3月17日-CSDN博客
图2:级联滤波预处理后进行R波检测
2.3 逐分钟HRV多维特征提取体系
在完成RR间期序列重构后,以1分钟为分析窗格,计算涵盖心率统计、时域、频域及非线性域的完备HRV特征集。具体特征体系及生理含义如下:
(1)心率与RR间期统计特征
包含窗内RR间期均值(mean_RR)、中位数(median_RR)、标准差,以及心率的均值、最小值与最大值,用以描述该分钟内整体心脏节律水平。
(2)时域HRV特征
时域指标反映RR间期的总体变异性与瞬时波动程度。核心计算公式为:
其中,表示相邻RR间期差值大于50 ms的个数。
与
主要刻画副交感神经调控功能。
(3)频域HRV特征
采用Welch周期图法估计RR间期序列的功率谱密度,并提取极低频(, 0.003~0.04 Hz)、低频(
, 0.04~0.15 Hz)及高频(
, 0.15~0.4 Hz)频带能量。同时计算归一化低频功率(
)、归一化高频功率(
)及LF/HF比值,用以定量评估交感-副交感神经张力平衡状态。
(4)非线性HRV特征
基于Poincare散点图分析,定义标准差SDSD1与SD2:
其中为相邻RR间期差值的标准差。
反映瞬时逐拍变异度(主要关联HF成分),
反映长期总体变异度,两者之比
可表征心率调控的非线性耦合特征。
心率变异性HRV,相关内容也可见我主页的如下链接,👇
「ECG信号处理——(12)心率变异性分析」2025年4月1日_hrv rri-CSDN博客
图3:HRV多维特征提取
下表1为HRV 图中的时域、频域、非线性参数表。
表1:HRV时域、频域、非线性参数表
| 模型 | 准确率 | 精确率 | 召回率 |
|---|---|---|---|
| time_domain | Mean HR | 60.4 | bpm |
| time_domain | Mean RR | 992.9 | ms |
| time_domain | HR min | 32.4 | bpm |
| time_domain | HR max | 142.9 | bpm |
| time_domain | SDNN | 164.6 | ms |
| time_domain | RMSSD | 113.1 | ms |
| time_domain | SDSD | 113.1 | ms |
| time_domain | NN50 | 11610 | count |
| time_domain | pNN50 | 39 | % |
| frequency_domain | VLF | 15637.63 | ms^2 |
| frequency_domain | LF | 5622.106 | ms^2 |
| frequency_domain | HF | 2596.444 | ms^2 |
| frequency_domain | LF nu | 68.4 | nu |
| frequency_domain | HF nu | 31.6 | nu |
| frequency_domain | LF/HF | 2.165 | |
| frequency_domain | Total 5min | 24281.18 | ms^2 |
| nonlinear | SD1 | 80 | ms |
| nonlinear | SD2 | 218.6 | ms |
| nonlinear | SD2/SD1 | 2.733 |
2.4 时序上下文特征增强策略
OSA事件并非孤立静息状态下的随机点,而是呈现持续数分钟至数十分钟的聚集性发作,且发作前、中、后期的HRV变化轨迹具有显著差异性。为挖掘这种时间依赖性信息,本研究引入基于居中滑动窗口的上下文特征构造机制。
对于某一基础HRV特征序列,其中tt表示分钟索引,在同一条ECG记录内部,取窗口半径
(对应总窗口宽度
,取值为3分钟和5分钟),定义如下四类上下文派生特征:
(1)局部均值(Context Mean)
刻画特征在局部窗口内的基准水平:
(2)局部标准差(Context Std)
刻画窗口内特征波动幅度,反映HRV不稳定程度:
(3)一阶差分(Context Delta)
刻画当前分钟与前一分钟(或滞后分钟)的瞬时变化量,用于捕捉心率的快速应答:
其中为滞后阶数(通常取 1 或对应窗口半径)。
(4)局部趋势斜率(Context Slope)
通过最小二乘线性回归拟合窗内变化趋势,反映HRV指标的持续上升或下降态势:
上述所有上下文特征均在单条记录内部独立计算,确保时间窗不跨越不同受试者或不同夜间记录,从源头杜绝未来信息泄漏。本研究选取15个核心基础HRV特征进行扩展,在3分钟与5分钟两个尺度下分别生成均值、标准差、差分与斜率,最终构造出120个上下文特征,联合基础特征构成148维特征向量用于后续建模。
图4:上下文HRV特征示例
2.5 分类模型构建与阈值优化
为全面评估特征集的有效性,本研究并行对比了六类经典机器学习模型:径向基核支持向量机(RBF-SVM)、袋装决策树(Bagged Trees)、RUSBoost提升树、LogitBoost提升树、加权K近邻(Weighted KNN)以及伪线性判别模型(Pseudo-linear Discriminant)。
为避免因同记录样本随机打散导致的数据泄漏与性能虚高,本研究采用记录级留出验证(Record-level Holdout)策略。即以整条ECG记录为最小划分单元,按0.70:0.30的比例将35条记录拆分为训练集与测试集,保证同一记录内的所有分钟样本不会同时出现在训练与测试进程中,从而模拟模型面对全新受试者时的泛化场景。
建模流程如下:
1)对训练集特征进行Z-score标准化,利用训练集均值和方差归一化测试集;
2)引入代价敏感学习机制,对呼吸暂停类别赋予更高的误分类代价,以缓解类别不平衡问题;
3)采用交叉验证在训练集上优化模型超参数;
4)基于训练集后验概率输出,以最大化平衡准确率(Balanced Accuracy)为目标函数,搜索最优分类阈值;
其中为召回率(敏感度),
为特异度,二者均为分类阈值
的函数。
5)在未见测试集上评估模型的最终泛化性能。
评价指标涵盖准确率(Accuracy)、精确率(Precision)、召回率(Recall)、特异度(Specificity)、F1分数、AUC及平衡准确率。
3. 结果与分析
3.1 特征空间分布的PCA可视化分析
在构建分类模型之前,为直观评估本研究所提取的148维上下文HRV特征在区分正常呼吸与呼吸暂停片段时的自然聚集程度与可分性,本研究对所有标准化后的特征进行了主成分分析(Principal Component Analysis, PCA),并将高维特征投影至前两个主成分所张成的二维平面中进行可视化。
设经Z-score标准化后的特征矩阵为,其中
为有效分钟样本数,
为特征维度。PCA通过求解协方差矩阵
的特征值分解,得到按方差贡献率降序排列的主成分方向。图5展示了所有样本在前两个主成分(PC1与PC2)上的投影分布。
图5:基于PCA的HRV特征二维分布散点图(PC1 vs PC2)
图5的PCA投影揭示了以下三类可辨识的分布特征:
(1)类别高度重叠。蓝色(正常)与橙色(呼吸暂停)样本在二维平面中大面积交错,不存在能够干净分离两类的线性边界。这表明OSA引发的HRV变化在高维空间中并非全局性的、均匀分布的差异,难以通过简单线性投影揭示其完整结构。
(2)方差解释率有限。PC1与PC2的累计方差解释率仅为36.0%,说明前两个主成分远不足以表征OSA相关的判别信息。这一结果从数据层面表明,HRV特征空间中存在大量非线性交互与冗余结构,需要借助具备高维映射能力的机器学习模型而非目视判读来完成分类。
(3)离群样本存在。少数样本在PC1或PC2方向明显偏离主集群,可能源于R峰检测误差、异位心搏、信号伪影或个体间极端生理差异,提示分类器应具备对异常值的一定鲁棒性。
综上,PCA结果揭示了正常与呼吸暂停分钟在二维子空间中高度混杂的本质,意味着依赖HRV特征均值或线性距离的简单规则难以胜任筛查任务。因此,必须引入能够在原始高维空间构建复杂判别函数的机器学习方法——这正是第3.2节多模型对比实验的核心出发点。
3.2 多模型横向对比结果
在统一特征集与统一记录级划分策略下,各模型在测试集(共11条记录,4,407个有效分钟)上的性能指标如表2所示。
表2 各模型在测试集上的分类性能对比
| 模型 | 准确率 | 精确率 | 召回率 | 特异度 | F1分数 | 平衡准确率 | AUC |
|---|---|---|---|---|---|---|---|
| 伪线性判别 | 0.8078 | 0.8531 | 0.7956 | 0.8235 | 0.8234 | 0.8096 | 0.8791 |
| LogitBoost提升树 | 0.7831 | 0.8692 | 0.7235 | 0.8598 | 0.7897 | 0.7917 | 0.8791 |
| 袋装决策树 | 0.7622 | 0.8892 | 0.6598 | 0.8941 | 0.7575 | 0.7769 | 0.8775 |
| RUSBoost提升树 | 0.7561 | 0.8380 | 0.7025 | 0.8250 | 0.7643 | 0.7638 | 0.8552 |
| RBF核SVM | 0.7252 | 0.8332 | 0.6401 | 0.8349 | 0.7240 | 0.7375 | 0.8439 |
| 加权KNN | 0.4443 | 0.9444 | 0.0137 | 0.9990 | 0.0270 | 0.5063 | 0.8174 |
从表2可知,伪线性判别模型在准确率、召回率、F1分数及平衡准确率四项关键指标上均位列第一。值得注意的是,尽管加权KNN的特异度极高(0.9990),但其召回率仅有0.0137,表明模型几乎将所有样本判为阴性,属于严重的类别不平衡过拟合现象,不具备临床筛查实用价值。LogitBoost与Bagged Trees虽在精确率与特异度上表现优异,但其召回率显著低于伪线性判别,意味着在真实筛查场景中将漏掉更多真正的呼吸暂停分钟。
图6:多模型指标对比
伪线性判别模型在保持81%以上精确率的同时,召回率接近80%,说明该模型能够有效权衡呼吸暂停检出率与误报率,适合作为OSA初筛工具。
3.3 最优模型混淆矩阵分析
选取伪线性判别模型,其在测试集上的混淆矩阵分解为:真阳性(TP)1,974例,真阴性(TN)1,586例,假阳性(FP)340例,假阴性(FN)507例。
图7:最优模型混淆矩阵(线性判别模型)
据此计算,阳性预测值为85.31%,阴性预测值为75.78%。该混淆矩阵呈现两个重要特征:第一,假阴性数量(507)相对假阳性数量(340)略高,反映出模型对呼吸暂停类别的判定趋向于保守,这与代价敏感学习中的阈值优化结果相符(最优阈值0.3228,偏向阳性类别);第二,模型在两类错误上均未出现极度倾斜,证明上下文特征能够较好地区分正常呼吸段与呼吸暂停段的HRV动态差异。
3.4 ROC曲线与判别能力评估
伪线性判别模型的ROC曲线下面积(AUC)达到0.8791,在统计学上表明该分类器具有优秀的排序能力。与LogitBoost模型(AUC同为0.8791)相比,二者ROC曲线下方面积持平,但伪线性判别在操作点(即实际选用的最优阈值)上取得了更高的平衡准确率,说明前者在阈值附近具有更优的局部灵敏度。
图8:最优模型ROC曲线(线性判别模型)
ROC曲线的形状还提示,当假阳性率控制在0.2以内时,模型的真阳性率即可达到约0.75,这在临床初筛中是较为理想的折中水平。
3.5 逐记录预测时间序列分析
为进一步验证模型对OSA事件时序连续性的追踪能力,本研究绘制了各测试记录的全夜预测标签与真实标签对比时间线。观察时间序列图可以发现,模型对于持续时长超过3分钟的较明确呼吸暂停区块,能够保持较好的连续检出能力;对于正常呼吸的长时程稳定片段,误报较为稀疏。
图9:最优模型预测时间线(线性判别模型)
但在两类状态的边界过渡区(例如呼吸暂停骤然终止转为正常呼吸,或由浅呼吸逐步恶化为暂停),模型预测标签表现出一定的振荡或滞后偏差。该现象可能的成因如下:其一,1分钟标注粒度本身较为粗糙,无法精确反映状态切换的亚分钟级过渡过程;其二,当前上下文窗口(3/5分钟)在强非平稳态变化处的自适应能力尚有不足;其三,单导联ECG无法获取呼吸努力度或血氧下降幅度等直接病理信息,导致对临界状态的分辨力受限。
3.6 记录级呼吸暂停负担估计
除了分钟级精细判决外,本研究还关注模型对整条记录OSA严重程度的宏观估计能力。计算各测试记录中预测为呼吸暂停的分钟占比(预测负担)与实际标注占比(真实负担)。
图10:记录级呼吸暂停负担
数据显示,模型预测的记录级负担与真实负担呈显著正相关趋势,对于负担高于40%的重度记录,模型均能给出高于阈值的评估;对于负担低于15%的轻度或正常记录,模型的估计同样保持低位。这一结果表明,即使存在局部分钟级误判,模型的宏观输出仍可作为有价值的临床初筛参考指标——若某夜记录的预测呼吸暂停负担显著超出经验阈值,可建议受试者转诊接受标准PSG确诊。
4. 讨论
本研究所提框架的有效性可从生理机制层面得到合理阐释。呼吸暂停事件引发间歇性低氧血症,通过外周化学感受器激发交感神经兴奋,同时伴随迷走神经活性抑制。这种自主神经失衡在HRV频谱中表现为HF功率降低、LF/HF比值增大,在时域中表现为RMSSD下降。上下文特征则将这种失衡状态的演变过程纳入考量——例如呼吸暂停即将发生前,SDNN可能呈现渐进式下降趋势;而当呼吸恢复时,心率快速回升对应的HRV差分特征会出现剧烈跳变。伪线性判别模型通过线性组合上述众多原始及派生特征,实际上构建了一个映射自主神经张力时空演化模式的低维判别流形。
与传统深度学习方法相比,该模型的优势在于无需海量训练数据,且线性判别函数的权重系数具有明确的可解释性,便于临床医师理解模型决策依据。然而,其局限性同样明显:线性模型难以捕获高阶非线性交互效应,且对R峰检测错误极为敏感——若某分钟内出现漏检或误检R峰,将直接污染该分钟及邻近窗口的多个上下文特征。
5. 结论
本研究围绕单导联ECG的OSA筛查问题,提出了一套融合多域HRV基础特征与短时滑动窗口上下文增强特征的机器学习分析框架。通过在PhysioNet Apnea-ECG公共数据集上的严格记录级留出验证,证实了上下文特征能够显著提升传统模型对呼吸暂停事件的时序追踪能力。在六类对比模型中,伪线性判别模型展现出最佳的全面性能,测试集平衡准确率达到80.96%,AUC达到0.8791,表明该方法在保持较高检出率的同时具备可控的误报率。
本研究为低成本、可穿戴心电设备的OSA社区筛查提供了算法层面的可行方案。未来工作将着眼于:引入长短期记忆网络等时序深度模型以替代固定窗口手工特征;融合三轴加速度或血氧饱和度等多模态信号以弥补单模态信息不足;以及在多中心、跨设备数据上开展泛化性验证,推动研究成果向实际临床应用转化。
参考文献
[1] T Penzel, GB Moody, RG Mark, AL Goldberger, JH Peter. The Apnea-ECG Database. Computers in Cardiology 2000;27:255-258.
[2] Penzel, T., McNames, J., de Chazal, P.et al.Systematic comparison of different algorithms for apnoea detection based on electrocardiogram recordings.Med. Biol. Eng. Comput.40, 402–407 (2002). https://doi.org/10.1007/BF02345072
[3] Task Force of the European Society of Cardiology and the North American Society of Pacing and Electrophysiology. Heart rate variability. Standards of measurement, physiologic interpretation, and clinical use. Circulation 1996; 93:1043-1065.
[4] Guilleminault C , Winkle R , Connolly S ,et al.Cyclical variation of the heart rate in sleep apnoea syndrome. Mechanisms, and usefulness of 24 h electrocardiography as a screening technique.[J].Lancet, 1984, 323(8369):126-131.DOI:10.1016/S0140-6736(84)90062-X.
[5] J. E. Mietus, C. K. Peng, P. C. Ivanov and A. L. Goldberger, "Detection of obstructive sleep apnea from cardiac interbeat interval time series,"Computers in Cardiology 2000. Vol.27 (Cat. 00CH37163), Cambridge, MA, USA, 2000, pp. 753-756, doi: 10.1109/CIC.2000.898634.
Tips:下一讲,我们将进一步探讨,心电信号处理与应用的其他部分。
以上就是基于单导联心电图与上下文心率变异性特征的阻塞性睡眠呼吸暂停筛查方法研究的全部内容啦~
我们下期再见,拜拜(⭐v⭐) ~
(Ps:有代码实现需求,请见下列【微信名片】或【主页信息】,谢谢支持!~)