arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

CardioState-JEPA:面向共享心脏表征的延迟感知跨模态学习

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

arXiv 2608.12944首次发表:更新:

发表机构

Singapore Management University; Eindhoven University of Technology(新加坡管理大学; 埃因霍温理工大学)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

CardioState-JEPA是一种延迟感知跨模态心脏基础模型,通过对齐ECG、PPG、PCG的共享生理表征,在25项下游任务上显著提升了各模态的分类性能,实现了异质心脏信号的相互监督。

AI 中文摘要

心电图(ECG)、光体积描记图(PPG)和心音图(PCG)提供了同一心动周期的互补视图,但现有的心脏基础模型仅针对单一传感模态进行训练,未利用不同传感器间的共享生理信息。我们提出了CardioState-JEPA,这是一种基于生理感知联合嵌入预测架构的心脏基础模型,用于联合学习ECG、PPG和PCG的单一共享表征。该模型将异质波形映射到通用标记空间,通过单个共享Transformer编码器处理,通过预测掩码的潜在心脏状态进行学习,将预训练目标聚焦于共享生理信息而非传感器特定的波形外观。为处理电、机械和血流动力学事件间的时间偏移,跨模态预测采用学习到的延迟对齐器,使信号在对应心脏时间匹配。由于同步多传感器记录数据稀缺,CardioState-JEPA先从丰富的单模态数据中学习模态内结构,再利用配对数据在潜在心脏时间对齐模态。作为冻结编码器在涵盖ECG、PPG和PCG的25项下游任务上评估时,与最佳自监督信号基线相比,该编码器将PPG分类的平均AUROC提升8.2个百分点,PCG杂音检测的AUROC提升18.8个百分点,ECG分类的AUROC提升15.5个百分点,在多项ECG基准上的表现与使用特权临床文本或监督标签训练的心脏模型相当或更优。这些结果表明,异质心脏信号可对单一心脏生理基础模型实现相互监督。

英文摘要

Electrocardiography (ECG), photoplethysmography (PPG), and phonocardiography (PCG) provide complementary views of the same cardiac cycle, yet existing cardiac foundation models are trained for a single sensing modality, leaving the shared physiology across sensors unexploited. We introduce CardioState-JEPA, a cardiac foundation model to learn a single shared representation jointly across ECG, PPG, and PCG, built on a physiology-aware joint-embedding predictive architecture. The model maps heterogeneous waveforms into a common token space, processes them with a single shared Transformer encoder, and learns by predicting masked latent cardiac states, placing the pretraining target on shared physiology rather than sensor-specific waveform appearance. To handle the temporal offsets between electrical, mechanical, and hemodynamic events, cross-modal prediction uses a learned delay aligner that matches signals at the corresponding cardiac time. Because synchronized multi-sensor recordings are scarce, CardioState-JEPA first learns within-modality structure from abundant unimodal data and then uses paired data to align modalities in latent cardiac time. Evaluated as a frozen encoder across 25 downstream tasks spanning ECG, PPG, and PCG, our encoder improves average PPG classification by 8.2 AUROC points, PCG murmur detection by 18.8 AUROC points, and ECG classification by 15.5 AUROC points over the best self-supervised signal baseline and matches or exceeds cardiac models trained with privileged clinical text or supervised labels on several ECG benchmarks. These results establish that heterogeneous cardiac signals can mutually supervise a single foundation model of cardiac physiology.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑