ChatPaper.aiChatPaper

CardioState-JEPA:遅延を考慮した心臓共有表現のクロスモーダル学習

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

August 13, 2026
著者: Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed
cs.AI

要旨

心電図(ECG)、光電容積脈波記録(PPG)、心音図(PCG)は、同一の心周期を相補的な視点から捉えるものであるが、既存の心臓基盤モデルは単一のセンシングモダリティで訓練されており、センサー間で共有される生理学的特性は活用されていない。我々は、生理学的知識を組み込んだ結合埋め込み予測アーキテクチャに基づき、ECG、PPG、PCGにわたって単一の共有表現を共同で学習する心臓基盤モデルCardioState-JEPAを提案する。本モデルは異種の波形を共通のトークン空間に写像し、単一の共有Transformerエンコーダで処理し、マスク化された潜在心臓状態を予測することで学習する。これにより、事前学習の目標をセンサー固有の波形形状ではなく、共有された生理学的特性に置いている。電気的・機械的・血行動態的イベント間の時間的ずれを扱うため、クロスモーダル予測では、対応する心臓時刻で信号を整合させる学習遅延アライナを使用する。同期したマルチセンサ記録は稀少であるため、CardioState-JEPAはまず豊富な単一モダリティデータからモダリティ内構造を学習し、次にペアデータを用いて潜在的な心臓時刻上でモダリティを整合させる。凍結エンコーダとしてECG、PPG、PCGにわたる25の下流タスクで評価したところ、本エンコーダは最良の自己教師あり信号ベースラインと比較して、PPG分類の平均AUROCを8.2ポイント、PCG心雑音検出を18.8ポイント、ECG分類を15.5ポイント向上させた。さらに、複数のECGベンチマークにおいて、特権的な臨床テキストや教師ラベルを用いて訓練された心臓モデルと同等以上の性能を示した。これらの結果は、異種の心臓信号が単一の心臓生理学基盤モデルを相互に監視できることを実証している。
English
Electrocardiography (ECG), photoplethysmography (PPG), and phonocardiography (PCG) provide complementary views of the same cardiac cycle, yet existing cardiac foundation models are trained for a single sensing modality, leaving the shared physiology across sensors unexploited. We introduce CardioState-JEPA, a cardiac foundation model to learn a single shared representation jointly across ECG, PPG, and PCG, built on a physiology-aware joint-embedding predictive architecture. The model maps heterogeneous waveforms into a common token space, processes them with a single shared Transformer encoder, and learns by predicting masked latent cardiac states, placing the pretraining target on shared physiology rather than sensor-specific waveform appearance. To handle the temporal offsets between electrical, mechanical, and hemodynamic events, cross-modal prediction uses a learned delay aligner that matches signals at the corresponding cardiac time. Because synchronized multi-sensor recordings are scarce, CardioState-JEPA first learns within-modality structure from abundant unimodal data and then uses paired data to align modalities in latent cardiac time. Evaluated as a frozen encoder across 25 downstream tasks spanning ECG, PPG, and PCG, our encoder improves average PPG classification by 8.2 AUROC points, PCG murmur detection by 18.8 AUROC points, and ECG classification by 15.5 AUROC points over the best self-supervised signal baseline and matches or exceeds cardiac models trained with privileged clinical text or supervised labels on several ECG benchmarks. These results establish that heterogeneous cardiac signals can mutually supervise a single foundation model of cardiac physiology.