Generative Foundation Model for Structured and Unstructured Electronic Health Records

2508.16054v1 cs.AI, cs.CL 2025-08-26
Авторы:

Sonish Sivarajkumar, Hang Zhang, Yuelyu Ji, Maneesh Bilalpur, Xizhi Wu, Chenyu Li, Min Gu Kwak, Shyam Visweswaran, Yanshan Wang

Резюме на русском

## Контекст Electronic health records (EHRs) представляют собой огромные клинические базы данных, содержащие разнообразные сведения о пациентах, включая структурированные элементы (например, демографические данные, результаты лабораторных исследований, данные по виталю) и неструктурированные клинические заметки. Однако использование этих данных для повышения качества медицинского обслуживания становится сложным из-за их гетерогенности и сложности. Недавние разработки в области больших языковых моделей (LLMs) дали возможность создания фундаментальных моделей, которые могут обучаться на нескольких модальностях данных, включая структурированные и неструктурированные, и применяться для решения клинических задач. Несмотря на эти успехи, большинство существующих моделей продолжают использовать неэффективные подходы, сериализуя цифровые данные EHR в текст, что приводит к утере важных контекстов, таких как временные характеристики и количественные изменения. Требуется разработка модели, которая могла бы одновременно обрабатывать множество модальностей данных, сохраняя все их характеристики, и давала бы высококачественные результаты. ## Метод Мы предлагаем **Generative Deep Patient (GDP)**, многомодальную фундаментальную модель, которая может обрабатывать и структурированные, и неструктурированные данные из EHR. Модель включает в себя: 1. **CNN-Transformer Encoder**: Она эффективно обрабатывает структурированные EHR в виде временных рядов (time-series) и кодирует их с учетом временных характеристик. 2. **Cross-Modal Attention Mechanism**: Он объединяет информацию из структурированных и неструктурированных данных, обеспечивая глубинный контекстный анализ. 3. **LLaMA-Based Decoder**: Этот декодер генерирует высококачественные клинические рекомендации и многомодальные клинические рассказы. GDP тренируется с помощью двух этапов: 1. **Generative Pretraining**: Модель научивается генерировать клинические рассказы, при этом применяя **Masked Feature Prediction (MFP)** и **Next Time-Step Prediction (NTP)** для улучшения понимания временных характеристик. 2. **Multi-Task Fine-Tuning**: Модель применяется для конкретных клинических задач, таких как предсказание заболеваний (например, сердечной недостаточности), рассчитывания риска передержания в больнице и других клинических показателей. ## Результаты Мы проверили эффективность GDP на большом наборе данных MIMIC-IV. Модель показала высокую точность в клинических предсказаниях: - **Heart Failure (Сердечная недостаточность)**: AUROC = 0.923 - **Type 2 Diabetes (Тип 2 диабет)**: AUROC = 0.817 - **30-Day Readmission (Передержание в больнице за 30 дней)**: AUROC = 0.627 Более того, GDP демонстрирует высокую качественную генерацию клинических рассказов: - **ROUGE

Abstract

Electronic health records (EHRs) are rich clinical data sources but complex repositories of patient data, spanning structured elements (demographics, vitals, lab results, codes), unstructured clinical notes and other modalities of data. Harnessing this heterogeneity is critical for improving patient outcomes. Recent advances in large language models (LLMs) have enabled foundation models that can learn from multiple data modalities and support clinical tasks. However, most current approaches simply serialize numeric EHR data into text, which risks losing temporal and quantitative detail. We introduce Generative Deep Patient (GDP), a multimodal foundation model that natively encodes structured EHR time-series via a CNN-Transformer encoder and fuses it with unstructured EHRs through cross-modal attention into a LLaMA-based decoder. GDP is trained in two stages: (1) generative pretraining, where it learns to produce clinical narratives from raw patient timelines while also performing masked feature prediction (MFP) and next time-step prediction (NTP) to capture temporal dynamics; and (2) multi-task fine-tuning for clinically meaningful predictions (e.g., heart failure, type 2 diabetes, 30-day readmission). In clinical prediction, GDP demonstrated superior performance on MIMIC-IV: heart failure AUROC = 0.923, type 2 diabetes AUROC = 0.817, and 30-day readmission AUROC = 0.627. For narrative generation, GDP achieved ROUGE-L = 0.135 and BERTScore-F1 = 0.545. In a blinded human evaluation, GDP-Instruct scored highest on faithfulness, fluency, and overall clinical utility, suggesting reduced hospital documentation workload without sacrificing accuracy. Our results demonstrate that a single multimodal foundation model can both predict clinically actionable events and generate high-quality clinical narratives. Furthermore, GDP's flexible architecture can be extended to additional modalities.

Ссылки и действия