《自然》杂志,2026年7月15日在线发表;doi:10.1038/s41586-026-10780-5。本文提出一种贝叶斯生成框架,该框架整合纵向电子健康档案(EHR)与遗传数据,以识别潜在的疾病特征。
Electronic health records (EHRs) provide rich longitudinal disease histories, but existing methods for analysing these data typically treat diseases in isolation1 and rarely integrate germline genetics. Here we present ALADYNOULLI, a Bayesian generative framework that jointly models longitudinal EHR diagnoses, age and polygenic risk to recover latent time-varying disease signatures and patient-specific signature loadings; the model is formulated as a mixture of probabilities rather than a probability of a mixture2, correctly accommodating simultaneous an...
传统电子健康档案(EHR)分析将疾病视为孤立实体或仅考察两两关联,因而无法捕捉多种疾病如何共同演化¹。近期的无监督聚类方法¹⁶通常忽略时间动态性、疾病内部的生物学变异以及遗传因素对疾病进展的影响¹⁷,¹⁸。我们提出ALADYNOULLI——一种生成式模型,可整合种系遗传数据与纵向EHR,识别潜在疾病特征(latent disease signatures),从而建模个体特异性的健康轨迹随时间的变化。ALADYNOULLI通过识别能反映多种疾病共有的生物学过程的共享疾病特征,弥补了上述局限;该机制支持信息在相关但更常见的疾病之间共享,从而提升对罕见疾病的预测准确性¹⁹。 ALADYNOULLI相较现有方法具有若干关键优势:(1)对于可复现的特征,其生成的疾病特征在跨队列分析中展现出高度稳定性,并与所考察病例(家族性高胆固醇血症、克隆性造血、1型与2型糖尿病)中既有的临床表型高度一致;(2)在时间建模方面,可刻画疾病风险在整个生命历程中的动态演变;(3)在遗传整合方面,直接将遗传信息嵌入模型架构;(4)作为统一框架,可同时建模EHR中绝大多数常见疾病,在相关疾病间共享信息,从而即使对数据有限的疾病亦能提升预测性能¹⁹;(5)在个体特异性轨迹方面,提供可随新增临床信息实时更新的个性化风险谱;(6)在原则性偏倚校正方面,基于明确的似然函数设定,支持通过逆概率加权(inverse probability weighting)进行原则性选择偏倚校正。 通过联合建模多种疾病及其遗传决定因素,ALADYNOULLI提升了疾病风险预测能力,增强了遗传发现效能,并揭示了诊断类别内部的患者亚群。个体间的疾病模式在发病年龄、进展速度及构成成分上存在差异,反映出不同的潜在生物学机制。ALADYNOULLI通过整合多个潜在特征,建模个体患每种疾病的概率(图1)。其中,\(\,{\rm{sigmoid}}({\phi }_{kdt})=1/(1+{e}^{-{\phi }_{kdt}})\),κ为全局校准参数,θikt表示个体i在时间t对特征k的标准化且随时间变化的关联强度,ϕkdt则刻画特征k与疾病d在时间t的时变关联关系。标准化的个体–特征关联(即“载荷”,loadings)θikt由潜在变量λikt经如下变换导出:其中rk为人群层面特征k的特异性参考水平,Γk刻画遗传因素对特征易感性的影响,gi表示影响λik均值的个体遗传与人口学因素(包括36个多项式风险评分(PRS)、性别及10个遗传主成分,共计47个特征),Ωλ为时间协方差核(temporal covariance kernel),用于建模λikt随时间变化的平滑轨迹。 其中μd为疾病特异性基线,即人群患病率的logit值,ψkd表示特征k与疾病d之间的总体关联强度,Ωϕ则允许此类关联随时间变化。Ωϕ与Ωλ分别控制偏离均值轨迹的时间协方差,且按构造独立于均值。通过将高斯过程先验设定为均值参数的偏移量,本模型促使时间波动区别于系统性效应(如遗传易感性或疾病–特征关联)。 ALADYNOULLI直接将疾病发生建模为各特征特异性疾病概率的加权组合,因此其形式为概率的混合(mixture of probabilities),而非稀疏因子分析²中“混合的概率”(probability of a mixture),亦非基于分配的主题模型¹⁶中对疾病的回溯式指派。该建模方式使模型能够预测未来发病(而不仅解释已观测到的诊断)、容纳个体同时存在的多种疾病进程,并建模持续存在的慢性疾病。给定θikt与ϕkdt后,各疾病条件独立——所有疾病间的建模相关性均源于其在相同特征中所扮演的角色。本文中,“载荷”(loadings)专指个体特异性的特征关联(λ与θ),“特征–疾病关联”(signature–disease associations)则指特征重要性(ϕ),此用法与稀疏因子分析惯例一致;其他领域术语使用可能不同。 尽管这些队列在人群特征、医疗体系及数据采集方法上存在差异,我们的模型仍识别出高度一致的特征模式(扩展数据图2与图3、补充表3及补充图3–5)。图2c可视化呈现了多种疾病在各年龄段的平均风险比(hazard),凸显其时间风险模式。此外,模型的张量结构(补充图7)支持利用平均载荷(公式(3))与群体层面的ϕkd快速计算疾病风险比。对这些个体模式进行聚合,可揭示显著的群体层面差异。在一项回顾性分析中,图3b对比了早发性心肌梗死(发病年龄≤55岁,事件平均年龄49.9岁)与晚发性心肌梗死(发病年龄≥70岁,平均发病年龄74.6岁):早发组患者在特征5上的贡献峰值更高、出现更早,且事件前特征载荷上升更为迅速,而晚发组则无此表现。不同的轨迹特征提示:尽管临床诊断相同,早发性与晚发性心肌梗死可能源于不同的疾病机制,因而需采取差异化的预防策略。为阐明不同疾病在特征构成上的差异,……
Electronic health records (EHRs) provide rich longitudinal disease histories, but existing methods for analysing these data typically treat diseases in isolation1 and rarely integrate germline genetics. Here we present ALADYNOULLI, a Bayesian generative framework that jointly models longitudinal EHR diagnoses, age and polygenic risk to recover latent time-varying disease signatures and patient-specific signature loadings; the model is formulated as a mixture of probabilities rather than a probability of a mixture2, correctly accommodating simultaneous an...