数据库简介
MIMIC-IV数据库
eICU数据库
样本量扩增:联合使用可将样本量提升至 50 万+患者级别,显著提高统计学效力。
外部验证能力:MIMIC 来自单中心(波士顿),eICU 覆盖全美多中心,天然形成内部开发-外部验证的研究设计,同一模型在不同医院会出现性能显著下降,采用多中心数据训练与跨库验证可以提高稳健性与泛化能力。
时间跨度延伸:覆盖 2008-2019 年的长时间窗,可进行时间趋势分析,MIMIC 提供长时间跨度与深度字段,eICU 提供广覆盖的机构差异,两者结合利于做时空与机构层面的稳健性检验。
异质性分析:可比较不同地域、医疗体系下的治疗模式差异。
数据互补:MIMIC 的数据颗粒度更细,eICU 的标准化程度更高,可互为补充。
数据标准化:不同医院的实验室检查项目命名、单位、参考范围存在显著差异。即使使用 LOINC 编码系统进行标准化,仍需大量人工审核和映射工作。某些特殊检查在一个数据库中存在而在另一个中缺失,造成数据完整性问题。
数据采集频率差异:MIMIC-III 的数据颗粒度更细,而 eICU 的标准化程度更高。 MIMIC 数据库中生命体征可能每小时记录多次,而 eICU 中可能采用固定时间间隔记录,这种差异给时序分析带来挑战。
医疗体系差异:MIMIC 数据来自波士顿单一教学医院,而 eICU-CRD 包含了美国 208 家医院的数据。不同地区的医疗实践、资源配置、患者人群特征存在系统性差异,可能影响模型的泛化能力。
时间跨度不同:MIMIC-III 和 MIMIC-IV 覆盖 2001-2019 年,而 eICU-CRD 仅包含 2014-2015 年的数据医疗技术和治疗指南的时代变迁可能导致治疗模式和预后的差异。
双数据库联合使用可研究问题/方向
临床预测模型:比如某类患者 ICU 谵妄的临床预测模型或者列线图;MIMIC 数据库划分训练集和验证集,eICU 的作为验证集。
动态轨迹:用各种生命体征或者实验室指标来预测某类患者 ICU 谵妄,多数据库进行联合开发验证。如血小板、TYG 动态轨迹等等。
关联性研究:某联合指标和不良预后的关联,数据库涉及到的方向主要包括谵妄、意识障碍。
精神类药物的使用:如抗抑郁药、抗焦虑药、抗精神病药、麻醉药物在 ICU 患者中的使用模式、适应症、安全性(副作用、药物相互作用)、撤药反应。
案例一:

标题:Development of a machine learning-based prediction model for sepsis-associated delirium in the intensive care unit
研究内容和结果:重症监护病房(ICU)中的脓毒症患者经常会出现脓毒症相关性谵妄 (SAD),这与预后不良密切相关。该研究的目的是开发一种基于机器学习的模型来早期预测 SAD。患者数据是从重症监护 IV 医疗信息集市(MIMIC-IV)数据库和 eICU 合作研究数据库(eICU-CRD)中提取的。MIMIC-IV 数据分为训练集和内部验证集,而 eICU-CRD 数据则作为外部验证集。使用最小绝对收缩和选择算子回归选择特征变量,并使用逻辑回归、支持向量机、决策树、随机森林、极端梯度提升 (XGBoost)、k 近邻和朴素贝叶斯方法构建预测模型。在验证集中评估模型的性能。该模型还应用于一组未评估或无法评估谵妄的患者。MIMIC-IV 和 eICU-CRD 数据库分别纳入 14,620 例和 1723 例患者,诊断 SAD 的中位时间为 24 小时和 30 小时。与非 SAD 患者相比,SAD 患者 28 天 ICU 死亡率更高,ICU 住院时间更长。在对比的模型中,XGBoost 模型性能最好,被选为最终模型(受试者工作特征曲线下内部验证面积(AUROC)=0.793,外部验证 AUROC=0.701)。XGBoost 模型在预测 SAD 方面优于其他模型。与传统的谵妄评估相比,该预测模型的建立可以更早地预测 SAD,并且适用于传统方法难以评估的患者。
案例二:

标题:Development of a Machine Learning-Based Predictive Model for Postoperative Delirium in Older Adult Intensive Care Unit Patients: Retrospective Study
研究内容和结果:从重症监护 IV 医疗信息市场(MIMIC-IV)数据库和 eICU 合作研究数据库(eICU-CRD)中提取了入住 ICU 超过 24 小时的患者的数据。MIMIC-IV 数据被拆分为(7:3)训练组和内部验证集,而 eICU-CRD 数据则作为外部验证集。使用入院后前 24 小时的数据对随后的预测窗口(12 小时、24 小时、48 小时和整个住院时间)进行谵妄预测。对相应的特征变量进行 Boruta 特征选择,并采用 logistic 回归、支持向量分类器、随机森林分类器和极度梯度提升(XGB)构建预测模型。随后,使用受试者工作特征曲线(AUC)下面积、Brier 评分和决策曲线分析以及外部验证来评估模型性能。MIMIC-IV 和 eICU-CRD 数据集分别包括 6129 名和 709 名患者,他们被纳入分析。选择 54 个特征构建预测模型。关于内部验证,XGB 模型展示了不同预测窗口中谵妄的最有效预测。4 个预测窗口(12 h、24 h、48 h 和整个停留时间)的 AUC 分别为 0.848(95% CI 0.826-0.869)、0.852(95% CI 0.831-0.872)、0.851(95% CI 0.831-0.871)和 0.844(95% CI 0.823-0.863),外部验证集的 AUC 分别为 0.777(95%CI 0.726-0.825)、0.761(95%CI 0.710-0.808)、0.753(95%CI 0.704-0.798)、 和 0.737 (95% CI 0.695-0.777)。此外,XGB 模型在所有预测窗口中表现出最准确的校准,值分别为 0.129、0.136、0.144 和 0.148。此外,决策曲线分析表明,XGB 模型在大多数阈值概率值的净增益方面优于其他模型。确定的 6 个最重要的预测特征是第一天的谵妄评估结果、第一护理病房类型、最低格拉斯哥昏迷量表 (GCS) 评分、急性生理学评分 III、对乙酰氨基酚和非甾体抗炎药。
案例三:

标题:Triglyceride-glucose index as a valuable predictor for aged 65-years and above in critical delirium patients: evidence from a multi-center study
研究内容和结果:重点评估被诊断患有严重谵妄的 65 岁及以上患者。数据来自重症监护医学信息数据库(MIMIC-IV)和 eICU 合作研究数据库(eICU-CRD)。采用多因素 logistic 回归和限制性三次样条(RCS)回归确定 TyG 指数与谵妄风险的关系。从 MIMIC-IV (n = 4,649) 和 eICU-CRD(n = 1,844) 数据库中确定了 65 岁及以上的参与者。根据 RCS 回归得出的最佳阈值,参与者被分为两个队列:Q1(< 8.912)、Q2(≥ 8.912)。logistic 回归分析显示,TyG 指数与 65 岁及以上 ICU 患者危重谵妄风险增加之间存在直接相关性。这些发现在 eICU-CRD 数据集中得到了验证,敏感性分析进一步强化了我们的结论。此外,亚组分析显示了某些差异。
案例四:

标题:Association of dexmedetomidine with short-term outcome in patients with cardiogenic shock: a retrospective propensity score-matched cohort study from MIMIC-IV
研究内容和结果:这项回顾性队列研究分析了来自重症监护医疗信息市场(MIMIC)IV 数据库的数据,重点关注 CS 患者。暴露定义为重症监护病房(ICU)住院期间静脉注射右美托咪定。主要终点包括 7 天和 30 天全因死亡率。使用 eICU 2.0 数据库进行外部验证。预配型和倾向评分匹配的队列分别包括 2,341 名和 1,038 名患者。对整个队列的多变量 Cox 回归分析显示,右美托咪定给药与 7 天风险降低(风险比(HR)= 0.473,95% 置信区间(CI):0.359-0.624,p < 0.001)和 30 天全因死亡率(HR = 0.606,95% CI:0.500-0.735,p < 0.001)的风险降低显著相关。这种保护性关联在倾向评分匹配(PSM)后持续存在 7 天(HR = 0.418,95% CI:0.317-0.552,p < 0.001)和 30 天死亡率(HR = 0.579,95% CI:0.475-0.705,p < 0.001)。亚组分析表明,75 岁以上的患者、慢性肺部疾病患者或收缩压较低的患者可能无法从右美托咪定中获益。使用来自 eICU 2.0 数据库的 1411 名 CS 患者的外部验证证实了这些发现,PSM 调整后的分析显示,右美托咪定治疗患者的院内死亡率(HR = 0.597;95% CI:0.395-0.901;p = 0.014)和 ICU 死亡率(HR = 0.425;95% CI:0.262-0.689;p < 0.001)降低。





评论列表