一区SCI都在做的轨迹分析是什么?轨迹分析怎么做?有什么用

伊布
阅读 105 0 收藏 0 2026-01-10 10:00:00

今天我们来介绍一下 MIMIC 数据库中的一种高级分析方法——轨迹分析。

什么是轨迹分析?

核心思想:轨迹分析不是看患者在某个“时间点”的状态,而是看他们在整个时间轴上的“路径”或“过程”。它旨在识别和描述个体随时间的测量值(如生命体征、化验指标、药物剂量等)所遵循的、具有相似形态的模式。

简单比喻:想象一下,你不是给一群跑马拉松的选手拍一张照片(横断面研究),而是用无人机跟踪他们整个比赛过程。你会发现有些人起步快后劲不足,有些人匀速前进,还有些人先慢后快。这些不同的跑步“模式”就是轨迹。

为什么要在MIMIC数据库中使用轨迹分析?

MIMIC 数据库的以下特点使其成为轨迹分析的理想平台:

  • 高频率、纵向数据:ICU 患者拥有按小时甚至分钟记录的丰富数据,如生命体征、实验室结果、输液量、药物使用等。

  • 异质性患者群体:即使诊断相同,不同患者的疾病严重程度、恢复速度和临床过程也可能千差万别。轨迹分析能帮助发现这些隐藏在数据中的亚组。

  • 临床决策支持:通过识别与不良结局(如高死亡率、长住院日)相关的特定轨迹,可以早期预警高风险患者,实现精准干预。

常用的轨迹分析方法

以下是几种在 MIMIC 研究中常用的轨迹建模技术:

1️⃣ 群体轨迹模型

这是最流行和直观的方法之一。

原理:它假设研究人群中存在若干个潜在的、未观察到的亚组(即“轨迹群组”)。模型的任务是:

  • 识别出这些群组的数量

  • 描述每个群组随时间变化的轨迹形态(如线性、二次型、立方型)

  • 估计每个患者属于各个轨迹群组的概率

在 MIMIC 中的应用实例:

  • 血压轨迹:识别患者入住 ICU 后 72 小时内的平均动脉压轨迹。你可能会发现:A 组(稳定组)、B 组(持续低血压组)、C 组(先降后升组)。然后可以分析 C 组患者发生急性肾损伤的风险是否显著更高。

  • 血糖轨迹:分析糖尿病患者在 ICU 期间的血糖波动模式,找出难以控制的血糖轨迹与感染并发症的关联。

  • 通气参数轨迹:研究机械通气患者的呼吸机设置(如 PEEP、FiO2)的变化轨迹,预测成功脱机的可能性。

2️⃣ 潜类别增长分析

与 GBTM 在理念上非常相似,常被交替使用。它在结构方程模型的框架下进行,可以同时纳入预测变量(如入院时的年龄、性别)和结局变量(如死亡率)。

3️⃣ 时间序列聚类

这是一种更加数据驱动、非参数的方法。

原理:首先定义一种衡量两条时间序列“相似性”的距离指标(如动态时间规整),然后使用聚类算法(如 K-means、层次聚类)将相似的时间序列归为一类。

与 GBTM 的区别:GBTM 预设了轨迹的形状(多项式),而时间序列聚类更灵活,能捕捉更复杂、非多项式的模式。

4️⃣ 联合模型

这是更高级的方法,用于解决一个关键问题:如何将纵向变化的轨迹与生存结局(如死亡)联系起来?

原理:它同时拟合两个子模型

  • 纵向子模型:描述生物标志物(如血清肌酐)随时间的轨迹。

  • 生存子模型:描述该生物标志物的轨迹如何影响患者的死亡风险。

优势:传统方法是把纵向数据汇总成一个静态值(如平均值、最大值)再放入生存模型,这会丢失大量信息。联合模型利用了全部纵向信息,能更精确地评估动态风险。

为什么轨迹分析可以发高分?

“动态轨迹”(Dynamic Trajectories)分析之所以容易发表高分文章,是因为它代表了医学大数据研究从“静态快照”向“动态演变”的思维升级

简单来说,传统的临床研究往往只看“入院第一天”的数据,而动态轨迹分析看的是“数据是如何随时间变化”的,挖掘了数据的时间维度价值,解决了临床异质性问题,并指向了精准医疗。

文献示例

文献 1:

标题:Association between triglyceride-glucose index trajectories and in-hospital mortality in sepsis: a cohort study based on the MIMIC-IV database

轨迹分析部分:研究利用 ICU 入院后 24、48 和 72 小时的三个时间点的 TyG 指数数据,构建了带有来自 R 包 lcmm 的 hlme 函数的潜级混合模型(LCMM)。在模型中,时间点被视为自变量,以适应 TyG 指数的动态轨迹。LCMM 假设整体样本包含多个潜在类别,每个类别都有其独特的平均轨迹,并用不同的增长曲线参数对每个类别进行建模。详细的分析过程如下:首先构建了具有 1 到 7 个潜在类的 LCMM,并为每个指定类别号进行模型拟合和参数估计。固定效应包括线性和二次时间项,以捕捉 TyG 轨迹中潜在的非线性趋势。加入了随机效应,使个体在每个类别内偏离平均轨迹,从而反映个体间的异质性。模型选择采用以下标准以获得理想类别数量:[1] 值越低表示模型对贝叶斯信息准则(BIC)和赤池信息准则(AIC)等信息准则的拟合度越好;[2] 对数似然和相对熵,较高的对数似然和熵值接近 1(≥ 0.7)表示模型拟合度优越且类别分离清晰;[3] 最小班级规模,要求每个班至少占总样本的 3%,以避免因极小班级而产生的不稳定性和解释困难;以及[4] 类分配的平均后验概率(AvePP)应至少达到 70%,以确保轨迹分类的可靠性。基于这些综合标准,选择了最佳的潜在类别数量,并确定了不同的 TyG 指数动态轨迹亚型,用于后续的风险分层和结局分析。

在最优五类模型下,每个轨迹群的 TyG 指数动态变化如图所示。这五条轨迹表现出明显的异质性模式:

第一类:基线中等偏高,早期下降,随后逐渐上升(“下降后增加”模式)

第二类持续低水平,波动极小(“持续低”模式)

第三类:整体稳定在中等水平(“稳定中等”模式)

第四类:基线偏高,变化不大(“持续偏高”模式)

第五类:基线较低,随后升至中高后略有下降(“增加后下降”模式)

以“持续低”组为参考,完全调整模型显示,“增加后下降”组(OR = 2.61,95% CI:1.64–4.16)、“下降后增加”组(OR = 1.46,95% CI:1.01–2.13)和“稳定中度”组(OR = 1.23,95% CI:1.01–1.50)组住院死亡风险显著更高。亚组分析显示,这些关联在大多数临床层面中都表现稳健。

文献 2:

标题:Association between serum anion gap trajectory and mortality in hospitalized patients with sepsis: an analysis of the MIMIC-IV database

轨迹分析:

在 ICU 入院前五天提取 AG,以记录 AG 随时间的动态变化。采用潜能组混合模型(LCMM)确定研究人群的 AG 年龄轨迹。该方法可基于患者的纵向 AG 测量识别异质亚组。对具有 1 至 5 个轨迹类别的模型进行了评估,并利用赤池信息准则(AIC)、贝叶斯信息准则(BIC)、样本调整 BIC(SABIC)的最低值和最大熵值确定了最佳类别数。

评估了多种统计指标,如对数似然、AIC、BIC、SABIC 和熵,以确定最佳的 AG 轨迹类别数量,范围为 1 至 5。由于 AIC 最低(149,412.5)、BIC(149,479.7)和 SABIC(149,448.0)值,熵为 0.8,且每个类别包含超过 5% 的参与者,因此选择了三类模型作为最优解。这三类的特征如下:第一类(正常水平稳定轨迹)、第二类(高水平下降轨迹)和第三类(进行性酸中毒轨迹)。平均后验概率较为稳健,第一类为 0.9474,第二类为 0.8732,第三类为 0.8129。在完全调整模型中,3 类患者表现出显著增加的 ICU 死亡率风险[HR=1.72,(95% CI 1.43-2.07),P<0.001]和住院死亡率[HR=1.64,(95% CI 1.39-1.94),P<0.001]。

文献 3:

标题:The association between fluid balance trajectories and prognosis in ICU patients with cardiac arrest, a group-based trajectory model analysis

轨迹分析:提取了 CA 患者 ICU 入院后前 1 至 7 天的 FB 数据和预后指标,FB 的计算公式为 FB = (总输液量 - 总输液量)/初始体重(kg)。液体过载(FO)定义为累计 FB 超过初始体重的 10%,基于群体的轨迹建模(GBTM)是一种半参数模型,用于纵向数据分析,能够识别同一队列内的 FB 轨迹模式(17)。研究采用 GBTM 方法,利用三次多项式拟合 FB 轨迹,最佳组数由模型参数确定。选定组数后,评估线性、二次和三次多项式的显著性,以优化轨迹形状。选择最佳轨迹的标准包括:(1)贝叶斯信息准则(BIC)和赤池信息准则(AIC),接近 0 的值表示拟合度更好;(2)平均后验概率(Avepp),>0.7,表明亚组分类可靠;(3)每个病程组患者比例 >5%;(4)OCC(正确分类率),最低 OCC 值应大于 5.0,值越高表示分类越好;(5)对模型简易性和临床可解释性的全面评估。

在对 FB 轨迹进行分组之前,最初从第一天到第七天考察了 FB。然而,由于数据缺失比例较高,第 4 天到第 7 天的缺失率分别为 5.4%、21.9%、33.9% 和 43.9%。由于第 5 至 7 天数据严重缺失,分析限制在第 1 至 4 天的 FB 上。展示了用于确定 FB 轨迹组最优数量的模型拟合统计量和平均后验概率(AvePP)。4 组和 5 组模型的 AIC 和 BIC 相似,所有模型中数值最小。此外,每组人口比例均超过 5%,且 AvePP 和最低 OCC(正确分类率)均达到所需门槛。在考虑模型的整体可解释性和简洁性后,我们选择了四组轨迹模型。识别出四种不同的 FB 轨迹模式,轨迹 1(快速转为负平衡)、轨迹 2(稳定平衡)、轨迹 3(正平衡逐渐下降)和轨迹 4(高水平下降)。Kaplan–Meier 生存分析显示,轨迹 1 组的存活率显著高于其他轨迹组,其中液体过载组的死亡率明显高于非超载组。Cox 比例风险分析显示,调整了各种协变量后,轨迹 1 的生存率显著高于其他轨迹组。

注意事项

因果推断:轨迹分析主要揭示关联,而非因果。某个轨迹与不良结局相关,不代表它就是原因。

模型选择的主观性:确定“最佳”群组数量有时依赖于研究者的判断。

数据质量:MIMIC数据的缺失机制可能是非随机的,需要谨慎处理。

总结

轨迹分析是将MIMIC数据库的时序数据潜力最大化的利器。它超越了静态的快照视图,允许我们以动态的、模式化的视角理解疾病的自然史和患者的异质性。通过识别具有临床意义的不同轨迹表型,我们能够朝着更精细化、预测性和个性化的重症监护医学迈进。

如果你有具体的临床问题或想针对某个指标(比如心率、氧合指数)进行轨迹分析,可以联系我们继续深入讨论!


评论列表

发表评论