“我想预测患者死亡,当然只收集死亡病例啊!”
——这是许多临床研究者最易陷入的误区。有文章指出,超过60%的临床预测模型存在严重的样本选择偏倚,导致模型在真实世界中完全失效。本文将用一个简单的例子,说清为什么“只收集病例”是研究之路的起点陷阱。
核心问题:为什么不能只收集“阳性”患者?
1️⃣ 无法计算真实风险
研究背景:预测COVID-19患者死亡风险。
错误做法:收集100例死亡患者,发现80%都有高龄特征。
问题:你不知道在总人群(也就是该中心所有患有COVID-19患者)中,高龄者的死亡比例是多少。如果健康对照组中高龄比例也很高,结论就被推翻了。
正确逻辑:风险=(发病/死亡人数)/总暴露人数(该中心所有患有COVID-19)。缺少分母,无法计算。
2️⃣ 无法区分“预测因子”和“普遍特征”
研究背景:探讨中性粒细胞和淋巴细胞比值与脓毒症的关系
问题:只收集脓毒症患者:发现90%的患者NLR都高。但这是否意味着“NLR高”能预测脓毒症?
回答:不一定!如果未患脓毒症的危重患者中也有85%的人NLR高,那么NLR对脓毒症就没有特异性。它可能只是重症的普遍标志,而非脓毒症的特异性预测因子。
3️⃣ 必然导致模型“过拟合”
-
只用死亡患者数据训练的模型,会简单地将所有数据输入都预测为“死亡”。
-
因为模型从未见过“生存”的样本,无法学会区分两类人群的特征差异。
实战举例:NLR与脓毒症关系的研究设计

真实案例
案例一:预测模型
标题:Significant adverse prognostic events in patients with urosepsis: a machine learning based model development and validation study
期刊:Front Cell Infect Microbiol(中科院二区,IF=4.8)



本研究旨在利用机器学习(ML)方法构建并验证一个可解释的尿脓毒症患者预后预测模型。在研究设计和人群方法阐述的时候,可以看到本研究纳入的患者是入住ICU的脓毒症患者,其次在基线信息表中也可以看到纳入的人群既有存活的患者,也有死亡的患者,并不是纳入的所有患者都是发生了死亡的。
案例二:关联性研究
标题:Association between neutrophil percentage-to-albumin ratio and Parkinson's disease amongst adults in the US
期刊:Front Nutr(中科院二区,IF=5.1)



本研究旨在探究中性粒细胞百分比与白蛋白比率与帕金森病之间的关联。在参与者选择流程图中可见本研究是纳入了NHANES数据库中1999-2018年所有的参与者,在基线表中也可见既有患了帕金森疾病的参与者,也有没有患帕金森疾病的参与者,并不是纳入所有患有帕金森病的参与者。
总结
综上所述,在做临床研究的时候需要明确你想要观察的人群以及结局分别是什么,如果说想要观察所有入住ICU患者中性粒细胞和白蛋白比值与死亡风险的关系,那纳入的人群就是所有入住ICU的,结局变量应该是是否死亡。





评论列表