你以为机器学习只能做预测模型?Too young!今天带你解锁临床研究中机器学习的高阶玩法。
思路一:无监督聚类
无监督学习是什么?
无监督学习就像是让机器自己去“探索世界”,而不需要我们提前告诉它“正确答案”是什么。我们给机器一堆数据,但不告诉它这些数据的标签或者结果,让机器自己去发现数据中的规律和结构。
举个通俗的例子:假设你有一堆照片,里面有各种各样的动物,但你没有告诉机器每张照片是什么动物,机器通过无监督学习,可以自己把猫的照片放一堆,狗的照片放一堆。
聚类是什么?
把相似的东西放在一起聚类分析是无监督学习中最常用的方法之一。它的目标是把数据分成若干个“簇”,让同一个簇里的数据尽可能相似,而不同簇之间的数据尽可能不同。就好比把一群不同颜色、形状的球分组,把红色的球放一堆,蓝色的球放一堆,这样就形成了不同的“簇”。
适用场景
疾病亚型分类:在癌症研究中,聚类分析可以帮助我们发现不同癌症亚型。比如,通过对肿瘤患者的基因表达数据进行聚类,可以发现不同的基因表达模式,从而识别出不同的癌症亚型。这对于精准治疗和预后评估至关重要。
患者分层管理:在慢性病管理中,聚类分析可以根据患者的病情严重程度、生活方式等因素,将患者分为不同的风险层次,从而制定个性化的治疗和管理方案。
降维多个暴露物:当暴露变量为环境污染物时,通常有多个化合物,聚类分析可以根据化合物的含量将暴露物聚类为高暴露组、中等暴露组以及低暴露组。
案例文章
案例一:

标题:基于无监督学习方法的肝硬化危重患者临床亚型与预后的关系预测:来自两个危重监护数据库的研究
发表期刊:Int J Med Inform(IF=3.7/2区)
总结:该研究采用了“肘方法”、“累积分布函数(CDF)图”和“一致性矩阵”。共识 k-means,k-means 和 SOM 方法用于识别重症肝硬化的不同临床亚型。使用 eICU 数据库中的患者验证了我们的发现。在 MIMIC-IV 数据库中的患者中确定了三种临床亚型。亚型 A(N = 1424,55.07%)被标记为“常见亚型”,并表现出最低的死亡率。亚型 B(N = 703,27.18%)被归类为“高炎症反应亚型”,具有相对高的死亡率。C 亚型(N = 459,17.75%)被确定为“肝功能障碍亚型”,死亡率最高。这些结果与从内部验证集(MIMIC-IV 数据库)和外部验证集(eICU 数据库)获得的结果一致。
案例二:

标题:机器学习衍生的血培养分类在重症监护病房中具有预测和预后价值:一项回顾性队列研究
发表期刊:Intensive Crit Care Nurs(IF=4.9/2区)
总结:该研究基于重症监护医学信息市场(MIMIC)-IV 数据库中血培养患者的临床特征,开发了一种无监督聚类模型。使用 MIMIC-III 数据库中的数据进行了测试。使用基于机器学习的 k 均值聚类识别出 4 个聚类。聚类γ与最高的 28 天死亡率相关,其次是聚类α,δ和β。聚类γ的真菌分离率高于聚类β(P<0.05)。聚类δ与革兰阴性菌和真菌的分离率较高相关(P<0.05)。组γ和组δ患者的股静脉置管次数多于组β患者(均 P % 3 C 0. 001)。抗生素治疗持续时间分别为 4、6 和 7 天的α、δ和γ群患者的 28 天死亡率最低。
案例三:

标题:膳食叶酸和合成叶酸共同暴露模式与抑郁症状升高:NHANES 2005-2018 的发现
发表期刊:J Affect Disord(IF=4.9/2区)
总结:该研究采用无监督 K 均值聚类法针对叶酸水平聚类。基于叶酸摄入量,产生了四种共暴露模式,如下:“叶酸缺乏组”属于第 1 类,“膳食叶酸充足组”属于第 2 类,“叶酸补充组”属于第 3 类,“混合来源叶酸组”属于第 4 类。与第 1 组相比,第 2 组的参与者抑郁症状升高的风险较低(OR = 0.78[0.68,0.89]),而第 3 组和第 4 组的参与者则没有。研究结果表明,膳食叶酸摄入量较高,尤其是天然叶酸,与抑郁症状升高的风险较低相关。
思路二:特征重要性排序
特征重要性排序是什么?
不管是预测模型还是关联性研究中,我们通常会纳入很多特征(也就是数据中的变量)进行筛选或者作为混杂因素。特征重要性排序就是通过一些方法,来判断这些特征中哪些是最重要的,哪些是不太重要的。如果是预测模型就可以知道纳入的这些特征变量中,哪个对结局影响是最大,哪些是次要的,如果是关联性研究中就可以知道暴露变量对结局变量的影响程度有多大。
适用场景
疾病风险因素分析:在心血管疾病研究中,通过特征重要性排序,可以有助于医生在临床实践中重点关注这些关键因素,从而更有效地进行疾病预防和干预。
药物疗效评估:在药物临床试验中,特征重要性排序可以帮助我们发现哪些患者的特征与药物疗效密切相关。通过特征重要性排序,可以筛选出这些关键特征,为精准用药提供依据。
案例文章
案例一:

标题:潜在的不适当的多药治疗是老年人30天紧急住院的重要预测因素:一项机器学习功能验证研究
发表期刊:Age Ageing(IF=6/2区)
总结:该研究数据来自英国生物银行数据库。随机森林(RF)、XGBoost (XGB)和Logistic回归(LR)这三个ML模型利用了所有提取的变量,包括人口统计学和老年综合征、合并症和药物负担指数(DBI), DBI是一种衡量潜在不适当的多种用药的指标,量化了抗胆碱能和镇静药物的暴露程度。DBI、活动性、骨折、福尔斯、危险饮酒和吸烟被验证为预测 30 天急诊住院的重要变量。
案例二:

标题:早期心血管-肾-代谢综合征患者血红蛋白糖化指数与心血管疾病风险的相关性:来自中国健康与退休纵向研究的证据
发表期刊:Front Endocrinol (Lausanne)(IF=3.9/3区)
总结:从中国健康与退休纵向研究(CHARLS)数据库中招募患有早期 CKM 综合征(0-3 期)的参与者。采用 k-means 聚类分析,参与者分别根据基线和 3 年后测量的 HGI 值进行分类。采用极值梯度提升(XGBoost)算法,并采用 Shapley 加性解释(SHAP)方法确定特征重要性。SHAP 图显示,HGI 是比传统风险因素(如 FBG)更重要的特征,可用于预测 CVD。
机器学习还能做什么?
除了上面提到的聚类分析和特征重要性排序,机器学习还有很多其他的应用场景,比如:
关联规则
挖掘关联规则挖掘是用来发现数据中不同特征之间的关联关系。比如,在临床中,可以发现某些症状和检查结果之间是否存在关联,从而帮助医生更好地理解疾病的发展过程。
异常检测
异常检测是用来发现数据中的异常点。在临床中,可以用来检测患者的异常生理指标,及时发现潜在的疾病风险。比如,通过监测患者的心率、血压等指标,及时发现异常波动,从而提前预警。
图像识别
在医学影像领域,机器学习可以帮助医生更准确地识别病变,提高诊断的准确性。比如,通过深度学习算法,可以自动识别CT影像中的肿瘤,帮助医生更早地发现疾病。





评论列表