一区SCI都在做的SHAP分析是什么?哪些数据库可以做SHAP分析?

官方
阅读 26 0 收藏 0 2025-12-18 10:01:00

SHAP分析是什么?

SHAP analysis——SHAP 是一种“让机器学习模型变得可解释”的方法。它能回答一个核心问题:在模型预测某个结局时,每一个变量“贡献了多少”?是促进还是抑制?

不像传统回归只给你一个 β 值,SHAP 可以做到:

① 单个样本层面

② 整体人群层面

③ 非线性模型

④ 高维变量

这正是很多研究者发一区 SCI 的时候爱用它的原因。

为什么一区SCI这么爱SHAP?

1️⃣ 解决了“机器学习=黑箱”的致命问题

传统机器学习模型:Random Forest、XGBoost、LightGBM、SVM等预测强,但不可解释;而 SCI 审稿人最爱问的一句话是:What is the clinical / biological meaning?SHAP 正好补上。

2️⃣ 比“变量重要性排序”高级得多

如果模型算法本身有创新:

  • 传统 Variable Importance:只告诉“谁重要”,不告诉“怎么影响”,更不告诉“在什么水平下影响最大”。

  • 而 SHAP 可以做到:正负方向(↑风险 or ↓风险)、全局解释、个体化解释。

3️⃣ 对读者非常友好

SHAP 图一看就懂,不容易被挑“解释不足”,常包含以下四种图形:

① SHAP summary plot

② SHAP dependence plot

③ SHAP force plot(或 waterfall plot)

④ 模型中变量的SHAP值排序

哪些数据库适合做SHAP分析?

只要数据可以做机器学习,就可以做 SHAP。

那么哪些数据库可以做机器学习?我们在之前也有给大家做一个汇总,可以点击查看图片

哪些数据库可以做机器学习?

接下来,让我们一起看看利用公共数据库做 SHAP 分析的SCI文章。

案例文章一:NHANES 数据库

研究内容和结果:基于 NHANES 2003–2004 数据,该研究综合运用多种混合暴露统计方法与机器学习模型,系统评估了溴化阻燃剂(BFRs)暴露与高尿酸血症风险的关系,并引入 SHAP 分析增强模型可解释性。结果一致表明,BFRs 混合暴露与高尿酸血症风险升高显著相关,其中 BDE-28、BDE-47 和 BDE-99 在不同模型及 SHAP 解释中均被识别为主要驱动成分。SHAP 直观揭示了各单体 BFR 对个体高尿酸血症风险的方向性和相对贡献,验证了传统混合暴露模型的稳健性。此外,中介分析进一步表明,总胆固醇介导了关键 BFR 单体与高尿酸血症之间的部分关联,提示脂质代谢紊乱是这一环境暴露—代谢性疾病关系的重要生物学通路。

案例文章二:UKB 数据库

研究内容和结果:该研究基于 UK Biobank 大规模前瞻性队列,结合血浆蛋白组学与可解释机器学习,构建了前列腺癌的早期风险预测模型。结果显示,TSPAN1 和 GP2 在 Cox 回归与 LightGBM 分析中均稳定排名前列,并在 SHAP 解释中表现出对模型预测的主导性贡献,清晰揭示了其在个体风险评估中的关键作用。验证集中,整合 TSPAN1、GP2 及人口学特征的模型在总体及 5 年前列腺癌风险预测中均取得良好判别性能。纵向分析进一步表明,这两种蛋白在临床诊断前数年即出现持续升高,提示其作为长期预测生物标志物的潜力。整体而言,基于蛋白组学并辅以 SHAP 可解释性的简化模型,为前列腺癌的个体化风险分层和更早期、低侵袭性的筛查策略提供了有力依据。

案例文章三:MIMIC 数据库

研究内容和结果:该研究基于 MIMIC-IV 数据库,系统评估了应激性高血糖比值(SHR)在重症房颤患者器官功能障碍与死亡风险关联中的调节作用。结果显示,SHR 与 SOFA 的联合分层能够显著区分不同预后风险人群,其中高 SHR-高 SOFA 组在院内、30 天及 1 年死亡风险最高。通过 RCS 分析揭示了 SHR 与死亡风险之间存在显著非线性关系,并在不同 SOFA 水平下呈现差异化模式。基于多变量回归构建的列线图在风险预测中表现稳定。尤为重要的是,SHAP 可解释性分析直观量化了各预测因子对模型输出的贡献,明确表明 SHR 和 SOFA 是驱动死亡风险预测的核心变量,其次为年龄等临床指标;中介分析进一步提示血清碳酸氢盐在 SHR 与早期死亡之间发挥部分中介作用。整体而言,将 SHR 纳入器官功能评估并结合 SHAP 解释,可显著提升重症房颤患者死亡风险分层的精准性和临床可解释性。

案例文章四:SEER 数据库

研究内容和结果:该研究基于 SEER 大样本数据,结合多种机器学习方法构建了胆囊癌远处转移风险的预测模型。结果显示,XGB 模型在多模型比较中表现最优,具有较高的区分度和预测准确性。通过引入 SHAP 可解释性分析,研究直观量化了各变量对远处转移风险预测的相对贡献和作用方向,明确揭示了 T 分期、N 分期、肿瘤分级和年龄在模型中的核心驱动作用,同时也验证了社会经济相关因素(如城乡属性、婚姻状况和家庭收入)在风险分层中的保护性影响。基于该最优模型进一步开发的在线风险计算器,为胆囊癌患者提供了个体化、可解释的远处转移风险评估工具,有助于临床早期决策和精准治疗策略的制定。

案例文章五:CHARLS 数据库

研究内容和结果:该研究基于 CHARLS 前瞻性队列,针对早期 CKM 综合征人群构建并验证了可解释的机器学习预测框架,用于评估 10 年内发生认知障碍的风险。结果显示,在多模型比较中,XGBoost 在区分度、校准度及临床净获益方面表现最佳。通过 SHAP 分析对模型进行深入解释,研究直观揭示了各预测因子对个体认知结局的相对贡献和作用方向,其中受教育程度、总胆固醇和年龄是驱动认知障碍发生风险的核心因素。该研究强调了将高性能机器学习模型与 SHAP 可解释性相结合的优势,为早期 CKM 综合征人群的认知风险分层和精准干预提供了具有现实可操作性的工具。

结语

SHAP 不是为了“炫技”,而是为了让机器学习“能被审稿人看懂”。SHAP 并不是要取代回归分析,而是为机器学习模型提供一种“可被理解、可被审稿人接受”的解释语言。它使研究者不仅能回答“模型预测是否准确”,还能进一步解释“为什么准确”“哪些因素在什么水平下起关键作用”,从而显著提升研究的学术深度与应用价值。


评论列表

发表评论