NHANES数据库能不能做预测模型

官方
阅读 81 0 收藏 0 2025-07-11 10:00:00

在医学和公共卫生研究中,预测模型(如疾病风险评估、健康结局预测)是重要的分析工具。美国国家健康与营养调查(NHANES)作为全球最权威、数据最丰富的横断面研究之一,广泛应用于流行病学、公共卫生和临床医学研究。

一方面,NHANES数据庞大、变量全面;另一方面,横断面设计在因果推断和时间序列建模方面存在天然局限。

那么NHANES是否能够用来构建预测模型?让我们一起来看看!

NHANES是什么?

NHANES(National Health and Nutrition Examination Survey)是由美国CDC(疾病控制与预防中心)开展的全国性健康调查,数据包括:

  • 人口统计学(年龄、性别、种族等)

  • 饮食数据(维生素、微量元素摄入量等)

  • 体检数据(血压、BMI、体脂等)

  • 实验室检测(血糖、血脂、激素水平等)

  • 问卷调查(饮食、运动、慢性病史等)

  • 部分纵向数据(部分参与者有随访记录)

NHANES采用复杂抽样设计,数据具有全国代表性,且免费公开。NHANES属于横断面研究(Cross-sectional Study),即在某一特定时间点对人群进行观察或测量,用于描述某种疾病或健康状态的分布及其相关因素。其主要局限在于:

  • 无法确定因果关系;

  • 缺乏时间维度:不能追踪个体随时间的变化;

  • 难以建立事件发生顺序。

因此,传统观点认为,横断面研究不适合用于构建预测模型,尤其是基于时间演变的风险预测模型(如生存分析、事件发生预测等)。

NHANES预测模型案例

尽管NHANES是横断面研究,但近年来确实有不少文章尝试使用它来构建预测模型这些研究并非追求严格的因果推断,而是利用NHANES的丰富数据训练模型,寻找潜在的生物标志物或预测因子,为进一步前瞻性研究提供假设依据。例如,利用机器学习方法识别潜在高危人群;预测某人群当前是否患有疾病等。

标题:Construction and verification of the prediction model for risk of sleep disturbance in elderly patients with hypertension: a cross-sectional survey based on NHANES database from 2005 to 2018

PMID:39427119

主要研究内容:该研究利用NHANES数据库的6,708名老年高血压患者的队列,构建和验证老年高血压患者睡眠障碍的风险预测模型。通过加权多因素logistic回归分析,识别出抑郁评分、教育水平、哮喘、超重、关节炎和工作受限为独立危险因素,并构建了具有良好判别能力和校准度的列线图预测模型。模型在开发组和验证组的AUC分别为0.709和0.707,Brier评分均低于0.25,决策曲线分析也显示其在临床应用中具有净收益。研究表明,该模型可有效辅助医护人员识别睡眠障碍高风险的老年高血压患者,为其早期干预和睡眠管理提供科学依据。

标题:Machine learning and SHAP value interpretation for predicting comorbidity of cardiovascular disease and cancer with dietary antioxidants

PMID:39700695

主要研究内容:该研究基于美国国家健康与营养调查(NHANES)数据,开发并验证了一个结合膳食抗氧化剂的机器学习模型,用于预测心血管疾病(CVD)与癌症合并症。研究选取了包括维生素、矿物质和多酚在内的29种抗氧化相关特征以及9项人口与健康基线特征,研究人员经过数据预处理后,使用多种机器学习算法构建预测模型,并通过基准测试评估性能。结果显示,光梯度提升机(LightGBM)模型表现最优,准确率达87.9%,AUC达0.951,且具有良好的敏感性与特异性。通过SHAP分析发现,柚皮素、镁、茶黄素等抗氧化成分在预测中起关键作用,表明膳食抗氧化剂在CVD与癌症共病风险预测中具有重要价值。

做NHANES预测模型需要注意什么?

▶ 明确模型目的

  • 识别高危人群?

  • 发现潜在预测因子?

  • 验证某个假设模型在人群中的效果?

  • 确保模型解决实际临床/公共卫生问题。

▶ 控制混杂因素

  • NHANES包含大量协变量,但也可能存在未测量的混杂因素;

  • 建模时要合理选择特征,并考虑加权分析以反映全国代表性。

▶ 使用合适的统计/机器学习方法

  • 例如,逻辑回归、随机森林、支持向量机、神经网络等;

  • 采用交叉验证等技术来评估模型性能,避免过拟合;

  • 可考虑SHAP(SHapley Additive exPlanation)值等方法提高模型可解释性。

▶ 结果解读及局限性讨论

  • 横断面数据的因果推断限制;

  • 在解释模型结果时要谨慎对待因果推断,避免将关联误解为因果关系。

NHANES能做预测模型吗?

答案是:可以,但需谨慎。

NHANES作为横断面数据,在构建预测模型方面确实存在局限,但它仍然是一个极其宝贵的资源。只要明确研究目的、合理选择建模方法、尊重数据结构,完全可以在一定程度上构建出有参考价值的预测模型。


评论列表

发表评论