为什么GBD的数据不需要清洗?

官方
阅读 9 0 收藏 0 2025-06-30 10:01:00

GBD数据库是什么?

全球疾病负担(Global Burden of Disease, GBD)数据库由美国华盛顿大学健康指标与评估研究所(Institute for Health Metrics and Evaluation, IHME)主导,是目前全球规模最大、最全面的公共卫生研究项目之一,旨在定量评估全球及各地区的疾病、伤害和风险因素所造成的健康损失。

在GBD 2021研究中,为了估算非致命性疾病负担,研究团队系统性地识别并提取了多种数据来源。这些数据包括:调查数据(如人口与健康调查DHS)、疾病登记、医院病例报告、死亡登记数据(如死亡证、口头尸检等)、来自全球健康数据交换平台(GHDx)的数据等。2021年版本中共使用了100,983个数据源(其中19,189个为当年新增),包括:75,459个非致命性数据(用于估算发病率、患病率等);其余数据用于估算死亡率、DALY等指标。

GBD数据库的核心输出包括:

  • 死亡率(Mortality)

  • 发病率(Incidence)

  • 患病率(Prevalence)

  • 伤残调整寿命年(DALYs=YLLs+YLDs)

  • 年龄标准化指标率等衍生指标等

为何GBD数据库“通常不需要清洗”?

GBD数据库并非原始数据集,而是通过复杂模型处理后的估计性统计数据,其在公开发布前已经过IHME的全面预处理。主要原因如下:

▶ 非原始数据:

不同于NHANES、SEER等原始个体水平数据,GBD提供的是基于模型的国家/地区层面的估算结果。因此用户无法也无需进行如缺失值填补、异常值识别等个体数据清洗操作。

▶ 多源数据已被统一标准化处理:

IHME从全球不同来源(调查、登记、医院等)收集原始数据,已完成:

  • 统一疾病编码

  • 校正不同来源间系统误差(如调查设计、采样偏倚)

  • 地区/时间分布校正等标准化处理

▶ 模型处理和不确定性控制:

IHME采用多种建模技术:

  • 采用贝叶斯元回归模型工具DisMod-MR用于估计疾病发生率、患病率、死亡率等;

  • Cause of Death Ensemble model (CODEm)用于估计死亡率;

  • ST-GPR(Spatio-temporal Gaussian Process Regression)用于生成完整回顾性时间序列。

每个输出结果都附有不确定性区间(95% UI),体现模型误差范围。

使用GBD时的注意事项

虽然GBD数据库本身无需传统意义上的“数据清洗”,但在研究设计和数据解读过程中,仍需注意以下方面:

了解指标定义和含义:特别是DALY、YLL、YLD的构成与含义,以及它们在不同人群和疾病上的适用性。

注意单位和标准化方式:是否使用“绝对数(number)”或“年龄标准化率(age-standardized rate)”会直接影响结果解读。

分地区/分性别/分年龄数据使用:GBD结果可按国家、性别、年龄组等维度查询,应注意筛选匹配的研究人群。

了解时间跨度:GBD通常提供1990年以来的年度数据,分析时注意时间点与趋势是否合理。

总的来说,GBD数据库作为高度整合和建模后的公共卫生数据库,为全球健康决策和科研提供了权威的数据支撑。其“无需清洗”的特性降低了使用门槛,但研究者在使用时仍需充分理解其建模逻辑和数据背景,以保障分析结果的科学性和可解释性。


评论列表

发表评论