公共数据库发SCI如何冲击高分?环境污染与健康值得一试

官方
阅读 25 0 收藏 0 2025-09-25 10:00:00

公共数据库能应用于环境污染与健康吗?

“当然可以”

今天带大家了环境污染与健康+公共数据库如何发表 SCI。

环境污染与健康能挖掘的数据库

 NHANES 数据库 

NHANES 是一项系统性的全国性健康调查项目;多阶段、多层次的抽样调查,由美国疾控中心定期开展,并通过问卷调查、体格检查和实验室检测相结合,收集具有全国代表性人群健康与营养状况数据的大型数据库。往期我们也对 NHANES 数据库做过详细拆解,感兴趣的朋友可以点击链接进行学习。☞NHANES数据库及适用科室详解

 中国健康与农村发展追踪调查项目(CHARLS

CHARLS 旨在收集一组代表中国 45 岁及以上家庭和个人的高质量微观数据,以分析中国人口老龄化问题并促进老龄问题的跨学科研究。CHARLS 全国基线调查于 2011 年开展,采用多阶段概率与规模成比例 (PPS) 抽样方法。样本覆盖 28 个省、150 个县的 450 个村,涉及约 10 000 个家庭的 17 000 多人。CHARLS 是一项持续性调查,每 2 至 3 年进行一次。通过计算机辅助个人访谈 (CAPI) 技术,对参与者进行家中面对面访谈。调查内容包括受访者及其家庭的基本人口学信息、家庭成员之间的转移支付、受访者的健康状况、医疗和保险、就业、收入、支出和资产等。往期我们也对 CHARLS 数据库做过详细拆解,感兴趣的朋友可以点击链接进行学习。☞CHARLS数据库及适用科室详解

 英国生物银行数据集(UKB)

UKB 是一个庞大的生物医学数据库,包含超过 50 万名年龄在 37 至 73 岁之间的个体信息,覆盖英格兰、苏格兰和威尔士的人口。社会人口统计学、生活方式和健康状况数据通过触摸屏调查、访谈以及体格和生物学评估收集。健康结果通过连接到外部数据库(例如医院入院记录和国家死亡记录)进行监测。往期我们也对 UKB 数据库做过详细拆解,感兴趣的朋友可以点击链接进行学习。☞UKB数据库及适用科室详解

NHANES、CHARLS 及 UKB 数据库为什么能做环境污染与健康呢?三个数据库中有什么不同呢?

NHANES数据库:

NHANES 数据库中本身便有部分环境污染的数据,如在实验室数据中有每个参与者的芳香族化合物的暴露量、农药的暴露量、可替宁的暴露量、多环芳烃的暴露量及甲醛的暴露量等,我们可以通过提取每个参与者这些环境污染的暴露量进行分析;

NHANES 数据库针对不同的参与者进行多年的环境污染暴露量的评估,可以在长周期的横断面中分析环境污染与健康结果的关联。

CHARLS数据库:

虽然 CHARLS 数据库没有直接测量每一位受访者的污染物暴露情况,但根据数据库中的 psu 编码文件,我们可以将每一项污染物位点与他们的编码进行唯一匹配,从而获得受访者的环境污染暴露情况;

CHARLS数据库作为一项随访的队列数据,可以对同一组人群进行追踪的随访研究,从而观察到污染暴露的累积效应及健康变化的时间趋势。

UKB数据库:

UKB 数据库与 CHARLS 数据库一样,在数据内部没有测量每一位参与者的污染物暴露量,但其不仅可以通过链接外部数据集的方式得到每个参与者的暴露量,也可以通过一些模型来预测研究地区的污染物水平(如土地利用回归模型);

UKB 数据库和 CHARLS 数据库都是主要为进行前瞻性研究的数据库,可以观察到环境暴露对健康影响的长期效应。

NHANES、CHARLS、UKB 数据库的不同之处:

  • 污染物数据来源:NHANES 数据库来源于自身收集的多周期数据;CHARLS 数据库来源于外部污染物数据集,如 MODIS 数据集、SHAP 数据集、全球地面 PM2.5 数据集及 ERA5 数据集等;UKB 数据库来源于外部污染物数据集,如政府环境监测站数据、土地利用回归模型预测数据等;

  • 研究类型:NHANES 数据库是多周期的横断面研究;CHARLS 和 UKB 数据库是多年份随访的队列研究;

  • 针对人群不同:NHANES 数据库针对全部成年人群均可以进行;CHARLS 和 UKB 数据库主要针对中老年人群。

接下来我们利用通过各自的几篇高分例文来分析这类文章的思路:

 NHANES数据库:

案例一:

标题:Associations between urinary phthalate metabolite concentrations and markers of liver injury in the US adult population(中科院一区,IF=9.7)

主要研究内容与结果:使用 NHANES 2007-2016 年共 5 个周期的数据,进行了横断面研究研究,包括 6046 名参与者。采用线性回归来调查不同的邻苯二甲酸酯代谢物和肝功能指标(包括ALT、AST、GGT、TBIL和ALP)之间的关联,并采用贝叶斯核机回归(BKMR)来评估多种邻苯二甲酸酯代谢物对肝功能指标的联合效应以及混合物组分之间潜在的协同效应。结果显示,(1)ALT 与 AST:尿液总邻苯二甲酸二酯的对数转换浓度每增加 1 个单位,ALT 的对数转换浓度就会增加 0.02 个单位( P FDR = 0.003)。邻苯二甲酸单正丁酯和 AST 之间也存在正相关(β = 0.02; P FDR = 0.035),且当所有邻苯二甲酸酯代谢物浓度分别等于或高于其中位数的第 55 和第 60 百分位数时,ALT 和 AST 显著升高;(2)GGT:总邻苯二甲酸二酯和邻苯二甲酸单正丁酯与 GGT(均为 β = 0.03)以及总邻苯二甲酸二酯 与 ALP(β = 0.02)呈显著正相关( P FDR < 0.05),且当邻苯二甲酸酯代谢物的浓度均高于 55 百分位数时,与 50 百分位数相比,邻苯二甲酸酯对 ALP 水平具有显著的正向总体影响;(3)TBIL:总邻苯二甲酸二酯(β = 0.4; P FDR = 0.002)、邻苯二甲酸单乙酯(β = 0.3; P FDR = 0.002)和邻苯二甲酸单酯(β = 0.3; P FDR = 0.003)与 TBIL 呈显著正相关,且当所有邻苯二甲酸酯代谢物均高于其第 55 百分位数(与中位数相比)时,混合物的总体效应与 TBIL 升高相关;(4)ALB与TB:总邻苯二甲酸二酯(β = -0.2; P FDR = 0.002)、邻苯二甲酸单正丁酯(β = -0.3; P FDR = 0.002)、邻苯二甲酸单酯(β = -0.2; P FDR = 0.002)和邻苯二甲酸单苄酯(β = -0.2; P FDR = 0.015)与 ALB 呈显著负相关,且当邻苯二甲酸酯代谢物浓度均高于其中位数的 55 百分位数时,其对 ALB 的整体影响显著为负;(5)AST/ALT:总邻苯二甲酸二酯与 AST/ALT 之间存在显著关联 (β = -0.004; P FDR = 0.035)。

案例二:

标题:Association between exposure to per- and polyfluoroalkyl substances (PFAS) and chronic cough in American adults: Results from NHANES 2003–2012(中科院二区,IF=6.1)

主要研究内容与结果:研究纳入了 2003-2012 年间共5个周期的 4,882 名参与者。通过构建逻辑回归模型探索个体血清永久性氟化物(PFAS)与慢性咳嗽之间的关联,并采用 WQS 回归和 qgcomp 模型全面研究血清中六种 PFAS 对慢性咳嗽风险的总体影响。结果显示,PFBS 和 PFHP 与慢性咳嗽之间呈现明显正相关,而 PFOS 与 PFNA 与慢性咳嗽之间呈现负相关,而其他 PFAS 与慢性咳嗽之间不存在显著性关联。3 个 qgcomp 模型的结果一致表明,血液中PFAS代谢物的联合暴露与慢性咳嗽风险的增加显著相关(OR:1.186,95%CI:1.021-1.377),其中 PFBS 是最强的正向驱动因素,其次是 PFHP。在 WQS 回归的粗略模型中,同时暴露于血液中的 PFAS 代谢物与慢性咳嗽风险之间存在显著的正相关关系(OR:1.374,95%CI:1.022-1.845)。在调整一系列混杂因素后,这种正相关仍然存在,尽管它没有达到统计学意义(OR:1.181,95%CI:0.647-2.157)。在混合 PFAS 代谢物的分析中,PFHP 和 PFBS 显示出最高的权重,突显了它们对整体混合效应的显著贡献。

 CHARLS数据库:

案例一:

标题:Fine particulate matter components associated with exacerbated depressive symptoms among middle-aged and older adults in China(中科院二区,IF=8.0)

主要研究内容和结果:分析了 2011-2015 年 CHARLS 的数据,纳入共 22,126 名参与者,其中参与两次及以上随访的共 16,604 名参与者。文章采用的 PM2.5 数据来源于跟踪空气污染(TAP)数据集 -PM2.5 和物种数据集,通过将每日网格化的 PM2.5 组分浓度最初汇总为城市平均值,用于每月平均值的计算。单一污染物混合效应模型表明,总体 PM2.5 和五种 PM2.5 成分中的每一种的暴露与抑郁症状的风险增加呈显著正相关,单污染物模型的测量-响应曲线显示,PM2.5 及其组分暴露与抑郁症状呈单调递增关系。基于 qgcomp 模型,PM2.5 组分混合物与抑郁之间的确定-响应关系呈现一致的线性或超线性形状,没有较低的阈值,且随着五种 PM2.5 成分的共同暴露的每五分位数增加,观察到抑郁风险显著增加,其中硝酸盐(指数权重0.46),硫酸盐(0.33)黑碳(0.21)对抑郁症评分有积极影响,并被确定为有害联合效应的主要贡献者,而铵(-0.59)和有机物(-0.41)表现出负效应。

案例二: 

标题:Air pollution is linked to cognitive decline independent of hypersensitive C-reactive protein: insights from middle-aged and older Chinese(中科院二区,IF=5.9)

主要研究内容和结果:参与者(N = 6,434名成年人)来自 2011-2015 年的 CHARLS 数据集。空气污染数据来源于中国高浓度空气污染物 (CHAP) 数据集,包括直径≤1 μm 的颗粒物 (PM1 ) 、直径 ≤2.5μm 的颗粒物 (PM2.5) 、直径 ≤10μm 的颗粒物 (PM10) 、二氧化氮  (NO2) 和臭氧 (O3) 。逻辑回归结果显示,调整所有协变量后,较低的 PM2.5 、PM1 、PM10 和 NO2 暴露与减轻认知能力下降显着相关,而 hs-CRP 与认知能力下降之间的任何统计学意义,并且空气污染暴露变化与 hs-CRP 之间的统计学相关性。交互作用分析显示, hs-CRP 与 PM2.5 变化量、PM1 变化量 、PM10 变化量和 O3 变化量不存在显著的交互作用,仅与 NO2 在认知能力下降方面存在轻微的交互关联(OR:1.002,(95% CI:1.000,1.004)。然而,在调整协变量后,这种关联被抵消了( P = 0.055)。中介分析显示,hs-CRP 在空气污染与认知能力下降的关系中未观察到显著的中介作用,hs-CRP 与任一空气污染物的间接效应均不显著。

 UKB数据库:

案例一:

标题:Association of ambient air pollution exposure with low birth weight(中科院二区,IF=7.7)

主要研究内容和结果:参与者(N = 502,507名成年人)来自 UKB 数据集。空气污染数据通过欧洲空气污染影响队列研究(ESCAPE)项目开发的土地利用回归(LUR)模型计算。逻辑回归结果显示,PM2.5 、PM2.5-10 、PM10 、 NO2 和 NOx 暴露与低出生体重之间呈现显著正相关,调整协变量后,PM2.5 和 PM10 与低出生体重率之间仍然呈现显著正相关,而 PM2.5-10、NO2 和 Nox 与低出生体重之间的关联不再显著。多元线性回归显示,校正所有协变量后,PM2.5、PM10 和 Nox 与出生体重间呈现负相关,且 RCS 曲线显著这三种空气污染物与出生体重呈现非线性关联。

案例二:

标题:Fine particulate matter components associated with exacerbated depressive symptoms among middle-aged and older adults in China(中科院二区,IF=8.0)

主要研究内容和结果:分析了 2006-2024 年 UKB 的数据,纳入共 416,032 名参与者。文章采用的污染物数据通过污染物特定的土地利用回归模型计算,使用来自地理信息系统的预测变量并将其与 UKB 基线访问时提供的参与者的居住地址联系起来。在完全校正模型中,除 PM2.5–10 外,所有空气污染暴露均被确定为冠心病、心力衰竭、心律失常和全因心血管疾病死亡的危险因素。调整潜在混杂因素后,暴露于严重空气污染的参与者患冠心病的风险高 7.1%(95% CI,1.022–1.121;P=0.004),患心力衰竭的风险高 31.8%(95% CI,1.218–1.427;P<0.001),患心律失常的风险高 6.7%(95% CI,1.016–1.121;P=0.009),全因心血管疾病死亡的风险高 25.3%(95% CI,1.117–1.406;P<0.001),其中 PM2.5 和 NOX 的风险最高。与低夜间灯光组相比,高夜间灯光组的 PM2.5、PM2.5–10、PM10、NO2 和 NOX 污染水平均升高,且具有显著的统计学差异。

结论

总体而言,如果想要做环境污染物与健康的研究方向,我们可以选择如 NHANES、CHARLS 或 UKB 等大型数据库,这些数据库中虽有的数据不直接提供所有污染暴露情况,但同样可以通过参与者的居住地址信息,结合外部环境监测、卫星遥感或土地利用回归模型等数据集,利用地理信息系统进行空间链接,从而估算每个个体的长期污染暴露水平。

同时,数据库内部收集的健康指标、生物样本和协变量信息为分析污染暴露与多种健康结局的关系提供了坚实基础,实现内、外部数据融合驱动的环境健康研究。

此外,不同数据库在人群特征、地域覆盖、随访设计和数据深度上各有优势,我们可根据具体科学问题灵活选择,通过整合多源数据和发挥各数据库特点,能够更全面、精准地揭示环境因素对人类健康的长期影响。


评论列表

发表评论