肿瘤发文选哪个数据库?各数据库研究方向区别对比

官方
阅读 47 0 收藏 0 2025-09-27 10:00:00

“为什么我的数据量很大,却总被审稿人质疑创新性?”“同一个idea,别人能发5分+,我却只能发1分?”。

问题的根源,很可能在于第一步——数据库就选错了!

肿瘤学研究离不开公共数据库,但每个数据库都有其独一无二的“基因”和“脾气”。用SEER做风险因素探索,或用NHANES做长期预后,就像用狙击枪打苍蝇,用苍蝇拍打坦克——工具不对,努力白费!

五大数据库肿瘤研究定位全景

各数据库详细对比与典型研究设计

 1️⃣ SEER:临床预后研究的"金标准" 

优势:

  • 数据质量高,具有权威性

  • 样本量大,覆盖时间长

  • 包含详细的临床病理信息

  • 随访数据完整,适合生存分析

劣势:

  • 缺乏治疗方案的具体细节

  • 缺乏实验室检查指标

  • 缺乏患者的生活质量数据

  • 仅限美国人群,存在地域局限性

适合研究方向:

  • 肿瘤流行病学研究

  • 预后因素分析

  • 治疗模式研究

  • 生存分析

SEER数据库肿瘤研究典型案例一:死亡趋势研究

标题:Causes of Death After Surgery Among Cancer Patients: A Population-based Cohort Study

研究方法:这项回顾性、基于人群的队列研究分析了来自 SEER 数据库的 1992 年至 2021 年间确诊为 21 种实体癌的 3,424,671 例患者(包括 2,371,058 例手术病例)的数据。研究采用竞争风险模型评估指标癌、非指标癌和非癌症原因的累积死亡率,并按癌症类型分层。在短期(30 天)和长期随访期间评估了手术干预措施,主要结局指标关注死亡归因,次要结局指标关注时间优势变化。结果显示,在 14 种恶性肿瘤(例如前列腺癌、乳腺癌、结直肠癌)中,非癌症死亡人数超过了指数癌症死亡人数,占术后死亡人数的 48.7%,其中心血管疾病和感染是主要原因。到 2020 年代,非癌症原因已成为这些癌症的主要死亡驱动因素。然而,指数癌症死亡在胰腺癌、卵巢癌和脑肿瘤中仍然占主导地位,凸显了持续存在的治疗差距。手术切除显著改变了癌症人群的死亡率特征,肺癌的非癌症死亡率增加了 95.7%,胰腺癌的非癌症死亡率增加了 87.3%(P < 0.001),凸显了加强术后合并症管理的迫切需要。虽然大多数实体癌术后 1 个月的死亡率在过去 30 年中有所改善,但脑癌、胆道癌和结直肠癌仍然存在差异。本研究凸显了术后死亡率的范式转变,大多数实体肿瘤的非癌症原因死亡现已超过癌症相关死亡。这些发现强调了将针对心血管健康和感染预防的多学科护理纳入生存计划的紧迫性。

SEER数据库肿瘤研究典型案例二:预测模型研究

标题:Response to Neoadjuvant Systemic Therapy May Serve as an Indicator for Omitting Post-BCS Radiation Therapy in Women with Early-Stage Breast Cancer

研究方法:该研究从 SEER 数据库中收集了 7291 例接受新辅助全身治疗(NST)和保乳手术(BCS)的早期乳腺癌女性患者的临床资料。根据患者对 NST 的反应进行分层,并分别使用 Cox 回归分析和 Fine-gray 竞争风险模型评估接受和未接受 BCS 后放疗患者的长期生存率和复发风险。 结果显示,对于早期乳腺癌女性患者,即使未接受保乳术后放疗,获得 NST 完全缓解(CR)的患者的 OS 和 DFS 与接受保乳术后放疗的患者相同,且未接受放疗并未增加复发风险或 BCSD。对于未接受 NST 完全缓解的患者,我们采用年龄、N 分期、分级、NST 疗效和分子亚型等 5 项临床指标构建了列线图,用于临床预测复发风险。验证结果证实了该模型能够准确区分高危和低危患者,并具有良好的临床应用价值。

2️⃣ NHANES:肿瘤风险与早期诊断的"宝库"

优势:

  • 包含丰富的生物标志物数据

  • 具有全国代表性

  • 数据采集标准化

  • 包含详细的生活方式信息

劣势:

  • 样本量相对较小

  • 缺乏长期随访数据

  • 肿瘤病例数量有限

  • 横断面设计,难以确定因果关系

适合研究方向:

  • 肿瘤风险因素研究

  • 早期生物标志物探索

  • 健康差异研究

  • 预防策略评估

NHANES数据库肿瘤研究典型案例一:癌症幸存者早期风险指标

标题:Predictive value of composite nutritional indicators geriatric nutritional risk index and controlling nutritional status for mortality risk in early-onset cancer survivors

研究方法:该回顾性研究评估了 GNRI 和 CONUT 对 3,273 例早发性(EO)癌症幸存者死亡率的预测作用。GNRI < 98 和 CONUT ≥ 2 独立预测全因死亡风险(HR = 3.36,95%CI = 2.69-4.19,P < 0.001)、癌症特异性死亡风险和非癌症死亡风险的升高。与低风险患者相比,高风险患者的生存结果最差(全因死亡 HR = 3.36,P < 0.001)。Kaplan-Meier 分析证实,在所有死亡终点事件中,GNRI < 98、CONUT ≥ 2 和高风险组的预后均较差。本研究首次验证了 GNRI 和 CONUT 作为识别高危 EO 癌症幸存者的有效综合炎症-免疫-营养指标。结合两项指标的复合分层增强了多维炎症-免疫-营养风险评估,为该人群的预后和个性化治疗提供了实用框架。

NHANES数据库肿瘤研究典型案例二:肿瘤风险因素

标题:Interpretable machine learning approaches for predicting prostate cancer by using multiple heavy metal exposures based on the data from NHANES 2003-2018

研究方法:该研究基于 2003 年至 2018 年美国国家健康与营养调查(NHANES)数据库中的 8022 个样本,利用了 18 种血液和尿液重金属和矿物质以及 14 个协变量的浓度信息。在评估的 8 个 ML 模型中,随机森林(RF)算法表现出优异的性能,在测试集中达到了 72.835%的准确率、0.869 的受试者工作特征曲线下面积(AUC)、0.145 的 F_1 得分、0.749 的 G_mean 和 0.498 的约登指数。四种可解释的方法被整合到 ML 模型中。 RF 研究发现,血铅(Pb)(0.449~29.964 µg/dL)、尿铯(Cs)(1.822~270.426 µg/L)和尿锑(Sb)(0.015~4.953 µg/L)水平与 PCA 风险呈正相关,而血镉(Cd)(0.247~9.025 µg/L)则呈负相关。值得注意的是,尿 Cs 和 Sb 在本研究中成为新的 PCA 风险相关金属。协同效应分析进一步确定血铅、尿锑和尿铯是主要的 PCA 影响因素。本研究建立的预测模型可为 PCA 的防控提供有价值的策略。

3️⃣ UKB:精准肿瘤学的"前沿阵地"

优势:

  • 多组学数据整合

  • 前瞻性设计

  • 包含影像学数据

  • 数据质量高

劣势:

  • 数据获取流程复杂

  • 需要较长的审批时间

  • 存在健康志愿者偏倚

  • 肿瘤病例积累需要时间

适合研究方向:

  • 遗传风险研究

  • 生物标志物发现

  • 精准预防研究

  • 多组学整合分析

UKB数据库肿瘤研究典型案例一:预测模型构建

标题:Prospective cohort study integrating plasma proteomics and machine learning for early risk prediction of prostate cancer

研究方法:该研究对英国生物样本库 (UKB) 中 23,825 名无前列腺癌 (PCa) 男性的 1,463 种血浆蛋白进行了定量分析。参与者被分为训练集和验证集。使用 Cox 回归和带有前向特征选择的 LightGradient Boosting Machine (LightGBM) 模型来识别和排序预测蛋白。模型性能通过验证集中的受试者工作特征曲线下面积 (AUC) 进行评估,并使用 SHAP 值来解释特征贡献。结果显示TSPAN1 和 GP2 在所有分析中始终位居前列,为预测因子。在训练集中,经多变量 Cox 模型的 Bonferroni 校正后,这两种蛋白仍然与前列腺癌 (PCa) 风险显著相关。采用前向选择模型的 LightGBM 进一步将 TSPAN1 和 GP2 优先列为关键贡献因素,SHAP 分析证实了它们的重要性。在验证集中,结合 TSPAN1、GP2 和人口统计学变量的模型对总体 PCa 预测的 AUC 为 0.728,对 5 年风险的 AUC 为 0.760。基于 Youden 指数得出的阈值,TSPAN1 和 GP2 高表达组的风险比分别为 1.75 和 1.60。纵向分析显示,TSPAN1 水平在诊断前约 9 年开始上升,而 GP2 水平在诊断前 6 年开始上升。TSPAN1 和 GP2 有望成为前列腺癌 (PCa) 的长期预测生物标志物。基于蛋白质组学的简化模型或可实现个体化风险分层,并为更早、更微创的筛查策略提供参考。

UKB数据库肿瘤研究典型案例二:肿瘤风险因素

标题:Physical Activity, Genetic Susceptibility, and Risk of Colorectal Cancer in Type 2 Diabetes: A Large Population-Based Cohort Study

研究方法:该研究旨在探讨不同体力活动(PA)水平与 CRC 发病率之间的潜在关联,并考虑遗传易感性,以 T2D 人群为研究对象。该研究基于英国生物银行 (UKB) 中确诊为 2 型糖尿病患者的数据;对参与者进行跟踪直至 2022 年。使用 Cox 回归模型计算 CRC 的风险比 (HR) 和 95% 置信区间 (95% CI)。结果显示与低 PA 组相比,中度和高度 PA 组的 2 型糖尿病患者 CRC 风险的多变量校正 HR 分别为 0.81(95% CI [0.66; 0.98])和 0.74(0.58; 0.94)。在右半结肠癌患者中,中度和高度 PA 组 CRC 风险分别降低 31%(HR 0.69;95% CI [0.51; 0.93])和 42%(HR 0.58;95% CI [0.40; 0.85])。即使在多基因风险评分 (PRS) 较高的患者中,高 PA (HR 0.54; 95% CI [0.35; 0.84]) 也与较低的 CRC 风险相关。低 PRS 和高 PA 的人患 CRC 的风险最低。研究表明,中高水平的 PA 有助于降低 2 型糖尿病患者的 CRC 风险,并且联合考虑 PA 水平和 PRS 可以为预防 CRC 的个性化策略提供有价值的见解。

4️⃣ CHARLS:精准肿瘤学的"前沿阵地"

优势:

  • 具有中国人群代表性

  • 包含社会经济维度数据

  • 关注中老年人群

  • 包含医疗费用信息

劣势:

  • 肿瘤特异性数据有限

  • 样本量相对较小

  • 缺乏详细的临床数据

  • 随访时间较短

适合研究方向:

  • 肿瘤经济负担研究

  • 老年肿瘤学研究

  • 健康不平等研究

  • 医疗政策评估

CHARLS数据库肿瘤研究典型案例一:发病率趋势研究

标题:Early-life undernutrition, immune dysregulation, and cancer incidence in later life: a national life-course analysis from the China health and retirement longitudinal study

研究方法:该研究分析了中国健康与养老纵向研究(2011-2015)中 2-515 名出生于 1947-1961 年的成年人;如果出生在 1959-1961 年期间,且出生地为粮食缺口达到 30%的五个省份之一,则将早期营养不良定义为出生在 1959-1961 年期间。同时,我们设立了一个由 82 名成年人组成的独立医院验证队列(招募于 2024-2025 年),并对其进行了相同的暴露分类、生物标志物采样和癌症监测,以进行外部验证。预设结局指标包括高敏 C 反应蛋白(hs-CRP)、白细胞(WBC)计数和医生确诊的恶性肿瘤。我们采用多变量逻辑回归和 Cox 混合效应模型,包含交互作用项、量化剂量-反应关系和效应修正;两个队列的估计值均采用逆方差加权进行汇总。与未暴露的同龄人相比,暴露的成年人平均 hs-CRP 水平较高,中位 WBC 水平略有升高。营养不良独立地增加了患慢性炎症和白细胞增多症的几率。发育期的热量缺乏会留下持久的炎症痕迹,从而导致中年时期癌症负担加重。针对饥荒幸存者的全生命周期筛查,结合抗炎和营养干预措施,将能够降低恶性肿瘤的风险,因为中国遭受饥荒影响的老年人群体规模正在不断扩大。

CHARLS数据库肿瘤研究典型案例二:药物不良反应

标题:Polypharmacy, drug-drug interactions and adverse drug reactions in older Chinese cancer patients: evidence from CHARLS

研究方法:分析使用了中国健康与养老追踪调查(CHARLS;2011-2013)的数据。符合条件的参与者为年龄≥60 岁的社区居民,且对 CHARLS 问题“医生是否曾告诉过您患有恶性肿瘤或癌症?”的回答为“是”。最常见的报告部位是肺癌、胃癌、结直肠癌、肝癌和乳腺癌,最终分析队列包含 408 名受试者。通过面对面访谈确定多重用药(每日≥5 种药物),并使用标准化参考药典确定 DDI(剂量与剂量相关性)。不良反应(ADR)由患者自我报告确认,并与病历相符。抑郁和认知能力采用经过验证的量表进行测量。使用根据社会人口统计学和临床因素调整的逻辑回归模型来评估关联性。结果显示基线时,36.0% 的参与者报告使用多种药物,随访时该比例上升至 38.0%。临床显著的药物相互作用 (DDI) 从 20.1% 上升至 23.0%,而不良反应 (ADR) 从 6.9% 上升至 8.1%。在校正模型中,多种药物治疗和药物相互作用均独立增加 ADR 风险。抑郁评分升高也与 ADR 发生率增加相关,尤其是在老年女性中。多重用药和药物相互作用(DDI)显著增加了中国老年癌症患者的不良反应风险,而抑郁症进一步加剧了其易感性。针对性的药物管理、严密的 DDI 监测以及对心理健康的关注,或许可以减少可预防的伤害,并改善这一快速增长的老年肿瘤患者群体的预后。

5️⃣ GBD:全球肿瘤政策的"决策基石"

优势:

  • 全球范围数据

  • 时间跨度长

  • 包含多种肿瘤类型

  • 具有政策指导价值

劣势:

  • 缺乏个体层面数据

  • 数据为估计值,存在不确定性

  • 无法进行个体水平分析

  • 更新周期较长

适合研究方向:

  • 全球肿瘤负担研究

  • 时间趋势分析

  • 政策效果评估

  • 国际比较研究

GBD数据库肿瘤研究典型案例一:流行病学趋势

标题:Epidemiological trends of early-onset gastrointestinal cancers from 1990 to 2021 and predictions for 2036: analysis from the global burden of disease study 2021

研究方法:利用 2021 年全球疾病负担 (GBD) 数据库,分析了 15-49 岁人群早发性胃肠道癌症的年龄标准化发病率 (ASIR)、死亡率 (ASMR) 和伤残调整生命年 (ASDR) 随时间 (1990-2021) 的变化趋势。分析涵盖按年龄、性别、地区和社会人口指数 (SDI) 划分的负担。使用 Joinpoint 回归估计了平均年百分比变化 (AAPC),并使用贝叶斯年龄-时期-队列模型预测了未来趋势 (2022-2036)。1990 年至 2021 年,仅结直肠癌的 ASIR 有所增加(AAPC:0.37,95%CI:0.24-0.50),食管癌、胃癌、肝癌、胰腺癌和胆囊/胆道癌的 ASIR 有所下降。除胆囊/胆道癌外,男性的负担更重。不同地区、性别和 SDI 水平的 ASIR 存在显著差异。吸烟和高体质指数是主要危险因素。预测显示,早发结直肠癌和食管癌的 ASIR 将上升,肝癌发病率保持稳定,而胃癌、胰腺癌、胆囊/胆道癌的发病率、死亡率和 DALYs 率将下降。早发性胃肠道癌症在全球范围内构成了巨大且不断变化的负担,其发病率因癌症类型、年龄、性别、地区和 SDI 而异。迫切需要有针对性的预防和医疗保健策略来应对可改变的危险因素并减少差异。

GBD数据库肿瘤研究典型案例二:风险归因

标题:The Global, Regional, and National Burden of Three Female Pelvic Cancers Attributable to High Body Mass Index from 1990 to 2021: A Systematic Analysis for the Global Burden of Disease Study 2021 and Projection to 2050

研究方法:该研究旨在利用 2021 年全球疾病负担(GBD)数据,探讨高 BMI 对这些癌症影响的地区和年龄差异以及三者之间的共性。研究检索了 1990 年至 2021 年这些癌症的死亡人数、伤残调整生命年(DALY)及其年龄标准化率(ASR),并利用估计年变化百分比(EAPC)和变化百分比评估了疾病负担趋势。研究还分析了 21 个地区 ASR 与社会人口指数(SDI)的相关性,并利用贝叶斯年龄-周期模型(BAPC)预测了未来的疾病负担趋势。结果显示,女性结肠癌和直肠癌的全球负担自 1990 年以来有所下降,但在 2021 年仍为三种癌症中最高,同时这三种癌症在高收入地区负担较高。自 1990 年以来,归因于高 BMI 的卵巢癌和子宫癌负担呈上升趋势,且这三种癌症负担在中低收入地区和年轻人群中增长最快,预计到 2050 年这三种癌症负担都将继续增加。本研究证实了高 BMI 对这些癌症的影响具有区域性和年龄特异性,并具有长期影响。因此,后续公共卫生干预措施应根据国家和地区情况采取更有针对性的肥胖防控策略,以有效减轻高 BMI 对这些癌症的不利影响。

终极总结


评论列表

发表评论