SEER数据库SEER数据库中科院2区SCI文章常见工作量文章常见工作量

官方
阅读 96 0 收藏 0 2025-08-09 10:01:00

2区期刊的 SEER 研究定位

工作量基准:从 SEER 数据中系统提取数据,结合多种统计模型(如 PSM、多变量回归分析和预测模型构建),完成全流程的数据清洗、分析、稳健性检验与结果解读。

核心要素:

✅ 统计分析:

  • 可采用 Kaplan-Meier 曲线与 Log-rank 检验比较不同治疗方式下患者的 OS 与 CSS 差异;

  • 可使用多变量回归模型(如 Logistic 回归、Cox 比例风险模型)识别关键影响因素;

  • 为控制潜在混杂偏倚、提升组间可比性,引入倾向性评分匹配(PSM)方法,构建平衡队列并进行稳健性验证;

  • 考虑到 SEER 数据的长期随访特性,可引入时间依赖性分析或竞争风险模型等方法,以提高分析的准确性。

✅ 高级模型:在此基础上构建预测模型(如列线图或机器学习算法),并通过交叉验证、ROC 曲线、校准曲线、决策曲线等手段对模型性能进行全面评估。

✅ 外部验证:如条件允许,可借助外部数据集进行验证,以进一步检验模型的稳健性与泛化能力。若暂时缺乏外部数据,也可通过 bootstrap 重抽样进行内部稳健性测试。

工作量框架与5篇案例对照

典型工作量拆解

案例一:

文章标题:Development and validation of a deep learning-based survival prediction model for pediatric glioma patients: A retrospective study using the SEER database and Chinese data

1️⃣ 数据准备

本研究共纳入9532名儿童胶质瘤患者的数据,分别来自美国SEER数据库(2000–2018年,共 9274 例)和中国唐都医院(2010–2018 年,共 258 例),其中 SEER 数据作为训练集与内部测试集,唐都医院数据作为外部验证集。

纳排标准:包括确诊为儿童胶质瘤(年龄≤18岁)、完整的随访信息、生存时间≥1个月的患者,排除缺失关键变量(如肿瘤特征、治疗方式、生存状态)的病例。

变量整理:统一整理了包括人口学特征(年龄、性别、种族)、肿瘤学特征(病理类型、分期分级、肿瘤大小)、治疗方式(手术、放疗、化疗)和随访信息(生存状态、生存时间)等变量。

数据划分:SEER 数据按 8:2 比例随机分为训练集与测试集;唐都医院数据作为独立外部验证集用于检验模型的泛化能力。

2️⃣ 统计分析

生存分析:Cox 回归(HR及95%CI),使用 Harrell’s C-index 和校准曲线评估 Cox 模型的判别能力与拟合度。

模型训练与测试:

  • 三种生存预测模型用于主分析:DeepSurv(深度神经网络)、N-MTLR(神经多任务逻辑回归)、随机生存森林(RSF)。

  • 所有模型使用训练集进行建模,并在测试集上进行初步验证。

  • 超参数调优通过 1000 次随机搜索与5折交叉验证完成,目标为最小化 Brier 分数与最大化C-index。

模型性能评估指标:

  • 判别能力:使用 C-index 和 AUC(1年、3年、5年)评估模型区分生存状态的能力。

  • 拟合度与准确性:Brier Score 和 Integrated Brier Score(IBS)衡量预测误差。

  • 校准能力:绘制 1/3/5 年生存的校准曲线,评估预测概率与实际生存的一致性。

  • 临床效益评估:使用决策曲线分析(DCA)衡量不同模型在多个时间点的净获益。

特征重要性:

SHAP 可视化最终模型的特征重要性。

临床工具开发:

基于 DeepSurv 模型构建了在线预测工具。

3️⃣ 结果呈现

表1:变量赋值表

表2:患者基线特征以及单因素多因素 Cox 回归分析

表3:外部验证的基线特征

表4:训练集验证集的基线特征

图2:(A)数据集中变量的相关系数;(B)预测误差曲线;(C)DeepSurv和神经网络多任务逻辑回归(NMLTR)模型的损失收敛图

表5:四种生存模型的性能

图3:1(A)-3(C)-5(E)年生存预测的ROC曲线。1(B)-3(D)-5(F)年生存预测的校准曲线(训练集);1(G)-3(I)-5(K)年生存预测的ROC曲线。1(H)-3(J)-5(L)年生存预测的校准曲线(验证集)

图4:4种不同模型的1(A)-3(B)-5(C)生存预测的决策曲线分析

图5:(A)SHAP图可视化,描绘了 DeepSurv 模型特征的贡献排名。(B) 模型中每个特征变量的平均 SHAP 值排名。(C)12 个特征中不同因素对模型的影响(X 轴为特征变量的赋值,Y 轴为 SHAP 值)

图6:(A)描述 DeepSurv、神经网络多任务逻辑回归(NMLTR)和随机生存森林(RSF)模型中特征重要性的热图。(B)用于生存预测和治疗选择的 DeepSurv 模型的在线预测器。4 例小儿胶质瘤患者的生存预测。(C) 小儿神经胶质瘤患者五种不同治疗方式的生存预测

案例二:

文章标题:Survival benefit of combined immunotherapy and chemoradiotherapy in locally advanced unresectable esophageal cancer: an analysis based on the SEER database

1️⃣ 数据准备

本研究基于美国国家癌症数据库 SEER(Surveillance, Epidemiology, and End Results)项目,系统提取 2004–2014 及 2019–2020 年间确诊为局部晚期不可切除食管癌的7758名患者。其中接受放化疗单独治疗者 6,395 例,接受放化疗联合免疫治疗者 1,363 例。

纳入标准包括:① 诊断为局部晚期且不可手术切除的食管癌;② 接受放化疗联合免疫治疗或单纯放化疗;③ 明确的临床病理信息及完整的生存结局数据。剔除标准包括:① 缺失关键治疗信息;② 生存时间为0;③ 合并其他恶性肿瘤史者。

变量整理:统一整理了包括人口学特征(年龄、性别、种族)、肿瘤学特征(病理类型、分期分级、肿瘤大小)、治疗方式(手术、放疗、化疗)和随访信息(生存状态、生存时间)等变量。

采用 X-tile 软件确定年龄和肿瘤大小的最佳分界值,分别为 75 岁和 60 mm,用于后续分层分析。

2️⃣ 统计分析

生存差异比较:采用 Kaplan-Meier 方法绘制总体生存(OS)及肿瘤特异性生存(CSS)曲线,并通过 Log-rank 检验比较两组生存差异。在原始队列和 PSM 匹配队列中均开展了生存比较。

PSM:为减少混杂因素干扰,采用 1:4 比例最近邻匹配法进行倾向性评分匹配,匹配变量包括种族、肿瘤部位、大小、分级、病理类型等,最终形成 1,357 例 CRT+IMT 组与 5,090 例 CRT 组的匹配队列。

回归建模分析:在匹配后队列中进行单因素和多因素 Cox 比例风险回归模型,识别与 OS/CSS 显著相关的独立预后因素,结果以风险比(HR)及 95% 置信区间(CI)表示。

亚组分析:进一步进行分层分析,以探讨治疗方式在不同人群中的差异效应。

本地数据验证:在本中心独立队列中纳入 63 例接受 CRT+IMT 的局部晚期不可切除食管癌患者,开展回顾性分析,进一步验证了 CRT+IMT 可显著延长 OS(中位生存 21 月)与 PFS(中位 15 月),ORR 达 62%,DCR 高达 92%。

3️⃣ 结果呈现

图2:(A–F)图像展示了通过 X-tile 分析确定年龄和肿瘤大小的最佳截断值。(A, D)黑点表明已确定年龄/肿瘤大小的最佳截断值。(B, E)基于确定的截断值构建了直方图和(C, F)Kaplan-Meier 曲线

表1:患者倾向评分匹配前后的基线特征

图3:(A, B) 使用标准化均值差异(SMD)(A)和倾向得分(B)对 CRT+IMT 组与 CRT 组进行倾向得分匹配

表2:按治疗方式分层患者的生存率

图4:(A–D) Kaplan-Meier 生存曲线,展示倾向评分匹配前后患者的总生存期(OS)(A, C)和无病生存期(CSS)(B, D)。图中显示了 95%置信区间(基于对数风险估计)、不同时间点的风险患者数量以及对数秩检验的 P 值

表3:倾向评分匹配后患者总生存率的单变量和多变量 Cox 回归分析

表4:倾向得分匹配后患者癌症特异性生存的单变量和多变量 Cox 回归分析

图5:(A, B) 显示匹配队列中 OS(A)和 CSS(B)预后因素多变量分析的森林图

图6:(A, B) 基于治疗效应对总生存期(OS)(A)和无病生存期(CSS)(B)的亚组分析和交互检验结果汇总于森林图

表5:我院纳入患者的基本特征

图7:(A, B) Kaplan-Meier 曲线显示我院纳入患者的总生存期(A)和无进展生存期(B

案例三:

文章标题:The effectiveness of combined extrahepatic bile duct resection in radically resected cases with intrahepatic cholangiocarcinoma: a SEER-based retrospective cohort study and an external validation

1️⃣ 数据准备

本研究基于 SEER 数据库(Surveillance, Epidemiology, and End Results),共纳入 2004–2020 年间切除性手术确诊为肝内胆管癌(IHCC)患者 1,521 例,其中 189 例接受了联合肝外胆道切除(EHBDR)。所有患者均为病理确诊病例,并拥有完整的临床病理与随访资料。

纳入变量包括:人口学特征(年龄、性别、婚姻状况、种族)、临床背景(是否合并肝硬化)、肿瘤病理特征(T分期、N分期、分化程度、肿瘤数量、是否有卫星结节、血管侵犯、肿瘤组织类型等)、手术方式(是否联合 EHBDR、多脏器联合切除、肝叶切除范围)、术后治疗(是否接受辅助放疗/化疗)及随访数据(OS、CSS、DFS、生存时间等)。

对连续变量如 CA19-9 水平的缺失值采用多重插补法(multiple imputation)处理,具体使用 R 软件中的 mice 包完成。

2️⃣ 统计分析

组间比较:使用卡方检验或Mann-Whitney U 检验比较 EHBDR 组与非 EHBDR 组在基线特征、手术方式和病理特征方面的差异。

生存分析:采用 Kaplan-Meier 方法估算总生存期(OS)、癌症特异性生存期(CSS)及无病生存期(DFS),并通过 Log-rank 检验比较 EHBDR 与非 EHBDR 两组的生存差异。生存曲线进一步在 T 分期、N 分期等亚组中进行分层分析。

单变量与多变量 Cox 回归:分别构建 OS 和 CSS 的风险模型,识别独立预后因素。显著变量包括:性别、肝硬化状态、T/N 分期、肿瘤分化程度、是否接受 EHBDR 等。在外部验证队列中,还纳入了 CA19-9 水平、手术切缘状态、多发肿瘤、卫星结节等额外指标。

倾向性评分匹配(PSM):为减少基线差异造成的偏倚,分别在 SEER 队列(1:2 匹配)与外部验证队列(1:1 匹配)中进行 PSM 匹配,控制的变量包括:年龄、性别、肝硬化、T/N 分期、分化程度、手术范围、术后化疗等。匹配后两组大多数变量达到平衡,标准化差值(SMD)均小于 0.1,匹配后依然观察到 EHBDR 组的长期生存不良。

外部验证队列:该队列来自研究中心癌症数据库,初始共纳入 965 例确诊 IHCC 患者,最终纳入 522 例完整病例,其中 EHBDR 组 117 例,非 EHBDR 组 405 例。外部队列中位随访时间为 47.5 个月(IQR: 36.25–65 个月)。

3️⃣ 结果呈现

表1:基于 SEER 队列在 PSM 前根据总生存期(OS)和无病生存期(CSS)对接受 BDR 治疗的患者与未接受 BDR 治疗的患者进行的比较分析

图3:Kaplan–Meier 曲线展示 SEER(监视、流行病学和最终结果)队列中接受 BDR(胆管切除)和未接受 BDR 的患者之间的生存差异,在倾向评分匹配前。(A) 整个队列的无进展生存期;(B) T1–T2 疾病患者的无进展生存期;(C) T3–T4 疾病患者的无进展生存期;(D) N−(淋巴结阴性)患者的无进展生存期;(E) N+(淋巴结阳性)患者的无进展生存期;(F) T3–T4 和 N+疾病患者的无进展生存期;(G) 整个队列的癌症特异性生存期;(H) T1–T2 疾病患者的癌症特异性生存期;(I) T3–T4 疾病患者的癌症特异性生存期;(J) N−(淋巴结阴性)患者的癌症特异性生存期;(K) N+(淋巴结阳性)患者的癌症特异性生存期;(L) T3–T4 和 N+疾病患者的癌症特异性生存期

表2:SEER 队列 OS 和 CSS 预后因素的单变量和多变量 Cox 回归分析

表3:基于 SEER 队列 PSM 后的 BDR 组与未 BDR 组在总生存期(OS)和无病生存期(CSS)上的比较分析

图4:Kaplan–Meier 曲线展示在 SEER(监视、流行病学和最终结果)队列中进行倾向评分匹配后,接受胆管切除(BDR)的患者与未接受 BDR 的患者之间的生存差异。(A) 整体队列的无进展生存期(OS);(B) T1–T2 疾病患者的 OS;(C) T3–T4 疾病患者的 OS;(D) N−疾病患者的 OS;(E) N+疾病患者的 OS;(F) T3–T4 和 N+疾病患者的 OS;(G) 整体队列的无病生存期(CSS);(H) T1–T2 疾病患者的 CSS;(I) T3–T4 疾病患者的 CSS;(J) N−疾病患者的 CSS;(K) N+疾病患者的 CSS;(L) T3–T4 和 N+疾病患者的 CSS

案例四:

文章标题:Prognostic impact of increased lymph node yield in colorectal cancer patients with synchronous liver metastasis: a population-based retrospective study of the US database and a Chinese registry

1️⃣ 数据准备

本研究基于来自 SEER 数据库(n=3899) 与 中国多中心注册登记数据(n=676) 的转移性结直肠癌患者,严格按照既定纳入与排除标准筛选符合条件的患者。两队列涵盖完整的基线特征与随访信息,为后续的生存分析与亚组比较提供了坚实的数据基础。

纳排标准:根据国际疾病分类肿瘤学分类(ICD-O-3)的解剖学编码,原发肿瘤部位分为三个亚部位:近端结肠(C18.0、C18.1、C18.2、C18.3 和 C18.4)、远端结肠(C18.5、C18.6、C18.7)和直肠(C19.9 和 C20.9)。同步 LM 通过影像学或病理学检查确定。同步 LM 是指在原发性 CRC 诊断后 6 个月内发现的肝脏病变。如果患者未接受 CRC 手术、未提供淋巴结切除数量数据或生存状态未知,则被排除在外。

变量整理:统一整理了包括患者的人口统计学和临床信息(年龄、性别)、淋巴结比率(LNR)、阳性淋巴结数量除以总 LNY、肿瘤[原发肿瘤部位、肿瘤等级、组织学类型、美国癌症联合委员会(AJCC)TNM 分期和术前癌胚抗原(CEA)]、手术策略(仅原发部位切除、原发部位和转移灶切除)以及结局变量(随访时间和生存状态)和随访信息(生存状态、生存时间)等变量。

PSM:为控制混杂偏倚、平衡 LNY <12 与 ≥12 两组间的基线差异,研究分别在 SEER 队列、中国队列 及其合并总体中进行了 1:1 PSM 匹配。

2️⃣ 统计分析

Kaplan-Meier 曲线与 Log-rank 检验:用于评估 LNY <12 vs. LNY ≥12 对 CSS 的影响。

多变量 Cox 回归模型:纳入所有在单变量分析中显著(P<0.05)的变量,进一步探讨独立预后因素。

多变量 Cox 回归模型:纳入所有在单变量分析中显著(P<0.05)的变量,进一步探讨独立预后因素。

LNY 与肿瘤部位交互分析:额外比较 LNY 对近端结肠、远端结肠与直肠患者的生存影响。

补充分析与验证:

  • 在中美队列分别进行匹配与生存分析后,还将两个队列合并进行整体分析,以增强结论的外部适用性。

  • 生存分析结果在多个 M 分期(M1a/M1b)分层下保持一致,提升了结论的普适性。

3️⃣ 结果呈现

表1:SEER 数据库和中国登记中 IV 期结直肠癌患者的临床病理特征

表2:LNY 与 IV 期结直肠癌患者临床病理特征之间的关联在 SEER 数据库和中国登记中的关系

图1:在 SEER 数据库中,根据 LNY 分层,在 PSM 前后患者的 Cox 调整生存曲线。(A) PSM 前所有 IV 期患者。(B) PSM 前 M1a 期患者。(C) PSM 前 M1b 期患者。(D) PSM 后所有 IV 期患者。(E) PSM 后 M1a 期患者。(F) PSM 后 M1b 期患者

表3:SEER 数据库中经倾向评分匹配后,IV 期结直肠癌患者癌症特异性生存的多变量 Cox 分析

图2:中国登记数据库中经倾向评分匹配调整后的 Cox 生存曲线,按淋巴结清扫数量分层(A)PSM 前所有 IV 期患者(B)PSM 前 M1a 期患者(C)PSM 前 M1b 期患者(D)PSM 后所有 IV 期患者(E)PSM 后 M1a 期患者(F)PSM 后 M1b 期患者

图3:根据 LNY 分层对 SEER 数据库的生存亚组分析

图4:根据 LNY 分层对中国登记系统的生存亚组分析

案例五:

文章标题:Lymph node yield as a surrogate marker for tumour biology and prognosis in colon cancer

1️⃣ 数据准备

包括了来自两个大型基于人群的数据集的结直肠癌患者:SEER 和 CORECT-R,涵盖了 2010 年至 2020 年。符合条件的患者具有经病理学确诊的结直肠腺癌,接受了根治性切除术,并具有完整的病理学和随访记录。

纳排标准:仅纳入结肠非转移性腺癌且淋巴结数据完整的患者。在两个数据集中均排除了接受急诊手术、次全结肠切除术、全直肠结肠切除术或外脏器切除术的患者。

变量整理:统一整理了包括人口学特征(年龄、性别、种族)、肿瘤学特征(病理类型、分期分级、肿瘤大小)、治疗方式(手术、放疗、化疗)和随访信息(生存状态、生存时间)等变量。

2️⃣ 统计分析

描述性分析:使用频数、中位数、四分位数等对患者基线特征进行总结;时间趋势图用于展示 LNY 和 LN+ 随年份的变化。

趋势分析:分别在 CORECT-R 和 SEER 队列中分析不同T分期下 LNY 的时间变化趋势。计算不同 LNY 层级下的 LN 阳性率,寻找平台效应(如LNY=9为转折点)。

回归建模分析:使用 Cox 比例风险模型评估 LNY 与 OS 的独立关系,控制混杂因素(年龄、性别、肿瘤部位、阳性淋巴结数、是否接受辅助治疗等)。

亚组分析:亚组分析中将患者按 LNY ≥9 vs. <9 和 LN 阳性 vs. 阴性分层,比较生存差异。

队列差异:在 CORECT-R 中使用线性回归预测每个多学科团队(MDT,multi-disciplinary teams)的预期 LNY。识别偏高/偏低的 MDT(±2 SD),并比较其 OS 是否有统计差异。

3️⃣ 结果呈现

表1:CORECT-R 和 SEER 队列的人口统计学特征

图2:折线图显示:a. CORECT-R 数据库中每年纳入的每名患者平均切除的淋巴结数量 b. SEER 数据库中的相同指标 c. CORECT-R 数据库中每名患者平均切除的含癌淋巴结数量 d. SEER 数据库中的相同指标 e. CORECT-R 数据库中每年至少有一个淋巴结转移的患者百分比 f. SEER 数据库中每年至少有一个淋巴结转移的患者百分比

图 3. 每个 LNY 值下至少有一个淋巴结转移的患者百分比

图 4. 不同淋巴结产量和淋巴结状态下的生存模型

图 5. 检查不同 MDT 的淋巴结收获量变化


评论列表

发表评论