2区期刊的SEER工作量定位
工作量基准:SEER(Surveillance, Epidemiology, and End Results)数据库由美国国家癌症研究所(NCI)建立与维护,覆盖数千万肿瘤患者个案,囊括多种实体瘤与血液肿瘤,记录了详尽的发病、分期、病理、治疗方式及随访结局等临床流行病学信息。凭借其大样本、长期随访及数据质量可控等优势,SEER 已成为肿瘤流行病学和预后研究中应用最广泛的公共数据库之一。
近年来,围绕 SEER 的研究在 PubMed 上的累计发文量持续攀升,2025 年发文量达 1649 篇!随着数据库价值被不断挖掘,SEER 相关工作在顶级期刊中的竞争也愈发“卷”:近一年发表于一二区期刊的 SEER 研究早已不再满足于单一肿瘤、单一结局的简单生存率报告,而是普遍呈现出精细分型、多终点预后、竞争风险建模、个体化风险预测、亚组不平等评估与临床决策导向相结合的综合工作量特征。这类研究不仅需要对大规模患者个案进行严格质控与复杂变量处理,还需整合高级统计模型、预测工具构建及多维可视化表达,其整体工作量相当于一项系统性临床队列研究,而绝非简单“下 SEER 做个单变量生存分析”即可完成。

下面结合近期 2 区期刊 SEER 论文的共性,拆解一下现在想发二区 SEER 文章通常需要具备的核心要素和工作量。
核心要素:
✅ 精细化病例筛选与分层:
基于 ICD-O-3 编码、原发部位、病理类型、确诊年份、分期系统、治疗方式、随访时间及结局变量等,进行严格纳排;同时按年龄段、性别、种族/族裔、婚姻状况、诊断年代、肿瘤分级/分期等多维度交叉分层,精准刻画不同人群的发病与预后特征。
✅ 趋势与生存模式识别:
除传统 Kaplan–Meier 生存曲线与 log-rank 检验外,常结合 Cox 比例风险模型、分层 Cox、时间依赖协变量、竞争风险模型(Fine–Gray)及多状态模型,分析总体生存(OS)、癌症特异生存(CSS)、无病生存(DFS)等多种终点的长期趋势与风险模式,并通过敏感性分析验证模型稳健性。
✅ 预后因子解析与风险预测工具构建:
在单因素筛选基础上,利用多变量回归模型深入挖掘独立预后因素,构建列线图(nomogram)等预测工具,并通过 C-index、ROC 曲线(AUC)、校准曲线、决策曲线分析(DCA)、Net Reclassification Improvement(NRI)等指标评价预测性能;部分研究还会进行内部/外部验证(bootstrap、训练-验证队列划分)。
✅ 人群差异与健康不平等评估:
通过分层分析和交互作用检验,考察不同种族/族裔、性别、年龄段、社会经济状况(如县级贫困率、教育水平)、地区分布等因素对诊疗模式与预后的影响;常用率比、率差、相对危害比(HR 比值)、归因分数等指标,量化人群间差异,并从卫生资源配置与精准医疗角度讨论潜在不平等。
✅ 高信息密度可视化与补充分析:
综合采用流行病学趋势图、生存曲线、多变量森林图、列线图展示、校准曲线、决策曲线、亚组分析森林图、竞争风险累积发生曲线等图表,在有限篇幅中高效呈现复杂结果;同时提供详尽的补充材料,包括变量定义、编码规则、敏感性分析、亚组结果表等,对主文结论形成有力支撑。
工作量框架与3篇案例对照

典型工作量拆解
案例一:

文章标题:Comprehensive analysis of clinical and molecular heterogeneity in early-onset non-small cell lung cancer: prognostic paradoxes and insights into efficacy
变量:包括人口学特征(诊断年龄、性别、种族、婚姻状况)、肿瘤特征(原发部位、组织学类型、侧位性、TNM 分期、SEER 分期、分级、肿瘤大小、远处转移情况、原发肿瘤数量)以及治疗方式(手术、放疗、化疗记录)。此外,分子分析数据来源于癌症基因组图谱(TCGA)、基因表达综合(GEO)和 cBioPortal 数据库,涉及差异表达基因和体细胞突变。
2️⃣ 统计分析
主要结局为总生存期(OS)和癌症特异性生存期(CSS)。次要结局包括年龄对治疗效果的动态影响以及预后因素的权重。
-
基线特征:连续变量采用 t 检验,分类变量采用卡方检验或 Fisher 精确检验进行比较。使用多变量逻辑回归评估年龄与高分期/高分级肿瘤的关系。
-
生存分析:使用 Kaplan-Meier 法和 Log-rank 检验比较组间生存差异。多变量Cox比例风险模型用于评估各变量与全因死亡率的关系。
-
高级统计方法:为控制混杂偏倚,采用倾向评分匹配(PSM)。利用 X-tile 软件和二次多项式拟合确定与预后及临床特征相关的年龄阈值。通过随机生存森林(RSF)模型评估各变量对预后影响的权重,并使用限制性立方样条(RCS)结合交互项探究治疗方式与年龄对生存风险的非线性关联。
-
分子分析:使用 limma 包进行差异表达基因分析,利用 maftools 包绘制突变图谱,并通过多数据库交叉验证关键分子发现。
3️⃣ 结果呈现
年龄对预后和临床特征的非线性影响

不同年龄段内年龄与肿瘤特征的相关性


早发与晚发肺癌患者的生存比较


按治疗分层的早发与晚发组生存比较


治疗效果与年龄的关系及预后因素权重

不同亚组中手术的生存优势

早发与晚发组死因谱构成

早发与晚发组的分子遗传学差异

案例二:

文章标题:Distinct Prognostic Patterns of Single Hormone Receptor-Positive Subtypes in HER2-Negative Breast Cancer: A SEER-Based Retrospective Cohort Study
变量:主要包括人口学特征(诊断年龄、性别、种族)、肿瘤特征(组织学类型、肿瘤分级、AJCC 第 6 版分期、T/N/M 分期、特定部位转移情况)以及关键的分子亚型(基于 ER/PR 状态定义的四种亚型:ER+/PR+、ER+/PR-、ER-/PR+、ER-/PR-)。该研究未整合外部组学数据库进行分子机制探索。
2️⃣ 统计分析
主要结局为乳腺癌特异性生存期(BCSS)。次要结局包括总体生存期(OS)以及不同分子亚型间的预后比较。
-
基线特征:分类变量采用卡方检验或 Fisher 精确检验进行比较,以描述不同分子亚型间的临床病理特征分布。
-
生存分析:使用 Kaplan-Meier 法和 Log-rank 检验进行单因素生存比较。采用单变量及多变量 Cox 比例风险回归模型评估各因素(尤其是分子亚型)与死亡风险的关联,并计算风险比(HR)。
-
高级统计方法:为解决比例风险假设违例问题,引入了时间依赖协变量进行分析。通过构建并内部验证一个整合了关键临床变量的 Nomogram(列线图)模型来预测个体患者的 3 年及 5 年 BCSS。使用 C-index、Brier 评分和校准曲线评估模型的区分度与校准度,并应用决策曲线分析(DCA)评估其临床效用。通过广泛的敏感性分析(包括针对分期分类和竞争风险的探讨)以验证核心结论的稳健性。
3️⃣ 结果呈现
不同 HR 状态亚型的生存曲线比较

各分子亚型间死亡风险的量化比较

HER2 阴性乳腺癌生存预测列线图

案例三:

文章标题:Age-dependent effects of surgical approach in T3b differentiated thyroid carcinoma: a population-based analysis using machine learning
变量:包括人口学特征(诊断年龄、性别、种族、婚姻状况、家庭收入、县类型)、临床病理特征(诊断年份、组织学分级、肿瘤大小、多灶性、N 分期)以及治疗变量(手术方式[腺叶切除术 vs. 全甲状腺切除术]、放射性碘治疗)。主要结局为总生存期(OS)。
2️⃣ 统计分析
主要结局为总生存期(OS)。次要结局包括手术方式的整体效应评估以及年龄与手术方式对生存影响的交互作用。
-
基线特征:连续变量采用 Mann-Whitney U 检验,分类变量采用卡方检验进行比较。
-
生存分析:使用 Kaplan-Meier 法和 Log-rank 检验进行组间生存比较。使用多变量Cox比例风险模型评估各变量与死亡风险的关系。
-
高级统计方法:采用随机生存森林(RSF)模型处理高维数据并评估变量重要性。运用SHAP(SHapley Additive exPlanations)可解释性分析,通过计算总 SHAP 值、主 SHAP 值和交互 SHAP 值来量化特征贡献、识别独立效应并探测变量间的交互作用(特别是年龄与手术方式)。使用限制性立方样条(RCS)Cox 模型探究手术效果随年龄变化的连续非线性关系,并确定效应转换的年龄阈值(45 岁)。在 Cox 模型框架下,对年龄进行分层(<45 岁 vs. ≥45 岁),并计算乘法和加法交互作用指标,以正式验证年龄对手术效果的修饰效应。通过直接调整法生成多变量校正后的生存曲线。使用 RCS 泊松模型估计不同手术方式随年龄变化的死亡率。
3️⃣ 结果呈现
手术方式的总 SHAP 值与主 SHAP 值分布图

年龄与手术方式交互 SHAP 值分布图

手术方式风险比随年龄变化的 RCS 曲线图

不同年龄组与手术方式的校正生存曲线图

年龄与手术方式交互作用的 Cox 回归分析结果表






评论列表