如何在SEER数据库找到感兴趣的数据,含步骤详解

官方
阅读 19 0 收藏 0 2025-10-03 10:00:00

3步精准定位法

 第一步:明确研究变量类型 

明确我所需要的变量类别:

1.我的变量是人口统计学还是肿瘤类型?

  • 人口统计学数据:

Race,Sex,Year,DX模块 

→ Sex 【患者性别】

→Year of diagnosis 【诊断年份】

→Race recode (W, B,AI,API)【种族】   

Race and Age 模块 

→ Age recode with single ages and 90+ 【患者年龄】

Other模块 

→ Marital status at diagnosis 【婚姻状态】

→Patient ID 【患者ID】

County attributes模块 

→ Median household income inflation Type of Reporting Source 【家庭收入】

  • 肿瘤治疗数据

Therapy 模块

→ RX SUMM—SURG PRIM SITE (1998+) 【原发部位手术变量】

→ RX SUMM--SURG/RAD SEQ 【手术和放射治疗顺序】

→ RADIATION RECODE 【化疗情况】

→ CHEMOTHERAPY RECODE 【放疗情况】

  • 肿瘤位置和形态学

Site and Morphology 模块

→ Site recode ICD-O-3/WHO 2008, Site recode ICD-O-3/WHO 2008 (for SIRs) 【基于ICD-03记录的肿瘤位置】

→ Behavior code ICD-O-3 【病灶良恶性】

→ Histologic Type ICD-O-3, ICD-O-3 Hist/behav, ICD-O-3 Hist/behav, malignant 【国际肿瘤疾病分类第二版(ICD-O-3)组织学编码参考】

→ Grade (thru 2017) 【肿瘤分级,17年之前】

→ Grade Clinical (2018+) 【肿瘤分级,18年之后】

→ Grade Pathological (2018+) 【病理分级】

→ Laterality 【成对器官的一侧或肿瘤可报告起源的一侧】

2.我的结局变量在哪里?

Cause of Death(COD)and Follow-up 模块

→ COD to site recode 【根据部位编码确定死因】

→ SEER cause-specific death classification 【SEER特定原因死亡分类】

→ Survival months 【生存月数】

3.不同时间周期的数据如何获取?

部分数据根据诊断存在不同变量中

例:肿瘤大小随年份不同存在两个变量之中,需要全部获取

 第二步:使用官方数据与工具 

最佳路径:

访问SEER*Stat:进入case listing,选择table,使用find功能:查找关键词对应变量。

访问SEER官网:

https://seer.cancer.gov/analysis/

查找筛选所需变量:

 第三步:确认变量细节 

找到数据文件后,在进行分析前,务必仔细查阅变量文档,这是确保分析准确性的关键。

1️⃣ 查找变量定义与编码规则:

核心文档:在下载数据的页面,找到并下载最新的 “SEER Data Dictionary” 或 “Case Listing Variables” 文档。

2️⃣ 检查变量描述:

在此文档中搜索您感兴趣的变量名(如 RX_SUMM_SURG_PRIM_SITE),确保其定义与您的研究概念完全匹配。

3️⃣ 理解编码格式:

仔细查看每个代码对应的具体医学或操作含义(例如,手术代码30代表“根治性切除术”)。

4️⃣ 确认数据可用年份与版本:

SEER数据库包含多个子数据集(如SEER 9, SEER 17, SEER 22等),覆盖的年份和人群不同。

5️⃣ 注意变量变更:

许多变量(如TNM分期、治疗编码标准)会随着时间更新(例如,从AJCC 6th版变为7th版)。务必确认您所使用的变量在您选择的研究时间范围内是一致可用的,避免将不同标准的编码混合分析。

6️⃣ 特别关注:

保密规则:SEER为保护隐私,对某些变量进行了处理(如将年龄大于等于90岁的患者统一编码为90)。

未知值/缺失值编码:明确缺失值或未知值的特定编码(通常是99, 999, Blank等),并在数据分析前进行正确处理。

实战案例:寻找手术、死亡和生存时间变量

目标变量:

  • 治疗变量:原发部位的手术信息

  • 结局变量:死亡原因、生存时间

操作步骤:

▶ 手术变量查找:

进入SEER*Stat:点击Case Listing,进入Table,选择Therapy模块。

找到核心变量:

  • RX Summ—Surg Prim Site (1998+) 【原发部位手术代码】:记录了对原发肿瘤进行的最明确的手术操作。

  • RX Summ—Surg/Rad Seq 【手术和放疗的时序】:记录了手术和放射治疗的先后顺序。

▶ 死亡与生存变量查找:

在Table中继续寻找,进入Cause of Death(COD)and Follow-up模块。

找到核心变量:

  • Survival months 【生存月数】:从诊断到最后一次联系或死亡的月份数。这是计算生存时间的核心变量。

  • COD to site recode【根据部位编码确定死因】:导致患者死亡的部位。

  • SEER cause-specific death classification 【SEER特定原因死亡分类】:由SEER算法判断的死亡是否由所患癌症导致。这是肿瘤研究中常用的终点指标。

▶ 确认变量信息:

  • 查看代码手册:在数据字典中仔细查阅上述每个变量的详细编码规则。例如,RX Summ—Surg Prim Site代码0通常代表“无手术”,30可能代表“根治性切除术”,必须根据字典进行准确解读。

  • 确认数据可用性:注意这些变量在选择的SEER数据集(如SEER 17)中覆盖的诊断年份范围(例如,1975-2021),确保它们适用研究时段。

通过以上步骤,就可以精准地定位到SEER数据库中进行癌症生存分析所需的最关键的治疗和结局变量。

常见问题与解决方案

1. 变量选择与理解

常见问题场景:研究“肺癌的手术治疗”,有多个手术变量,该如何选择?

解决方案与建议:

  • 优先使用通用变量:选择名称含“Summ”的标准化变量。

  • 特定癌种深入研究:考虑站点特异性变量。

  • 核心原则:查阅数据字典,选择最符合研究问题的变量。

2. 数据处理与分析

常见问题场景:生存时间变量中有值为0,是否正常?

解决方案与建议:

  • 小数正常:由天数精确计算而来。

  • 检查标记变量:结合Survival months flag使用。

  • 值为0的处理:代表存活不足一个月,根据研究目的决定是否保留。

3. 数据处理与分析

常见问题场景:如何准确定义“癌症特异性死亡”?

解决方案与建议:

  • 使用COD to site recode变量和SEER cause-specific death classification变量。

  • 分析标准:将“死于癌症”记为事件1,“Alive”记为删失,“死于其他疾病”记为事件2。

4. 数据合并与版本

常见问题场景:TNM分期变量中途有过变化,如何处理?

解决方案与建议:

  • 识别版本:数据字典会标注变量有效年份和版本。

  • 分时段分析:分别使用不同版本进行分析,统一转换变量。


评论列表

发表评论