3步精准定位法
第一步:明确研究变量类型
明确我所需要的变量类别:
1.我的变量是人口统计学还是肿瘤类型?
-
人口统计学数据:
Race,Sex,Year,DX模块
→ Sex 【患者性别】
→Year of diagnosis 【诊断年份】
→Race recode (W, B,AI,API)【种族】

Race and Age 模块
→ Age recode with single ages and 90+ 【患者年龄】

Other模块
→ Marital status at diagnosis 【婚姻状态】
→Patient ID 【患者ID】

County attributes模块
→ Median household income inflation Type of Reporting Source 【家庭收入】

-
肿瘤治疗数据
Therapy 模块
→ RX SUMM—SURG PRIM SITE (1998+) 【原发部位手术变量】
→ RX SUMM--SURG/RAD SEQ 【手术和放射治疗顺序】
→ RADIATION RECODE 【化疗情况】
→ CHEMOTHERAPY RECODE 【放疗情况】

-
肿瘤位置和形态学
Site and Morphology 模块
→ Site recode ICD-O-3/WHO 2008, Site recode ICD-O-3/WHO 2008 (for SIRs) 【基于ICD-03记录的肿瘤位置】
→ Behavior code ICD-O-3 【病灶良恶性】
→ Histologic Type ICD-O-3, ICD-O-3 Hist/behav, ICD-O-3 Hist/behav, malignant 【国际肿瘤疾病分类第二版(ICD-O-3)组织学编码参考】
→ Grade (thru 2017) 【肿瘤分级,17年之前】
→ Grade Clinical (2018+) 【肿瘤分级,18年之后】
→ Grade Pathological (2018+) 【病理分级】
→ Laterality 【成对器官的一侧或肿瘤可报告起源的一侧】

2.我的结局变量在哪里?
Cause of Death(COD)and Follow-up 模块
→ COD to site recode 【根据部位编码确定死因】
→ SEER cause-specific death classification 【SEER特定原因死亡分类】
→ Survival months 【生存月数】

3.不同时间周期的数据如何获取?
部分数据根据诊断存在不同变量中
例:肿瘤大小随年份不同存在两个变量之中,需要全部获取


第二步:使用官方数据与工具
最佳路径:
访问SEER*Stat:进入case listing,选择table,使用find功能:查找关键词对应变量。
访问SEER官网:
https://seer.cancer.gov/analysis/
查找筛选所需变量:

第三步:确认变量细节
找到数据文件后,在进行分析前,务必仔细查阅变量文档,这是确保分析准确性的关键。
1️⃣ 查找变量定义与编码规则:
核心文档:在下载数据的页面,找到并下载最新的 “SEER Data Dictionary” 或 “Case Listing Variables” 文档。
2️⃣ 检查变量描述:
在此文档中搜索您感兴趣的变量名(如 RX_SUMM_SURG_PRIM_SITE),确保其定义与您的研究概念完全匹配。
3️⃣ 理解编码格式:
仔细查看每个代码对应的具体医学或操作含义(例如,手术代码30代表“根治性切除术”)。
4️⃣ 确认数据可用年份与版本:
SEER数据库包含多个子数据集(如SEER 9, SEER 17, SEER 22等),覆盖的年份和人群不同。
5️⃣ 注意变量变更:
许多变量(如TNM分期、治疗编码标准)会随着时间更新(例如,从AJCC 6th版变为7th版)。务必确认您所使用的变量在您选择的研究时间范围内是一致可用的,避免将不同标准的编码混合分析。
6️⃣ 特别关注:
保密规则:SEER为保护隐私,对某些变量进行了处理(如将年龄大于等于90岁的患者统一编码为90)。
未知值/缺失值编码:明确缺失值或未知值的特定编码(通常是99, 999, Blank等),并在数据分析前进行正确处理。
实战案例:寻找手术、死亡和生存时间变量
目标变量:
-
治疗变量:原发部位的手术信息
-
结局变量:死亡原因、生存时间
操作步骤:
▶ 手术变量查找:
进入SEER*Stat:点击Case Listing,进入Table,选择Therapy模块。
找到核心变量:
-
RX Summ—Surg Prim Site (1998+) 【原发部位手术代码】:记录了对原发肿瘤进行的最明确的手术操作。
-
RX Summ—Surg/Rad Seq 【手术和放疗的时序】:记录了手术和放射治疗的先后顺序。
▶ 死亡与生存变量查找:
在Table中继续寻找,进入Cause of Death(COD)and Follow-up模块。
找到核心变量:
-
Survival months 【生存月数】:从诊断到最后一次联系或死亡的月份数。这是计算生存时间的核心变量。
-
COD to site recode【根据部位编码确定死因】:导致患者死亡的部位。
-
SEER cause-specific death classification 【SEER特定原因死亡分类】:由SEER算法判断的死亡是否由所患癌症导致。这是肿瘤研究中常用的终点指标。
▶ 确认变量信息:
-
查看代码手册:在数据字典中仔细查阅上述每个变量的详细编码规则。例如,RX Summ—Surg Prim Site代码0通常代表“无手术”,30可能代表“根治性切除术”,必须根据字典进行准确解读。
-
确认数据可用性:注意这些变量在选择的SEER数据集(如SEER 17)中覆盖的诊断年份范围(例如,1975-2021),确保它们适用研究时段。
通过以上步骤,就可以精准地定位到SEER数据库中进行癌症生存分析所需的最关键的治疗和结局变量。
常见问题与解决方案
1. 变量选择与理解
常见问题场景:研究“肺癌的手术治疗”,有多个手术变量,该如何选择?
解决方案与建议:
-
优先使用通用变量:选择名称含“Summ”的标准化变量。
-
特定癌种深入研究:考虑站点特异性变量。
-
核心原则:查阅数据字典,选择最符合研究问题的变量。
2. 数据处理与分析
常见问题场景:生存时间变量中有值为0,是否正常?
解决方案与建议:
-
小数正常:由天数精确计算而来。
-
检查标记变量:结合Survival months flag使用。
-
值为0的处理:代表存活不足一个月,根据研究目的决定是否保留。
3. 数据处理与分析
常见问题场景:如何准确定义“癌症特异性死亡”?
解决方案与建议:
-
使用COD to site recode变量和SEER cause-specific death classification变量。
-
分析标准:将“死于癌症”记为事件1,“Alive”记为删失,“死于其他疾病”记为事件2。
4. 数据合并与版本
常见问题场景:TNM分期变量中途有过变化,如何处理?
解决方案与建议:
-
识别版本:数据字典会标注变量有效年份和版本。
-
分时段分析:分别使用不同版本进行分析,统一转换变量。





评论列表