SEER数据库的数据结构解读

官方
阅读 29 0 收藏 0 2025-04-24 19:01:00

什么是SEER数据库?
 

SEER数据库全称为:NATIONAL CANCER INSTITUTE The Surveillance, Epidemiology, and End Results Program,即美国国家癌症研究所用来监测,统计流行病学和最终结果的癌症数据库。

官方网址:https://seer.cancer.gov/

 

SEER数据库包含了来自各个州的注册癌症患者的信息,其中包括患者的人口学特征(如年龄、性别、种族)、癌症类型、诊断时间、治疗方法和生存状况等。这些数据对于研究癌症的流行病学、病因学、诊断和治疗方面的问题非常有价值。

 
 
获取使用权限以及下载软件
 

1.获取使用权限:

2.下载软件

 
 
数据提取与导出
 

登录页面后有“Data”、“Selection”、“Table”、“Output”四个选项。

 

“Data”界面中可以选择任意你想要查阅的数据集。数据集的名字上会介绍参与此个数据集的机构数量及起始时间。大家可根据自己的需要随意选择。

选好数据集后点击“Selection”,进入下一个界面。Selection其实就是选择病例筛选的条件。

筛选条件设定好之后,点击“Table”,Tab1e是选择你需要用到的临床信息。

点击工具栏的闪电按钮(Execute)就可以下载病例数据。字典功能可以提供部分变量的含义,会提供相关的链接。(第四栏0utput,指的是输出文件的文件名,可以随便命名)。

最后会出现表格形式,可以将表格的数据直接复制粘贴到excel里。

数据提取出来后就可以对数据进行数据清洗和分析啦~

 

 
数据结构
 

• Age at Diagnosis与Race, Sex, Year Dx, Registry, County与Race and Age (case data only)与Dates:人口基本信息,包含患者ID、诊断年龄(Age at Diagnosis)、种族(Race)、性别(Sex)、诊断年份(Year of Diagnosis)等信息。

• Site and Morphology:记录肿瘤的原发部位(Site)和组织学类型(Histologic Type/Morphology)等信息。

• Stage:包括不同分期系统(如AJCC、SEER Summary Stage等)下的肿瘤分期信息,用于描述肿瘤的严重程度与扩展范围。

• Therapy:包括患者是否接受手术、放疗、化疗等治疗方式的详细记录。

• Site Special Data Items:根据不同肿瘤类型提供专属的临床或分子特征信息,例如乳腺癌的激素受体状态、前列腺癌的PSA值等。

• Extend of Disease:反映肿瘤原发部位局部及远处的扩展情况,包括肿瘤大小、淋巴结受累及远处转移情况。

• Multiple Primary Fields:识别患者是否存在多个原发肿瘤,并记录每个肿瘤的诊断顺序和编号。


评论列表

发表评论