UKB数据库的数据结构解读

官方
阅读 42 0 收藏 0 2025-04-26 19:00:00

引言
 
 
 
 

英国生物银行(UK Biobank, UKB)作为全球最大规模的生物医学数据库之一,其数据维度之广、深度之复杂堪称科研界的“百宝箱”。截至2025年,UKB已整合50万参与者的基因组、影像学、生活方式、电子健康记录等多源数据,并持续更新随访信息。

UKB数据的获取流程比较繁琐,需要在UKB官网:

https://www.ukbiobank.ac.uk/,进行注册和权限申请,通过提交项目申请表确定研究内容以及需要的数据(不同数据对应不同的收费标准),审核通过并完成付款后即可通过RAP平台下载数据。

 
 
UKB的数据结构
 

UKB数据库所涵盖的数据可以分为以下五类:

 

1.基因组数据 

• 基因分型:使用Affymetrix UK BiLEVE和UK Biobank Axiom芯片对约50万参与者进行了分型,覆盖约82万个SNP位点。

• 全基因组测序:已有20万余参与者完成高覆盖WGS,可用于稀有变异与结构变异研究。

 2.检查与问卷数据 

• 问卷数据:难以通过常规健康记录评估的一系列暴露和健康结果的数据,包括饮食、食物偏好、工作史、疼痛、认知功能、消化健康和心理健康。
• 现场临床检测提供血压、肺功能、认知测试和DXA骨密度测量等数据。

 3.生物标志物数据 

• 常规生化:血液和尿液中包含30余项生化指标,如肝肾功能、血脂和血糖等。
• 蛋白质组学:使用Olink平台测量超5,000种血浆蛋白,支持生物标志物发现与药物靶点研发。

 4.影像组学 

• 多模态MRI:脑、心脏及腹部MRI,以及全身DXA骨密度扫描,为影像组学和AI分析提供基础数据。
• OCT与眼底照相:视网膜厚度与视神经结构数据支持眼科与神经研究。

 5.算法化结局与记录链接 

• UKB生成870余种“算法化结局”字段,通过综合自报、门诊/住院及死亡记录,提供疾病首次发生时间等关键信息。
• 数据库持续与NHS电子健康系统对接,实现心血管事件和癌症登记等长期随访与实时更新。

 

在UKB官网上可以查看数据结构及所包含的字段(如下图所示),UKB数据库中所有信息被组织为多个“主类目(Primary Category)”,每一类目下包含不同数量的数据字段(Data-fields),用于表示具体测量值、问卷选项或健康结局信息。主类目结构清晰,覆盖临床医学、基因组、影像学、心理行为、生活方式等关键研究维度。


评论列表

发表评论