这节课将由统计之光金牌讲师王老师,揭示肿瘤生信的标准流程,带领大家零基础“通关”肿瘤生信分析!
1.数据获取:测序与基因芯片
🟡RNA-seq(转录组测序):
优势:覆盖全转录组、可发现新转录本、检测低丰度基因
应用:适用于探索未知突变/融合基因(如TCGA数据)
🟡基因芯片:
优势:成本低、批次效应易校正(适合验证研究)
缺陷:仅检测已知探针(可能漏掉重要新基因)
⚠️ 新手建议:优先使用GEO数据库中已标准化的芯片数据
2.差异分析:转录组测序生信分析的起点
通过统计学方法筛选肿瘤组vs正常组的差异基因(DEGs),是后续所有分析的基石。
🟡差异基因筛选:
工具选择:RNA-seq用 DESeq2/edgeR/limma,芯片用 limma
阈值设定:|log2FC|>1且 FDR<0.05(避免假阳性)
可视化:火山图(标注关键基因)、热图(聚类样本)
区分肿瘤与正常组织:TCGA数据需合并GTEx正常样本
3.WGCNA分析:挖掘共表达网络
这一步主要是将数千个基因聚类成模块,找出与临床特征(如TNM分期、转移状态)强相关的基因网络。比如:
寻找与免疫浸润(如ESTIMATE评分)相关的基因模块
联合生存分析筛选关键模块(如蓝色模块与OS显著相关)
4.GO、KEGG富集分析:
功能解析黄金组合

对于零基础的同学来说,只需要记住关键的富集分析解读点:
🟡GO富集:回答"差异基因在哪些生物学过程/细胞组分/分子功能中富集?"
🟡KEGG通路:揭示"这些基因参与哪些已知信号通路?"
5.单因素COX分析及lasso回归:
构建预后模型的利刃
🟡单因素COX初筛:从差异基因中筛选与生存显著相关的基因(p<0.05)
🟡LASSO回归降维:解决多重共线性问题,选择最优基因组合
⭕肿瘤特异性要点
1、必须校正临床混杂因素(年龄、分期等),避免假阳性;
2、注意随访时间不足导致的右删失(建议中位随访时间>3年)。
6.预后模型与生存分析:
从数据到临床价值的转化
在预后模型构建过程中,是把我们的分析数据转化为具有临床应用价值的过程。我们需要优化筛选目标基因,计算每个样本的风险评分,并基于此构建模型,同时用ROC曲线评估模型。
除此之外,除此之外,还需要注意进行模型的验证。
🟡内部验证:样本量大的前提下,将数据集分为训练集与验证集,用训练集构建模型,用验证集来验证模型。
🟡外部验证:另外找一组数据集(公共数据库,或自己测序),对模型进行验证。
详情添加班主任咨询👇


会员专享课程资料
开通会员后,可免费下载本课程资料
课程评论