在构建疾病预测模型时,研究者常面临一个基础却关键的问题:训练集和内部验证集该如何划分?常见的划分方法有 7:3、8:2 甚至 6:4,但这些比例背后有何依据?本篇公众号将结合方法学原则与实际文献案例,为您系统梳理,一起来看看吧~
为什么需要划分训练集和验证集?
在构建预测模型时,我们通常希望模型不仅能预测现有数据,而且可以估计模型未来的预测性能,为后续外部验证或实际应用提供可靠依据。为此,必须将原始数据划分为训练集和内部验证集。其中训练集用于估计模型参数,验证集用于评估模型的泛化能力。
如果不进行划分,直接用全部数据训练并报告性能,模型很可能出现过拟合的情况。这种结果会导致模型在真实临床或公共卫生场景中失效,甚至产生误导性决策。因此,划分训练集和验证集至关重要。
常见划分比例
1️⃣7:3 划分训练集和验证集—最常见的划分方法
在中等样本量(1,000–5,000),7:3 可提供更可靠的验证估计,尤其当结局事件较少时。
优点:
验证评估更可靠:30% 的验证集提供了更大的样本数,有助于更稳定地估计模型性能指标,尤其在事件发生率较低时,能降低因小样本验证导致的评估偏差或方差。
对模型过拟合更具敏感性:较大的验证集能更真实地反映模型在新数据上的表现。
平衡实用性与稳健性:相比 8:2,它在不过度减少训练数据的前提下,提升了验证环节的可信度,适合资源有限但需保证评估质量的科研场景。
缺点:
训练信息相对受限:在样本总量不充足的情况下,可能限制复杂模型的表达能力,增加欠拟合风险。
受单次划分随机性影响:7:3 划分的结果可能因抽样波动而不够稳健;若条件允许,建议辅以重复随机划分或交叉验证以增强结论可靠性。
不解决根本性小样本问题:当总样本量接近下限(如 n≈1,000)且事件数极少(如 <100)时,即使 30% 的验证集也可能无法充分代表目标人群,此时应优先考虑交叉验证或 Bootstrap 方法。
案例文章一:

标题:Associations between metabolic-inflammatory biomarkers and Helicobacter pylori infection: an interpretable machine learning prediction approach
概要:该研究利用可解读的机器学习模型,研究代谢炎症标志物与幽门螺旋杆菌(HP)感染之间的关联,重点关注甘油三酯-葡萄糖(TyG)指数、TyG/HDL-C 比值及系统性炎症生物标志物。 分析了来自 2924 名 NHANES 参与者和吉林大学第二医院 1021 名患者的数据。通过多变量回归评估代谢-炎症标志物与 HP 之间的关联。比较了 11 个机器学习模型的预测性能,评估标准包括 AUC、准确性、敏感度、特异性、精度、F1 评分和 Kappa 统计量。可解释性通过 SHAP 值、校准图、混淆矩阵和决策曲线分析评估。
划分方法:NHANES 数据集被分为 70%训练集和 30% 测试集,采用分层抽样以保证结果分布。
案例文章二:

标题:Transcultural prediction model for late-life depression based on multi-cohort machine learning and explainable AI
概要:协调了健康与退休研究(HRS,n = 6865)和中国健康与退休纵向研究(CHARLS,n = 4476)针对 ≥60 岁成年人的数据。抑郁症在两个队列中均使用经过验证的量表进行评估。特征选择使用了 Boruta 算法。评估了 17 种机器学习算法,HRS 数据分为训练(70%)和内部验证(30%),以及用于外部验证的 CHARLS 数据。模型表现通过 AUC、决策曲线分析、校准图和 SHapley 加法解释(SHAP)进行评估。
划分方法:HRS 数据集按抑郁状态分层,分为训练集(70%)和测试集(30%),而 CHARLS 数据集则作为外部验证队列。为确保模型开发稳健,采用了重复 5 次的 10 折交叉验证,所有模型均针对受试者工作特征曲线(AUC)下的面积进行了优化。对于需要超参数优化的模型,实现了网格搜索以识别最优配置。
2️⃣8:2 划分训练集和验证集——适用于大样本
当数据量充足(通常 >5,000 样本),8:2 能兼顾模型学习能力和验证稳定性。
优点:
模型训练充分:80% 的数据为模型提供了足够的信息量,有助于复杂算法充分学习特征与结局之间的关联。
验证结果相对稳定:20% 的验证集通常包含足够多的样本,能提供对模型泛化性能较为可靠的估计,减少因验证集过小导致的评估波动。
实现简单、解释直观:相比交叉验证,单次划分计算成本低,流程透明,便于快速迭代和结果复现。
缺点:
不适用于小样本事件:当总样本量有限或结局事件罕见时,20% 的验证集可能无法代表整体分布。
不适用时间序列预测:在趋势建模中,应采用时间顺序分割,而非随机 8:2 划分。
案例文章一:

标题:Development and validation of a deep learning-based survival prediction model for pediatric glioma patients: A retrospective study using the SEER database and Chinese data
概要:开发一个时间依赖的深度学习模型,准确预测儿科胶质瘤患者的预后,帮助临床医生做出精确的治疗决策并降低患者风险。该研究共纳入 9532 名儿科胶质瘤患者,其中 9274 名来自 SEER 数据库,258 名来自中国唐都医院的患者。训练时,选择了两种基于神经网络的算法(DeepSurv,神经多任务逻辑回归)和一种基于集合学习的算法(随机生存森林)。此外,还开发了一个多变量 Cox 比例危害模型用于比较。SEER 数据集被随机分为 80%用于训练,20%用于验证,而唐都医院数据集则作为外部验证队列。超参数通过 1000 次重复随机搜索和对训练队列的 5 倍交叉验证进行了调整。模型表现采用了C 指数、Brier 评分和综合 Brier 评分进行评估。
划分方法:SEER 数据集被随机分为 80% 用于训练,20% 用于验证。
案例文章二:

标题:Development and validation of an interpretable machine learning model for predicting hyperuricemia risk: Based on environmental chemical exposure
概要:高尿酸血症是全球性的健康问题,环境化学物质是风险因素。该研究利用 2011-2012 年国家健康与营养检查调查(NHANES)周期中多次环境化学物质暴露的数据,开发了一个可解释的高尿酸血症风险预测机器学习模型。采用最小绝对收缩与选择算子(LASSO)回归法来选择相关变量。数据集分为训练组(80%)和测试组(20%),构建了六个机器学习模型,包括随机森林(RF)、高斯朴素贝叶斯(GNB)、光梯度增强(LGB)、极端梯度增强(XGB)、自适应增强分类器(AB)和支持向量机(SVM)。该研究发现 2011-2012 年 NHANES 周期中高尿酸血症的患病率为 20.58%,与之前的研究一致。
划分方法:NHANES 数据集被随机分为 80% 用于训练,20% 用于验证。为解决训练数据中高尿酸血症组与非高尿酸血症组的类别不平衡,对训练集应用了合成少数过采样技术(SMOTE)和 SMOTE-Tomek 的结合方法。
3️⃣6:4 划分训练集和验证集——相对少见
将数据按 6:4 的比例划分,是一种相对少见但有特定价值的策略,通常用于对模型评估稳定性要求较高、而对模型复杂度要求相对较低的场景。
适用场景:
-
样本量中等偏小,且研究重点在于可靠评估模型性能而非追求极致预测精度;
-
结局事件分布不均衡(如罕见病、低发病率结局),需更大验证集以确保各类别在验证集中有足够代表;
-
模型本身较简单,对训练数据量需求不高,但需避免因验证集过小导致性能估计失真。
优点:
验证结果高度稳健:40% 的验证集显著降低了性能指标的抽样变异,尤其在事件数有限时,能提供更可信的泛化能力估计。
提升研究可信度:较大的验证集减少了因偶然性导致模型表现被高估的可能性,提升研究结论的可信度。
便于敏感性分析:充足的验证样本支持按亚组进一步评估模型一致性。
缺点:
训练数据明显受限:仅 60% 的数据用于建模,在样本总量有限时,可能削弱模型的学习能力,尤其不利于参数较多或非线性关系复杂的机器学习算法,易导致欠拟合。
案例文章:

标题:Environment-wide association study of cardiovascular and all-cause mortality: Analysis of the National Health and Nutrition Examination Survey, 1999-2018
概要:环境有毒物质越来越多地被怀疑影响心血管和全因死亡率,但此前的研究主要集中在一种或少数几种化学物质上。该研究基于国家健康与营养调查(1999-2018)的数据,分析多种环境化学物质与心血管疾病及全因死亡率的关联,以及炎症在这些关联中的潜在介导作用。
划分方法:NHANES 数据被随机分配,比例为 6:4 分为训练集和测试集。
结论
在公共数据库中,对训练集与验证集的划分比例不是一成不变的,而是研究目标、数据规模、结局特征与模型复杂度共同作用下的权衡结果。当你采用大数据库(如 SEER、NHANES 全周期)时,8:2 是高效且稳健的选择,而面对中等规模队列(如 1,000–5,000 人)或事件相对少的情况,7:3 是最适合且最常用的划分方法,此外,6:4 的划分比例也可以发挥独特的价值。





评论列表