“我们收集了300例样本,能做机器学习预测模型吗?”
这是许多临床研究者面临的现实问题。传统观念认为,机器学习需要“大数据”才能训练出好模型,但现实中高质量临床数据获取困难,样本量有限,尤其是临床队列或单中心研究中样本量更有限。好消息是:数据少不代表不能做机器学习!关键在于采用正确的策略和方法。
套路总结
小样本机器学习的3个核心原则
即使数据量有限,仍然可以利用机器学习构建准确预测模型,关键是避免过拟合。常用策略包括:
1️⃣ 合理选择算法:轻量级模型优于深度模型
避免盲目使用深度学习(神经网络);
首选基于集成和正则化的算法:
-
LASSO回归
-
随机森林(RF)
-
XGBoost/LightGBM
-
支持向量机(SVM)
2️⃣ 特征工程与降维:减少噪音变量
-
使用相关性分析、方差分析过滤无关变量;
-
LASSO、Boruta或PCA主成分分析,降低维度,防止“维度灾难”。
3️⃣ 模型评估与验证:交叉验证增加模型可信度
-
K折交叉验证代替单一划分;
-
可选Bootstrap重采样增强模型稳定性;
-
多维度报告模型评估指标:AUC、敏感度、特异度、DCA、校准曲线。
案例解析
公共数据库如何做“机器学习+小样本预测”?
案例一:MIMIC-IV数据库中危重系统性红斑狼疮患者死亡风险的预测

样本量:MIMIC-IV数据库中被诊断为系统性红斑狼疮(SLE )、年龄在18岁及以上、首次入院的危重患者共395名,另收集本地医院100例SLE患者作为外部验证。
建模策略:
-
特征选择:LASSO筛选变量,剔除冗余特征;
-
数据增强:采用SMOTEENN算法(SMOTE和ENN算法的高级混合体)解决类别不平衡问题;
-
模型选择:XGBoost、LightGBM、Naive Bayes、RF、SVM;
-
基于两个或多个机器学习模型的堆叠集成模型进一步提升预测性能。
亮点:
-
比较原始数据和重采样平衡后数据所构建模型的预测性能,证明在非平衡数据上进行适当处理可以提升预测性能;
-
比较基于逻辑回归的传统列线图和采用堆叠集成方法的机器学习模型,全面评估模型性能;
-
使用SHAP算法解释机器学习模型,明确关键特征及其对结局的影响。
案例二:SEER数据库中乳腺浸润性微状癌患者预后的预测

样本量:本地医院作为训练和验证(1年队列281例,5年队列165例),SEER中514例患者数据作为外部验证。
建模策略:
-
特征选择:结合卡方检验结果和Cox回归结果筛选变量;
-
模型选择:Logistic regression、RF。
亮点:
-
分别对1年队列和5年队列进行建模,识别短期和长期预后的不同预测因子;
-
比较基于逻辑回归模型和机器学习模型,全面评估模型性能。
案例三:CHARLS数据库中膝骨关节炎患者抑郁症状的预测

样本量:CHARLS数据库中496名参与者作为训练和验证,美国OAI队列中1115名参与者作为外部验证。
建模策略:
-
特征选择:文献综述筛选已被证明的重要预测变量,LASSO进一步筛选;
-
模型选择:Logistic regression、RF、决策树、人工神经网络。
亮点:
-
跨人群队列验证模型泛化性能;
-
多种模型综合比较,多指标全面评估模型性能。
总结
数据量不是绝对限制,只要控制过拟合风险、注重特征工程和模型选择,小样本数据依然可以构建有价值的机器学习模型。





评论列表