3区期刊的CHARLS研究定位
✅ 变量独特且多样:采用复合指标或量表计算评分得到新指标,突破单一指标的局限性,捕捉变量的复杂性和动态性,提供更精准的 “测量工具”。
✅ 方法基础但多样:虽然多采用常用的回归分析(logistic或COX),但也使用多种有效的高级统计分析方法来拓展分析维度,挖掘数据价值。
✅ 核心方法:
-
描述及关联性分析(包括基线信息统计、logistic回归分析、COX比例风险回归分析等);
-
高级模型(包括预测模型的构建和评估、中介效应分析等);
-
充分的亚组分析和敏感性分析。
工作量框架与5篇案例对照

典型工作量拆解
案例一:

文章标题:Association between Triglyceride-glucose index and sarcopenia in China: A nationally representative cohort study
1️⃣ 数据准备
确定使用数据波次:2011为基线数据,2013、2015年为随访数据(n=17,705 → 最终纳入1,819)
评估暴露变量甘油三酯-葡萄糖指数(TyG)= Ln[甘油三酯(mg/dL) × 葡萄糖(mg/dL)/2]
计算中介变量体重质量指数:BMI=体重(kg)/身高(m)2
2️⃣ 统计分析
主分析:多因素COX回归+RCS曲线
高级分析:
-
ROC曲线评价暴露变量对因变量的预测价值
-
中介效应分析评估中介变量对暴露变量与因变量间关联的影响
3️⃣ 结果呈现
表2 COX比例风险模型:探索TyG指数与肌肉减少症及其成分之间的关联

图3 RCS曲线:探索TyG指数与肌肉减少症之间的剂量反应关系并检验是否存在非线性效应

图4 ROC曲线:评估TyG指数对肌肉减少症的预测价值

图5 亚组分析:评估不同人群中 TyG指数与肌肉减少症之间的关联

图6 中介效应分析:评估BMI在影响TyG与肌肉减少症之间效应的中间作用

附录:
表1:不同TyG分层时的基线特征
表2:变量共线性检验
图1、图2:COX回归比例风险检验
案例二:

文章标题:C-reactive protein-triglyceride glucose index predicts stroke incidence in a hypertensive population: a national cohort study
1️⃣ 数据准备
选择CHARLS数据库完成2011血检人群(n=11,847 → 最终纳入3,834)
计算暴露变量:C反应蛋白-甘油三酯-葡萄糖指数 (CTI)
2️⃣ 统计分析
主分析:COX回归+Kaplan-Meier生存曲线
高级分析:
-
Boruta算法评价变量重要性,筛选特征变量
-
ROC曲线评价预测模型性能和价值
3️⃣ 结果呈现
表2 COX回归:探索高血压人群中CTI与中风的关系

图2 RCS曲线:研究CTI与中风风险之间的趋势和剂量反应关系

图3 亚组分析:不同组人群中CTI与中风风险之间的关联

图4 Boruta算法:评估高血压患者卒中风险相关变量,筛选能作为预测因子的变量

图5 ROC曲线:不同机器学习模型的预测性能比较

附录:
表1:变量多重共线性结果
表2:按CTI分组时人群的基线特征
表3:基于Boruta算法的CTI与脑卒中关系的多因素Cox回归分析
表4、表5:敏感性分析
图1:Kaplan-Meier生存曲线结果
案例三:

文章标题:Interaction effects of sleep duration and activities of daily living on depressive symptoms among Chinese middle-aged and older adult individuals: evidence from the CHARLS
1️⃣ 数据准备
选择CHARLS数据库中2020年数据(n=19,395→ 最终纳入15,511)
评估睡眠时长和ADL:ADL通过12个条目量表进行评估
2️⃣ 统计分析
主分析:二元logistic回归
高级分析:交互作用分析探索睡眠时长和ADL之间的交互作用,包括超额风险、归因比例、协同系数等
3️⃣ 结果呈现
表2 logistic回归:探索睡眠时长和ADL与抑郁症状之间的关联

表3、4 交互作用分析:探索短睡眠时长和ADL(表3)、长睡眠时长和ADL(表4)的不同情况下与抑郁症状之间的关联


附录:
表1、2、3、4:亚组分析结果(不同性别、年龄分别在短睡眠时长和ADL以及长睡眠时长和ADL对抑郁症状的交互作用)
表5:敏感性分析结果
案例四:

文章标题:Relationship between estimated pulse wave velocity trajectories and cardiovascular disease risk in patients with cardiovascular-kidney-metabolic syndrome stages 0-3
1️⃣ 数据准备
选择CHARLS数据库2011年数据(n=17,705 → 最终纳入6,788)
评估暴露变量:脉搏波速度(ePWV),并计算轨迹
2️⃣ 统计分析
主分析:COX回归+轨迹建模
高级分析:NRI和IDI值评估基本模型之外的风险重新分类的改进
3️⃣ 结果呈现
表2 COX回归:探索ePWV与心血管系统疾病之间的关联

表3 ROC、NRI和IDI结果:ePWV 轨迹和基线ePWV对心血管系统分类的影响

图2 轨迹建模:ePWV的轨迹曲线

图3 ROC曲线:加入ePWV基线和ePWV轨迹时的预测模型性能

附录:
表1:研究人群的纳入排除结果
表2:缺失数据详细记录
表3:方差膨胀因子多重共线性结果
表4、表5:ePWV轨迹模型选择方式和最大似然比
表6:亚组分析结果
表7、8、9、10:敏感性分析结果
案例五:

文章标题:Heterogeneous effects of socio-economic status on social engagement level among Chinese older adults: evidence from CHARLS 2020
1️⃣ 数据准备
选择CHARLS数据库2020年数据(n=19,395 → 最终纳入9,533)
评估暴露变量社会经济地位:由教育、收入和职业决定,使用评分来确定
2️⃣ 统计分析
主分析:Heckman两阶段模型
高级分析:异质性分析,以探究社会经济地位对亚组不同老年人社会参与度的影响
3️⃣ 结果呈现
表2 Heckman两阶段模型:探索社会经济地位对与社会参与度之间的关联,并检验其他变量对社会参与度造成的影响

表3、4、5、6、7异质性分析:探索不同亚组人群中社会经济地位与社会参与度之间的关联








评论列表