临床场景
假设你在做一个干预措施对“抑郁症状”影响的 Meta 分析:
研究 A:用 HAMD 量表(0–54 分),告诉你干预组 vs 对照组的均值±标准差。
研究 B:用 PHQ9 量表(0–27 分),也给你均值±标准差。
研究 C:干脆没报连续量表,只报了“抑郁症状显著改善”的“是/否”,而且“显著改善”的定义还各不相同:
-
有的定义为“HAMD 下降 ≥50%”
-
有的定义为“PHQ9 下降 ≥5 分”
-
有的定义为“不再满足诊断标准”
结局看起来都是“抑郁改善”,但:
量表不一样(分数范围、含义都不一样);
“异常/有效”的判断标准也不一样(不同 cutoff、不同定义)。
这个时候,Meta 分析到底该怎么做?
先搞清楚:结局类型+是否可“统一语言”
处理不同量表、不同异常标准的关键,先看结局本身是什么“类型”、能不能“翻译成同一种指标”。
大致有两种常见情况:
1️⃣ 连续结局:同一个概念,但量表不同
例如:抑郁严重程度用不同量表(HAMD、MADRS、PHQ9 等),都是连续分数,只是量纲不同。
2️⃣ 分类结局:同一个概念,但“异常/有效”的判据不同
例如:都是“有无严重抑郁”,但:
-
研究 A:诊断标准为 DSM5 + PHQ9 ≥15
-
研究 B:诊断标准为 ICD10 + HAMD ≥20
或者,同样是“治疗有效”:
-
有的用“症状减分 ≥50%”
-
有的用“不再满足诊断标准”
接下来,我们将详细探讨每种情况的具体解决思路。
连续结局:量表不一样,怎么合?
典型场景:不同研究用了不同量表测量同一个连续结局,比如抑郁、疼痛、生活质量等。
▶ 能用“均差(MD)”吗?
-
只有当所有研究使用的是“同一个量表/统一量纲”,才能直接用均差(MD)合并,比如大家都用 PHQ9、量表版本也一样。
-
一旦量表不同,MD 就像在用“人民币 + 美元 + 日元”直接加总,是没有意义的。
▶ 标准解法:标准化均差(SMD)
当不同研究用“不同但相关”的量表,测量同一个概念(比如抑郁严重程度)时,最常用的做法是使用“标准化均差(SMD)”,有时也叫 Hedges’ g 或 Cohen’s d。思路是:
-
把每个研究的效应大小(均值差异)除以该研究的标准差(或合并标准差),得到一个“无量纲”的效应值。
-
不同量表的效应值都转换成了“以标准差为单位”的统一语言,就可以合并了。
Cochrane 手册以及多篇方法学论文都建议:当同一结局使用不同测量工具时,应优先采用 SMD 进行合并。(Murad MH, Wang Z, Chu H, Lin L. When continuous outcomes are measured using different scales: guide for meta-analysis and interpretation. BMJ. 2019 Jan 22;364:k4817. doi: 10.1136/bmj.k4817. PMID: 30670455; PMCID: PMC6890471.)
实操步骤:
对每项研究:
-
计算干预组与对照组的均值差:MD = M1 − M2
-
找到(或推算)该研究的标准差(SD),或者合并标准差(SD_pooled)
-
计算 SMD = MD / SD_pooled,就可以直接将每项研究的 SMD 进行合并。
或者直接在 Meta 分析软件(如 RevMan、R 中的 meta 包、Stata 的 metan 等)中:
-
把每项研究的干预组与对照组均值、标准差输入进去。
-
选择效应指标为“SMD” ,就可以做森林图了。
怎么解释 SMD?
常用经验(供读者理解,不是严格“官方标准”):
-
SMD ≈ 0.2:小效应
-
SMD ≈ 0.5:中等效应
-
SMD ≈ 0.8:大效应
更准确的做法是结合临床意义与领域已有研究来解释这个大小。
哪些情况不适合强用 SMD?
不同量表虽然名字相似,但测量的是“不太一样的构念”(比如一个测“抑郁严重程度”,一个测“生活质量”),这时勉强合并要特别谨慎。
量表之间相关度很低、临床意义差别很大,可能要考虑:
-
只合并“概念相近”的亚组
-
或干脆不做定量合并,只做定性描述。
分类结局:
判断“异常/有效”的标准不一样,怎么办?
这时候常见的场景是:大家都在报“有无异常”“有无治愈/有效”,但:
-
诊断标准/诊断工具不同;
-
定义“异常”的 cutoff 不同;
-
定义“有效”的阈值不同(例如减分 ≥30% 还是 ≥50%)。
1. 先问自己:这些“异常/有效”是不是“同一类东西”?
关键在于:不同研究给出的二分类结局,是否指向临床上同一个概念?
例如:都是“是否有重度抑郁事件”,只是用了不同量表或诊断标准。
这种情况下,可以认为它们测量的是同一类事件,只是工具/阈值有差异。
如果不同研究的“有效”定义差异大到“临床含义不一样”(比如一个是“完全缓解”,一个是“轻微改善”),那么硬合并就很有问题,这时候可能更适合:
-
只合并“临床含义相近”的研究做亚组分析;
-
或分开报告,做定性描述。
2. 若概念相似:用“相对效应(RR/OR)”比绝对效应更稳妥
当不同研究对“异常/有效”的判据不同,但测量的是同一个事件,方法学上常建议:
优先采用相对效应指标(如风险比 RR、比值比 OR),而不是绝对效应(如风险差 RD)。
理由:
-
RR/OR 反映的是“干预组相对于对照组的事件发生概率是几倍”,在 cutoff 不同时通常更稳定。
-
RD(风险差)直接受基线事件率影响很大,而基线事件率又受 cutoff 选择影响,所以不适合在 cutoff 差异较大的研究中直接合并。
实操建议:
① 从每项研究中提取 2×2 表:
-
干预组:事件发生数 / 总人数
-
对照组:事件发生数 / 总人数
② 选择合适的效应指标:
-
RR:更直观,适合罕见或常见事件都还行;
-
OR:在 Logistic 回归、病例对照研究等中常见;
③ 在软件中按 RR 或 OR 做 Meta 分析。
3. cutoff 不同导致基线率差异很大时,注意异质性
不同诊断 cutoff 会直接改变“谁算异常”,因此:
-
各研究的对照组事件率可能差别很大;
-
RR/OR 也会受到一定影响,导致异质性增加。
处理建议:
事先制定“纳入标准”,规定只纳入临床上含义相近的定义;
按不同 cutoff 或不同定义做亚组分析,看看结果是否稳健;
若异质性过高且无法用亚组解释,可能需要:
-
放弃定量合并,改做定性描述;
-
或者只合并“严格定义”的亚组,其他研究做补充说明。
4. 有些特殊场景:可尝试“重新统一标准”
这是比较“理想化”的做法,但有些原始研究给出了足够详细的数据,允许你:
使用同一套标准重新划分“正常/异常”或“有效/无效”人群;
例如:原研究同时报告了量表均值和标准差,你可以按统一 cutoff(比如 PHQ9 ≥10)算出各组“异常人数”,再重新算 RR/OR。
当然,前提是:
-
原文给出了足够的数据(如分布、百分位数等);
-
重新定义的标准与原始研究设计不冲突。
现实中,这种操作很难对所有研究都做到,更多只能用于部分研究。
获取原始数据或进行敏感性分析
如果可能,联系原作者获取:
-
个体参与者数据(IPD)
-
不同截断值下的数据
-
量表的原始得分分布
检验结果是否稳健:
-
排除使用非标准量表的研究
-
排除使用非标准异常标准的研究
-
使用不同效应量统计方法比较结果一致性
实用小贴士
连续结局 + 不同量表:
-
首选 SMD(Hedges’ g 或 Cohen’s d),不要直接用 MD;
-
合并时要注意量表测量的是否为同一构念,相关性如何;
-
解读时可参考常见 SMD 大小划分(0.2/0.5/0.8),但最好结合本领域的标准解释。
二分类结局 + 不同 cutoff/ 定义:
-
先确认它们是不是“同一类事件”;
-
若是,优先采用 RR 或 OR 这样的相对效应指标;
-
若不同 cutoff 差异很大,最好按不同标准做亚组分析,或者只做定性描述,不要强行合。
异质性和敏感性分析很重要:
每当存在量表或标准差异,异质性几乎一定会高;
记得:
-
做亚组分析(按量表类型、按 cutoff 等);
-
做敏感性分析(剔除极端研究、只合并“同质性较好”的子集);
-
结果有矛盾时要诚实写清楚,而不是只报告“好看的”那个。
写作时要写得“看得懂”:
不要在文章里堆公式;
多用类比,少用专业术语;
对读者重点讲清楚三个问题:
-
为什么要用 SMD(而不是 MD);
-
为什么要用 RR(而不是 RD);
-
什么时候“不能合”,只能分或描述。
Meta 分析里,比“会算”更重要的是“会想”
面对“量表不同、异常标准不同”的结局:
技术上,我们有 SMD、有 RR/OR 等工具可以“统一语言”;
但更关键的是,你要先想清楚:
-
这些结局是不是在说“同一件事”;
-
统一了指标之后,合出来的结果,临床意义还能解释吗





评论列表