Meta分析评价结局指标采用了完全不同的量表,判断异常的标准也不同,怎么分析?

官方
阅读 36 1 收藏 1 2026-01-10 10:01:00

临床场景

假设你在做一个干预措施对“抑郁症状”影响的 Meta 分析:

研究 A:用 HAMD 量表(0–54 分),告诉你干预组 vs 对照组的均值±标准差。

研究 B:用 PHQ9 量表(0–27 分),也给你均值±标准差。

研究 C:干脆没报连续量表,只报了“抑郁症状显著改善”的“是/否”,而且“显著改善”的定义还各不相同:

  • 有的定义为“HAMD 下降 ≥50%”

  • 有的定义为“PHQ9 下降 ≥5 分”

  • 有的定义为“不再满足诊断标准”

结局看起来都是“抑郁改善”,但:

图片量表不一样(分数范围、含义都不一样);

图片“异常/有效”的判断标准也不一样(不同 cutoff、不同定义)。

这个时候,Meta 分析到底该怎么做?

先搞清楚:结局类型+是否可“统一语言”

处理不同量表、不同异常标准的关键,先看结局本身是什么“类型”、能不能“翻译成同一种指标”。

大致有两种常见情况:

1️⃣ 连续结局:同一个概念,但量表不同

例如:抑郁严重程度用不同量表(HAMD、MADRS、PHQ9 等),都是连续分数,只是量纲不同。

2️⃣ 分类结局:同一个概念,但“异常/有效”的判据不同

例如:都是“有无严重抑郁”,但:

  • 研究 A:诊断标准为 DSM5 + PHQ9 ≥15

  • 研究 B:诊断标准为 ICD10 + HAMD ≥20

或者,同样是“治疗有效”:

  • 有的用“症状减分 ≥50%”

  • 有的用“不再满足诊断标准”

接下来,我们将详细探讨每种情况的具体解决思路。

连续结局:量表不一样,怎么合?

典型场景:不同研究用了不同量表测量同一个连续结局,比如抑郁、疼痛、生活质量等。

▶ 能用“均差(MD)”吗?

  • 只有当所有研究使用的是“同一个量表/统一量纲”,才能直接用均差(MD)合并,比如大家都用 PHQ9、量表版本也一样。

  • 一旦量表不同,MD 就像在用“人民币 + 美元 + 日元”直接加总,是没有意义的。

▶ 标准解法:标准化均差(SMD)

当不同研究用“不同但相关”的量表,测量同一个概念(比如抑郁严重程度)时,最常用的做法是使用“标准化均差(SMD)”,有时也叫 Hedges’ g 或 Cohen’s d。思路是:

  • 把每个研究的效应大小(均值差异)除以该研究的标准差(或合并标准差),得到一个“无量纲”的效应值。

  • 不同量表的效应值都转换成了“以标准差为单位”的统一语言,就可以合并了。

Cochrane 手册以及多篇方法学论文都建议:当同一结局使用不同测量工具时,应优先采用 SMD 进行合并。(Murad MH, Wang Z, Chu H, Lin L. When continuous outcomes are measured using different scales: guide for meta-analysis and interpretation. BMJ. 2019 Jan 22;364:k4817. doi: 10.1136/bmj.k4817. PMID: 30670455; PMCID: PMC6890471.)

实操步骤:

对每项研究:

  • 计算干预组与对照组的均值差:MD = M1 − M2

  • 找到(或推算)该研究的标准差(SD),或者合并标准差(SD_pooled)

  • 计算 SMD = MD / SD_pooled,就可以直接将每项研究的 SMD 进行合并。

或者直接在 Meta 分析软件(如 RevMan、R 中的 meta 包、Stata 的 metan 等)中:

  • 把每项研究的干预组与对照组均值、标准差输入进去。

  • 选择效应指标为“SMD” ,就可以做森林图了。

怎么解释 SMD?

常用经验(供读者理解,不是严格“官方标准”):

  • SMD ≈ 0.2:小效应

  • SMD ≈ 0.5:中等效应

  • SMD ≈ 0.8:大效应

更准确的做法是结合临床意义与领域已有研究来解释这个大小。

哪些情况不适合强用 SMD?

不同量表虽然名字相似,但测量的是“不太一样的构念”(比如一个测“抑郁严重程度”,一个测“生活质量”),这时勉强合并要特别谨慎。

量表之间相关度很低、临床意义差别很大,可能要考虑:

  • 只合并“概念相近”的亚组

  • 或干脆不做定量合并,只做定性描述。

分类结局:

判断“异常/有效”的标准不一样,怎么办?

这时候常见的场景是:大家都在报“有无异常”“有无治愈/有效”,但:

  • 诊断标准/诊断工具不同;

  • 定义“异常”的 cutoff 不同;

  • 定义“有效”的阈值不同(例如减分 ≥30% 还是 ≥50%)。

1. 先问自己:这些“异常/有效”是不是“同一类东西”?

关键在于:不同研究给出的二分类结局,是否指向临床上同一个概念?

例如:都是“是否有重度抑郁事件”,只是用了不同量表或诊断标准。

这种情况下,可以认为它们测量的是同一类事件,只是工具/阈值有差异。

如果不同研究的“有效”定义差异大到“临床含义不一样”(比如一个是“完全缓解”,一个是“轻微改善”),那么硬合并就很有问题,这时候可能更适合:

  • 只合并“临床含义相近”的研究做亚组分析;

  • 或分开报告,做定性描述。

2. 若概念相似:用“相对效应(RR/OR)”比绝对效应更稳妥

当不同研究对“异常/有效”的判据不同,但测量的是同一个事件,方法学上常建议:

优先采用相对效应指标(如风险比 RR、比值比 OR),而不是绝对效应(如风险差 RD)。

理由:

  • RR/OR 反映的是“干预组相对于对照组的事件发生概率是几倍”,在 cutoff 不同时通常更稳定。

  • RD(风险差)直接受基线事件率影响很大,而基线事件率又受 cutoff 选择影响,所以不适合在 cutoff 差异较大的研究中直接合并。

实操建议:

① 从每项研究中提取 2×2 表:

  • 干预组:事件发生数 / 总人数

  • 对照组:事件发生数 / 总人数

② 选择合适的效应指标:

  • RR:更直观,适合罕见或常见事件都还行;

  • OR:在 Logistic 回归、病例对照研究等中常见;

③ 在软件中按 RR 或 OR 做 Meta 分析。

3. cutoff 不同导致基线率差异很大时,注意异质性

不同诊断 cutoff 会直接改变“谁算异常”,因此:

  • 各研究的对照组事件率可能差别很大;

  • RR/OR 也会受到一定影响,导致异质性增加。

处理建议:

事先制定“纳入标准”,规定只纳入临床上含义相近的定义;

按不同 cutoff 或不同定义做亚组分析,看看结果是否稳健;

若异质性过高且无法用亚组解释,可能需要:

  • 放弃定量合并,改做定性描述;

  • 或者只合并“严格定义”的亚组,其他研究做补充说明。

4. 有些特殊场景:可尝试“重新统一标准”

这是比较“理想化”的做法,但有些原始研究给出了足够详细的数据,允许你:

使用同一套标准重新划分“正常/异常”或“有效/无效”人群;

例如:原研究同时报告了量表均值和标准差,你可以按统一 cutoff(比如 PHQ9 ≥10)算出各组“异常人数”,再重新算 RR/OR。

当然,前提是:

  • 原文给出了足够的数据(如分布、百分位数等);

  • 重新定义的标准与原始研究设计不冲突。

现实中,这种操作很难对所有研究都做到,更多只能用于部分研究。

获取原始数据或进行敏感性分析

如果可能,联系原作者获取:

  • 个体参与者数据(IPD)

  • 不同截断值下的数据

  • 量表的原始得分分布

检验结果是否稳健:

  • 排除使用非标准量表的研究

  • 排除使用非标准异常标准的研究

  • 使用不同效应量统计方法比较结果一致性

实用小贴士

图片连续结局 + 不同量表:

  • 首选 SMD(Hedges’ g 或 Cohen’s d),不要直接用 MD;

  • 合并时要注意量表测量的是否为同一构念,相关性如何;

  • 解读时可参考常见 SMD 大小划分(0.2/0.5/0.8),但最好结合本领域的标准解释。

图片二分类结局 + 不同 cutoff/ 定义:

  • 先确认它们是不是“同一类事件”;

  • 若是,优先采用 RR 或 OR 这样的相对效应指标;

  • 若不同 cutoff 差异很大,最好按不同标准做亚组分析,或者只做定性描述,不要强行合。

图片异质性和敏感性分析很重要:

每当存在量表或标准差异,异质性几乎一定会高;

记得:

  • 做亚组分析(按量表类型、按 cutoff 等);

  • 做敏感性分析(剔除极端研究、只合并“同质性较好”的子集);

  • 结果有矛盾时要诚实写清楚,而不是只报告“好看的”那个。

图片写作时要写得“看得懂”:

不要在文章里堆公式;

多用类比,少用专业术语;

对读者重点讲清楚三个问题:

  • 为什么要用 SMD(而不是 MD);

  • 为什么要用 RR(而不是 RD);

  • 什么时候“不能合”,只能分或描述。

Meta 分析里,比“会算”更重要的是“会想”

面对“量表不同、异常标准不同”的结局:

技术上,我们有 SMD、有 RR/OR 等工具可以“统一语言”;

但更关键的是,你要先想清楚:

  • 这些结局是不是在说“同一件事”;

  • 统一了指标之后,合出来的结果,临床意义还能解释吗


评论列表

发表评论