近年来,有关“预后/影响因素(Prognostic Factors)”的系统综述和Meta分析数量呈爆发式增长。然而,数量的繁荣背后,质量却常常参差不齐。这些综述往往是临床决策、政策制定和实践变革的重要基石,如果结论不可靠,后果不堪设想。
就在12月22日,医学顶刊《BMJ》刊登了一篇关于“AMSTAR-PF”评估工具的重磅论文。这是首个专门针对“影响因素系统综述”开发的严格评价工具。

▲ 来源:BMJ官网
从这款工具中,我们能直接窥见顶刊对于此类研究最新的“金标准”。无论你是正准备开展相关研究,还是正在审稿,这都是一个绝佳的学习窗口。今天,我们就为大家详细拆解这套指南!
1
什么是AMSTAR-PF?
AMSTAR-PF是在著名的AMSTAR 2工具基础上,专门为预后因素(Prognostic Factor)研究量身定制的升级版。
它历经核心小组草案、外部专家反馈及三轮严格的试点测试才最终定稿。该工具包含14大领域、共19个关键问题,涵盖了从选题到结论的全过程。

▲ 来源:BMJ官网AMSTAR 2与AMSTAR-PF
的主要区别摘要及部分示例
评分规则:每个问题不再是简单的“是/否”,而是更精细地分为:
-
Yes (Y):完全符合
-
Probably Yes (PY):基本符合(虽有瑕疵但信息尚可)
-
Probably No (PN):可能不符合(信息不足或有缺陷)
-
No (N):不符合
-
Not Applicable (N/A):不适用(部分题目可选)
2
AMSTAR-PF逐条通关指南
1. 研究问题是否明确定义 (PICOTS)?
这是研究的起点。不同于干预研究的PICO,预后研究需遵循PICOTS原则:
P(Population):目标人群是谁?
I(Index factor):研究的核心影响/预后因素是什么?
C(Comparator):对照因素或其他影响因素是什么?
O(Outcome):预测的结局是什么?
T(Timing):预测的起点和随访时长是多少?
S(Setting):研究背景与医疗场景(如社区、ICU等)。
2. 试验方案是否预先注册?
透明度是防止“马后炮”的关键。
2a:是否在研究开展前在PROSPERO、BMJ Open等平台公开注册?
2b:如果实际操作偏离了计划,是否说明了理由?(若无方案,此项选N/A;若有方案但不公开,最高只能评为PN)。
3. 是否明确了纳入研究的设计类型?
-
前瞻性队列研究通常是预后研究的理想设计。
-
如果纳入了病例对照或随机试验数据,必须说明理由。
⚠避坑指南:在计算效应大小时,不同设计类型的研究建议单独进行合成,不可混为一谈。
4. 检索策略是否全面?
基本要求:至少检索两个数据库(如Medline, Embase),并提供完整的检索策略(含检索词)。
进阶要求:必须补充检索参考文献列表、灰色文献、预注册平台等。
时效性:检索时间应在文章被接受前的12个月内。
5. 筛选过程是否严谨?
-
必须由至少两名评审者独立进行“标题/摘要”筛选和“全文”筛选。
-
必须有明确的分歧解决机制(如讨论或引入第三方)。
6. 排除研究及理由是否透明?
-
对于所有阅读了全文但最终排除的研究,必须列出清单并逐一说明理由。
-
注意:排除理由不能是“结果不显著”或“偏倚风险高”,这会导致选择性偏倚。
7. 数据提取是否可靠?
7a:过程需双人独立提取,并有共识机制。
7b:提取内容需详实(包括人群特征、因素定义、结局测量、随访时间、缺失数据处理等)。
7c:高难度加分项——如果原始研究未直接报告效应量(HR/OR),综述作者是否采用了恰当的方法(如通过P值或生存曲线)自行推算?
8. 偏倚风险评估(核心关键点!)
这是评价一篇综述质量的“灵魂”。
8a:过程需双人独立评估。
8b:是否使用了专门针对预后研究的工具(推荐QUIPS工具)?重点考察以下维度:
✅ 研究参与者:样本是否具有代表性?
✅ 研究流失:失访是否导致了系统性差异?
✅ 影响因素测量:测量是否准确、一致?
✅ 结局测量:结局定义是否客观?
✅ 混杂因素调整:是否考虑了其他已知的重要预后因素?(这是预后研究中最易出错的地方!)
✅ 统计分析:模型选择是否恰当(比如是否过度拟合)?
9. 数据合成与Meta分析
9a(可解释性):如果原始研究的定义、时间点、调整因素差异巨大,切勿强行合并!
9b(统计方法):若进行Meta分析,是否使用了随机效应模型?是否量化了异质性(如报告tau2或预测区间)?
10. 是否探讨了“小样本研究效应”?
-
不仅仅是发表偏倚,还要考虑小样本研究是否因设计质量导致结果虚高。
-
应评估漏斗图不对称性或使用Egger’s test(注:若纳入研究少于10篇,检验效能不足,需在文中说明)。
11&12. 结果讨论:偏倚与异质性
偏倚讨论:不仅要看整体结果,还要讨论纳入研究的质量如何影响结论(如:仅看高质量研究,结论是否改变?)。
异质性讨论:除了看i2数据,更要从临床角度(人群差异、定义不同)探讨异质性的来源。
13. 利益冲突 (COI)
不仅要报告综述作者的COI,还要报告纳入的原始研究的资金来源,防止商业赞助导致的偏差。
14. 证据确定性分级
-
必须对关键发现的“确定性/可信度”进行评级。
-
推荐使用 GRADE 框架(虽然GRADE在预后领域的指南尚在完善中,但仍需参照现有标准进行调整和评估)。
3
总结:如何给出整体评级?
做完上述19道题后,AMSTAR-PF建议将综述整体质量分为四个等级。但这不是简单的算术题,而是基于严重程度的综合判断:
1️⃣High(高质量):
-
几乎没有缺陷,所有关键领域均为Y或PY。
-
结论非常可信。
2️⃣Moderate(中等质量):
-
存在少量(建议最多2个)PN或N。
-
缺陷不至于动摇主要结论。
3️⃣Low(低质量):
-
存在少量(建议最多两个)PN或N。
-
结论的可信度受到实质性影响。
4️⃣Critically Low(极低质量):
-
存在大量缺陷(超过2个关键缺陷)。
-
这篇综述的结论几乎无法用于指导实践。
AMSTAR-PF的发布,标志着预后因素研究进入了更规范化的时代。对于研究者而言,在动笔之前先通读一遍这个工具,将其作为“避坑指南”,能极大提升文章的命中率。
请大家记住,发表只是过程,产生真实、可靠、能指导临床的证据,才是科研的终极目标





评论列表