文献简介

文献标题:被误解的P值:为什么临床实践中的统计显著性不够
期刊名称:British journal of anaesthesia
影响因子:9.2,中科院1区/Q1
发表时间:2025年2月4日
1
P值的重要性
P值的真实含义
P值=在零假设成立的前提下,观察到当前极端结果(或更极端)的概率(例如P=0.05表示:若治疗无效,20次实验中可能出现1次类似结果)。
P值的重要性
1️⃣实验结果的解释:通过比较P值和设定的显著性水平,我们可以判断实验结果是否具有统计学上的显著差异。有助于研究人员确定实验结果是否可靠,并制定进一步的研究计划或临床决策。
2️⃣科研论文的撰写:在撰写医学科研论文时,通常需要报告P值来支持研究结论。这有助于同行评审人员了解研究结果的可信度。
3️⃣临床试验的设计与分析:在临床试验中,P值被广泛应用于评估药物疗效、安全性等方面的统计差异。通过合理的试验设计和统计分析,可以确保临床试验的结果具有可靠性和有效性。
2
P值的误读及后果
两大误读实例
● 概念性误解:
将P值错误理解为“零假设为真的概率”(如P=0.05≠5%零假设成立概率)。认为P值<0.05即代表“效应真实存在”或“结果具有临床重要性”。
● 过度依赖单一指标:
仅用P值判断研究价值(忽略置信区间、效应量等),追求P<0.05引发“P-hacking”(操纵数据达到显著)、发表偏倚(阴性结果未发表)。
P值滥用的灾难性后果
⚠过度依赖P值导致临床决策忽略效应大小和实际意义(例如:统计显著但临床无关的结果被采纳)。
⚠假阳性结论增加(如多重比较中I类错误累积),误导临床实践。
⚠临床决策失灵:统计显著≠患者受益
3
替代方案指南

▲除P值外,可进一步验证结果的统计方法
补充临床相关性指标:
最小临床重要差异(MCID)
应用:在样本量计算中纳入MCID,确保研究能检测临床有意义的差异。
结合置信区间解读结果:若CI包含MCID,提示效应具有临床价值(例:镇痛研究P=0.03,但疼痛仅降1分,MCID=2分→无临床意义)。
⚠注意:在几乎所有医学领域中(包括麻醉学),纳入诸如最小临床重要差异 (MCID) 等措施都是非常有必要的。
改进统计指标:效应量、置信区间与S值
效应量(Effect Size):量化干预的实际影响(如Cohen's d),避免仅依赖P值判断重要性。
置信区间(CI):提供效应量的可能范围(例:CI=[1.2, 3.5]且包含MCID→支持临床有效性)。
S值(Surprisal):计算S=-log₂(P值)(如P=0.05→S=4.32 bits)。
优势:直观反映证据强度(例:S=4.32≈连续4次抛硬币均正面朝上的“惊讶程度”)。
第二代P值(SGPV)
原理:评估置信区间与“无效区域”(如MCID以下)的重叠程度。
解读:
● SGPV=0:支持有意义的效应(CI完全排除无效区域)。
● SGPV=1:仅存在无效效应(CI完全在无效区域内)。
● 0<SGPV<1:结果不确定(Blume et al., 2019)。
优势:降低假阳性率,强调临床相关性(例:区域麻醉SGPV=0→恢复时间改善具临床价值)。
贝叶斯框架
核心:整合先验知识(如既往研究)计算后验概率。
应用:
● 当P>0.05时,贝叶斯分析仍可提示疗效可能性(例:脓毒症新药试验P>0.05,但OR<1.0的后验概率=95%→支持潜在获益)。
● 报告贝叶斯因子(BF)量化证据强度(Benjamin & Berger, 2019)。
优化研究设计与阈值调整
①降低P值阈值:
建议将显著性阈值从0.05降至0.005,减少假阳性(Chuang et al., 2023)。
⚠代价:需更大样本量(资源受限环境面临挑战)。
② 校正多重比较:
使用Bonferroni等方法控制家族错误率(如10次比较→阈值调至0.005)。
③ 机器学习模型评估:
用AUROC、F1分数等预测性能指标替代P值(例:ICU死亡率预测模型ICURE以AUROC验证性能)。
正如这篇顶刊论文的作者所强调的:“统计显著性≠临床相关性”,唯有综合MCID、效应量和不确定性评估,才能避免P值陷阱,推动循证决策。
详情添加班主任咨询👇


会员专享课程资料
开通会员后,可免费下载本课程资料