统计学的经典结论,在测量误差面前可能彻底失效。一篇最新研究展示了这样一个极端案例:同一份字节完全相同的数据,在一种假设下,95%置信区间覆盖真实值的概率是95.3%;而在另一种假设下,这个数字直接跌到0.0%。
问题出在预测变量的可靠性上
打开网易新闻 查看精彩图片
研究聚焦于线性回归中的测量误差问题。核心变量是:你对预测变量(自变量)的测量精度有多大的信心。这个看似技术性的假设,直接决定了置信区间能否兑现它的名义覆盖概率。
当研究者假设预测变量测量误差较小时,置信区间表现正常,覆盖概率接近理论值95%。但当假设测量误差较大时,同样的数据、同样的回归模型,置信区间的实际覆盖概率竟然归零——意味着区间一次都没能罩住真实值。
对实证研究的警示
这个结果对依赖回归分析做结论的研究者是个提醒:置信区间的可信度,不仅取决于数据本身,还取决于你对数据质量的假设。如果测量误差的设定与实际情况偏差过大,再漂亮的置信区间也可能只是数字游戏。
研究没有给出"如何正确设定误差"的万能答案,但它用极端对比说明了一个容易被忽视的事实:统计推断的结论,永远建立在假设之上。假设错了,结论的可靠性就要打上问号。
热门跟贴