第二个常见的坑,是做完实验才去算功效。这个操作在统计上叫事后功效分析,很多人以为能给自己的阴性结果找个说法:"我算了一下功效只有 0.3,所以没检出来是样本不够。"但用实测效应量倒推出来的功效,跟 p 值是一个信息的两种说法,等于绕了个圈把结论又说了一遍,审稿人不会认。真正有用的做法,是报告效应量的置信区间——如果区间宽到既包含"没效果"也包含"效果很大",那就诚实地说这项研究还不足以下结论,这比硬套一个功效数字体面得多。
第三个坑是把多组比较当成一次比较来算。有的同学设计了四个处理组,两两比一遍就是六次检验,样本量却按一次 t 检验算的。这么做假阳性率会明显抬高。要么在设计阶段就把多重比较校正考虑进去,要么老老实实用方差分析的框架去算,别做完了再想办法圆。