假设检验怎么选:一张决策表,加四个关于 p 值的常见误解
改善前后有没有差异、两台设备是不是一样、换了供应商影响大不大——这些问题都要靠假设检验回答。难的不是算,是选对方法,以及看懂结果到底说了什么。这一章给出可判断的选择路径,并说清楚 p 值不能回答的那几件事。
假设检验回答的是「是不是偶然」
改善之后不良率从 3.2% 降到 2.8%。这 0.4 个百分点,是改善起了作用,还是本来每个月就上下波动这么多?
假设检验只回答这一个问题:观察到的差异,用随机波动能不能解释得通。如果很难用偶然解释,就说这个差异「统计上显著」。
它不回答另外两个同样重要的问题:这个差异有多大(那是效应量的事),以及这个差异值不值得投钱(那是业务判断的事)。混淆这三件事,是六西格玛项目汇报里最常见的问题——p 值算得很漂亮,但没人说得清改善到底带来了多少钱。
这一章的重点因此有两个:选对方法,以及把统计结论翻译回业务语言。
三个问题就能定下用哪种检验
顺序回答这三个,再去查下面的表。
你比较的是什么量
均值(尺寸、重量、时间这类连续数据)、比例(不良率、合格率这类计数数据),还是变异(标准差、极差)?这三类走完全不同的方法族。
有几组,组之间是独立还是配对
一组和目标值比、两组互相比、还是三组以上?两组时要分清:不同设备的产品是独立样本;同一批产品改善前后各测一次是配对样本。配对用错成独立,会损失大量检验效力。
数据近似正态吗
连续数据的多数方法建立在正态假设上。形位公差、寿命、杂质含量、等待时间这类天然偏态的数据,应先做正态性检验,不满足时改用不依赖分布的非参数方法。
场景与对应方法
按上面三个问题的答案在表里定位。
| 你想知道的 | 用哪种检验 | 注意事项 |
|---|---|---|
| 比较均值 · 数据近似正态 | ||
| 这批产品的平均值有没有达到目标 | 单样本 t 检验 | 目标值是已知常数,不是另一组数据 |
| 两台设备产出的均值一样吗 | 双样本 t 检验 | 先看两组方差是否接近,不接近时用不假设方差相等的版本 |
| 同一批件改善前后有没有变化 | 配对 t 检验 | 必须是同一个体前后两次测量,顺序要能对应上 |
| 三台以上设备之间有没有差异 | 单因素方差分析 | 只告诉你「至少有两组不同」,要知道具体哪两组不同需做事后比较 |
| 两个因素同时影响,还有交互作用 | 多因素方差分析 | 交互作用往往比主效应更值得关注 |
| 比较比例 · 计数数据 | ||
| 不良率有没有达到目标水平 | 单比例检验 | 样本量太小时结论不稳,建议每组至少有 5 个不良品 |
| 两条产线的不良率一样吗 | 双比例检验 | 也可以用 2×2 卡方检验,结论一致 |
| 不良类型的分布和班次有没有关系 | 卡方独立性检验 | 每个格子的期望频数最好不小于 5,太小要合并类别 |
| 比较变异 | ||
| 改善后波动是不是变小了 | F 检验或 Levene 检验 | F 检验对正态性很敏感,数据不够正态时优先用 Levene |
| 数据明显非正态 | ||
| 两组独立样本的位置有无差异 | Mann-Whitney U 检验 | 比较的是中位数位置而非均值 |
| 三组以上独立样本 | Kruskal-Wallis 检验 | 方差分析的非参数版本 |
| 配对样本前后有无差异 | Wilcoxon 符号秩检验 | 配对 t 检验的非参数版本 |
关于非参数方法的实现:常规的 t 检验、方差分析、卡方检验在多数分析平台里都有现成节点;Mann-Whitney、Kruskal-Wallis、Wilcoxon 这几种不一定包含在基础安装里,可能需要额外扩展或通过 Python、R 脚本节点调用现成的统计库来完成。选型阶段建议先确认。
关于 p 值的四个常见误解
这四条在项目汇报里反复出现,而且经常没人纠正。
不是。p 值的定义是:假设两组本来就没有差异,那么观察到当前这么大(或更大)差异的概率是 3%。它是在「无差异」这个前提下算出来的概率,不是「无差异」本身的概率。
这个区别听起来像咬文嚼字,但方向完全不同。真要算「无差异的概率」,需要引入先验信息,那是另一套方法。
不能这么说。p 值大只说明现有证据不足以断定有差异,可能是真的没差异,也可能是样本量太小没测出来。
正确的表述是「未发现显著差异」,而不是「证明二者相同」。如果确实需要证明两者等效——比如验证国产替代件和原件性能一致——要用等效性检验,而不是拿 p 值大当证据。
不对。p 值同时受差异大小和样本量影响。样本量足够大时,一个毫无实际意义的微小差异也能算出极小的 p 值。
要说明差异有多大,应该报告均值差、比例差或效应量,并给出置信区间。汇报时说「不良率从 3.2% 降到 2.8%,差异的 95% 置信区间是 0.1% 到 0.7%」,比只说「p=0.008」有用得多。
这会系统性地制造假阳性。每做一次检验就有一次犯错的机会,做得越多,至少出现一次「显著」的概率越高。
方法应该在看数据之前根据问题类型定下来。如果确实需要做多组比较,要用相应的多重比较校正方法来控制整体错误率。
统计显著,不等于值得改善
这是六西格玛项目里最该建立的一个习惯:在做检验之前,先定下「多大的差异才值得投入」。
做法很简单。假设年产量 200 万件、单件成本 30 元,如果不良率能降 0.5 个百分点,一年省下 30 万;项目投入预计 15 万。那么 0.5 个百分点就是这个项目有意义的最小差异。低于这个幅度,哪怕 p 值再小,项目也不值得做。
定下这个数之后,反过来还能推出需要多少样本:要在给定的把握下检出 0.5 个百分点的差异,大致需要多大的样本量。这一步在试验设计前做,能避免两种常见浪费——样本收太少、结论出不来;或者样本收太多、多花的检验成本没有换来更多信息。
汇报的时候,三个数一起给:差异有多大、置信区间是多少、折算成钱是多少。只给 p 值的汇报,管理层无法据此做决定。
在数据平台里怎么做检验
重点不在算,在于把前置检查和事后翻译一起固化进流程。
先分组、先画图
按要比较的因素分组,先画箱线图或直方图看一眼。很多时候图上就能看出问题:分布形状差很远、有明显离群点、或者某一组样本量特别少。这些问题不先处理,直接算检验没有意义。
做正态性与方差齐性检查
连续数据先检查是否近似正态,再检查两组方差是否接近。这两项决定了走 t 检验还是非参数方法、用哪个版本的 t 检验。把这两步做成流程的固定环节,而不是凭印象跳过。
执行检验
选好方法之后配置节点执行。多数平台会同时输出检验统计量、p 值和置信区间,把置信区间一并留下,不要只取 p 值。
把结论翻译成一句话
用规则节点把 p 值和差异大小组合成可读的结论文字,例如「差异显著,但幅度小于设定的最小有意义差异,不建议据此启动改善」。这一步能让不懂统计的同事直接看懂,也避免每次都要人工解读。
封装成组件,固定分析套路
把「画图—检查前提—选方法—执行—翻译结论」整段封装。团队里每个人做同类比较时走同一套流程,结论口径一致,也不会有人图省事跳过前提检查。
做检验之前先确认这六件事
- 方法在看数据之前就定好了。先定方法再看结果,而不是看完结果挑一个显著的方法。
- 最小有意义差异定下来了。这个数应该来自业务测算,不是统计学给的。
- 样本是随机的、可比的。如果两组数据来自不同时间段,而中间换过原料批次,那么检验出的差异未必来自你关心的那个因素。
- 配对关系没有搞错。同一件产品前后测量是配对,不同产品分别测量是独立,两者的方法和结论都不同。
- 离群点的处理有依据。剔除要有可追溯的原因,不能因为它影响结论就删掉。保留和剔除两种情况下分别算一次,看结论是否稳健,是更好的做法。
- 结论会用业务语言表述。汇报里要有差异幅度、置信区间和折算金额,而不只是一个 p 值。
四个会让结论站不住的做法
拿每天的平均值做两组比较,样本量从几千条变成几十条,检验效力大幅下降,而且组内变异信息全丢了。能用明细就用明细。
改善前取一月的数据、改善后取五月的数据,中间隔了换季、换批、换人。检验出的差异里混了多少别的因素,无法分离。理想做法是同期对照。
方差分析只说明至少有两组不同,不告诉你是哪两组。直接说「三台设备有显著差异所以 B 设备有问题」是跳步,需要做事后多重比较才能定位。
换分组方式、换时间窗口、换剔除标准,试到 p 小于 0.05。这样得到的结论在下一批数据上通常复现不了,而改善措施已经投进去了。
六西格玛数据分析 · 本系列六章
- 数据从哪来、口径谁说了算
- 过程能力 Cp/Cpk 怎么算、怎么自动重算
- 控制图与判异规则怎么落到数据上
- 质量分析里怎么选假设检验方法当前章节
- 从几十个工艺参数里筛出关键因子
- 参数寻优:能做什么、不能做什么
先把「多大才值得做」这个数定下来
下次启动改善项目时,在收集数据之前先算一笔账:降多少个百分点、能省多少钱、项目投入多少。这个数定下来,后面的样本量、检验方法和结论解读都有了标尺。