六西格玛数据收集:数据从哪来,口径谁说了算
一个改善项目最先烧掉的通常不是分析时间,是两三周的凑数据时间。而凑完之后最容易翻车的,是各部门对同一个指标的算法根本不一样。这一章讲清楚 Measure 阶段该确认哪些事,以及五个最常吵架的口径分别该怎么定。
Measure 阶段难的不是测量,是对齐
六西格玛培训里,Measure 阶段讲的是测量系统分析、过程能力基线这些方法。但在真实项目里,这一阶段的时间去哪了?
大部分花在两件事上:把数据从几个互不相通的系统里凑出来,以及说服相关部门接受同一套算法。前者是工程问题,后者是组织问题,两个都不在六西格玛教材的重点章节里,但两个都能拖垮项目进度。
这一章不讲统计方法,只讲这两件事该怎么做。六西格玛数据分析总览里提到的各阶段分工,从这里开始落地。
项目启动前,先确认这六类数据在哪
不同行业的系统名称不同,但缺口的位置高度一致。
| 数据类型 | 常见来源 | 最常见的问题 |
|---|---|---|
| 过程参数 | 生产执行系统、设备控制系统、班组记录表 | 关键参数只存在设备本地且无导出接口;或只有整点抽样,精度不够 |
| 质量检测结果 | 实验室信息系统、质检系统、Excel 台账 | 复检记录与首检混在一起,不知道该取哪一次 |
| 物料与批次 | ERP、进货检验记录 | 批次号在不同系统里编码规则不同,关联不上 |
| 人员与班次 | 排班表、考勤系统 | 只有排班计划没有实际出勤,换班没记录 |
| 设备状态 | 维修保养记录、点检表 | 多为纸质或自由文本,无法直接参与计算 |
| 成本与损失 | ERP、财务核算表 | 口径按会计期间切,与生产批次对不上 |
盘点的目的不是集齐所有数据,而是提前知道哪一类是缺口。缺口在第一周暴露,项目还能调整范围;缺口在第六周暴露,通常只能重来。
五个最常吵架的口径
这几条如果不在项目启动会上定下来,后面每次汇报都会重新吵一遍。
不良率的分母是投入数还是产出数
返修品算不算不良
时间窗口按什么切
复检数据取哪一次
批次的粒度定在哪一级
把口径写进流程,而不是写进会议纪要
口径定完之后,真正的问题是三个月后还能不能还原它。
让每个数据源各占一个入口节点
数据库取一条、Excel 台账取一条、导出文件取一条,各自独立。不要先在 Excel 里手工拼好再导入——那一步没有记录,也是最容易出错的一步。
关联键先清洗再关联
批次号在不同系统里常有前后空格、大小写差异、补零规则不同。关联之前先统一格式,并且把关联不上的记录单独输出一份,而不是让它们静默消失。关联失败的比例本身就是数据质量的指标。
口径定义写成规则节点,不写成公式串
「投入数怎么算」「哪些状态算不良」「哪些记录要排除」,每一条对应一个可读的规则。规则节点的好处是别人打开就能看到判定条件,不需要去解析一长串嵌套公式。
在节点注释里写下为什么
这一步最容易被省掉,也是三个月后价值最高的一步。不是写「过滤异常值」,而是写「排除 2026-03-15 停机调试期间的记录,依据是设备维修单 M2603-118」。工具能记录你做了什么,记录不了你为什么这么做。
把这段处理封装成组件
下个项目、下条产线,数据准备的逻辑八成是一样的。封装之后口径由一处维护,不会出现三个人三套算法的情况。这也是让第二个项目比第一个快的主要原因。
数据够不够做分析,用三个问题判断
这三条任何一条不过关,后面的统计分析都会得出误导性的结论。
- 采样频率对得上吗。工艺参数每秒一条、质量检验每批一次,中间的对应关系怎么建立?常见做法是把参数按批次时间窗口聚合成均值、极差、最大最小值。但要注意:聚合本身会丢掉波动信息,而波动往往才是问题所在。如果怀疑问题出在过程波动上,聚合方式需要额外设计。
- 关键参数有没有缺失。工程师凭经验认为最相关的那几个参数,如果恰好没有采集,分析只能在剩下的参数里找相关性,很可能得出一个看起来显著但实际是代理变量的结论。这种情况下诚实的做法是先补采集,而不是硬做。
- 历史长度够不够覆盖变异。如果原料批次三个月换一次、季节温湿度有明显影响,那么只有一个月的数据就无法区分「工艺参数的影响」和「换了批原料的影响」。判断标准是:数据跨度要覆盖你已知的主要变异来源至少两个循环。
- 有没有已知的中断和异常期。设备大修、工艺变更、换供应商、疫情停产,这些时间段的数据不能和常态期混在一起算。项目启动时就该向生产和设备部门要一份这样的时间清单。
- 数据能不能持续拿到。Control 阶段要把监控固化成每天自动跑。如果这次的数据是靠某位同事手工导出的,那么改善成果就无法持续。这一条应该在 Measure 阶段就确认,不要等到最后。
三个会让整个项目白做的坑
这三条都发生过,而且发现得都很晚。
拿到的是按天汇总的合格率,却想分析设备之间的差异。汇总之后个体信息已经丢失,再怎么分析也还原不回来。需要明细就在取数阶段要明细。
两表关联后行数少了三成,没人注意。如果丢掉的恰好是某条产线或某个时间段,结论就系统性偏了。关联未匹配的记录必须单独输出并说明原因。
质检系统里往往只有送检的样品,没送检的、现场直接报废的不在里面。用这份数据算出来的不良率会系统性偏低,而且偏多少无法估计。
六西格玛数据分析 · 本系列六章
- 数据从哪来、口径谁说了算当前章节
- 过程能力 Cp/Cpk 怎么算、怎么自动重算
- 控制图与判异规则怎么落到数据上
- 质量分析里怎么选假设检验方法
- 从几十个工艺参数里筛出关键因子
- 参数寻优:能做什么、不能做什么
先把口径清单发出去
这一章最值钱的动作不是搭流程,是把上面那五个口径争议整理成一页纸,在项目启动会上让相关部门当场确认。这件事花半天,能省掉后面几周的返工。