数据清洗入门:读表、筛行、删列
日常九成的数据清洗,只用三个节点就能做完。这一讲把一张带标题行、有空白记录、多出一堆没用字段的原始台账,清成一张能直接往下走的表。
这一讲接着第 1 讲往下做,默认你已经会建工作流、会拖节点连线、看得懂节点上的红黄绿三盏灯。没做过第 1 讲的话,先花十分钟走一遍,这里不再重复。
数据清洗这件事,其实只有三个动作
拿到一份原始台账,数据清洗要做的无非三件事:把它读进来、去掉不该留的记录、去掉用不上的字段。对应三个节点:Excel 读取器、行过滤器、列过滤器。剩下的复杂操作都是在这三步之后才需要考虑的。
顺序也别搞反。先读进来看清楚数据长什么样,再筛行,最后删列。反过来先删列,很可能把筛行要用的判断字段先删掉了。
第一步:把表读进来
Excel 读取器是最常用的入口节点。新手在这一步遇到的问题基本是同一个:表头没认对,或者数据读少了。配置面板里选项不少,真正要动的只有两处。
演示会自动播放。鼠标移上去暂停,点任意按钮转为手动,点右上角可以全屏投影。
指定文件,然后看预览
路径填进去之后,下面的预览区就有东西了。预览是用来发现问题的,不是用来欣赏的。如果你看到字段名是 Column1、Column2 这种,说明真正的标题行被当成了第一行数据 – 这就是要去改表头规则的信号。
把表头认对
这个数字的意思是「第几行才是表头」。改对之后,预览里所有字段名会一次性变成真实名称,那行标题也不再算数据。
填几取决于你这张表:上面空了几行、有没有合并标题,现场数一遍行号就知道。不是固定填 2。这一步做对,后面每个节点都能按字段名选列。
数据量大时,取消扫描行数限制
系统默认只扫描前 10000 行来推断字段类型。数据量超过这个数还不取消,会出现读取不全、字段识别遗漏。
这是整套教程里唯一一个”不报错但结果是错的”陷阱。扫描限制导致的问题不会亮红灯,节点照样是绿灯,控制台一条警告都没有。发现它的唯一办法是核对行数 – 如果读进来正好 10000 行整,那多半不是巧合。
第二步:行过滤器,决定留哪些记录
行过滤和列过滤都在转换节点分组下,图标是扳手。先说行 – 它决定「留哪些记录」。
最常用的是「只有缺失的值才匹配」这一个勾。不用写任何表达式,空值行就全被选出来了。除此之外还支持列值匹配、模式匹配、正则匹配、行号范围。
「保留」还是「排除」,是新手最容易选反的地方。同一套条件选反,结果正好互补,而且两种都不报错。唯一的发现办法是执行完回监控面板核对行数 – 减少的数量和你预期一致,这一步才算做完。
规则复杂到写不出来的时候,把字段样例和你想要的结果描述给 AI,让它给你一段正则再粘回来。这是正常用法,不必回避。
第三步:列过滤器,决定留哪些字段
行过滤决定留哪些记录,列过滤决定留哪些字段。操作就是把不需要的字段从右边的「包括」挪到左边的「排除」。
| 模式 | 什么时候用 |
|---|---|
| 手动 | 字段少,十几个以内,直接点选最快 |
| 通配符 | 字段名有规律,比如一次选中所有 扩展字段* |
| 正则 | 规律复杂,比如 ^扩展字段\d+$ |
| 类型 | 按数据类型批量选,比如把所有文本字段留下 |
有一句要说清楚:列过滤器只影响往下游传的字段,源文件一个字都没有动过。很多新手担心”删了原表怎么办”,不会的。
建议养成的习惯:读进来先删掉用不上的列,后面每一步都更快、更清爽。
找不到节点时,直接搜
节点几百个,不用背分类。分类树是给你浏览的,日常干活靠搜 – 这是新手和熟手最明显的效率差别之一。
中文英文都能搜。想不起节点叫什么,就搜你要干的事。搜不到就换个说法:「分组」「聚合」「汇总」经常指向同一个节点。
学完自检
- 能把 Excel 读进来,字段名是真实名称而不是 Column1
- 知道数据量大时要去高级页取消扫描行数限制,也知道它不会报错
- 能用行过滤清掉空白记录,并且清楚「保留」和「排除」的区别
- 能用列过滤删掉用不上的字段,并且知道源文件不受影响
- 执行完会回监控面板核对行数,而不是看到绿灯就往下走

