数据清洗入门:读表、筛行、删列

日常九成的数据清洗,只用三个节点就能做完。这一讲把一张带标题行、有空白记录、多出一堆没用字段的原始台账,清成一张能直接往下走的表。

25 分钟预计用时
3 个节点覆盖九成清洗
1 个不报错的坑
开始之前

这一讲接着第 1 讲往下做,默认你已经会建工作流、会拖节点连线、看得懂节点上的红黄绿三盏灯。没做过第 1 讲的话,先花十分钟走一遍,这里不再重复。

数据清洗这件事,其实只有三个动作

拿到一份原始台账,数据清洗要做的无非三件事:把它读进来去掉不该留的记录去掉用不上的字段。对应三个节点:Excel 读取器、行过滤器、列过滤器。剩下的复杂操作都是在这三步之后才需要考虑的。

顺序也别搞反。先读进来看清楚数据长什么样,再筛行,最后删列。反过来先删列,很可能把筛行要用的判断字段先删掉了。

第一步:把表读进来

Excel 读取器是最常用的入口节点。新手在这一步遇到的问题基本是同一个:表头没认对,或者数据读少了。配置面板里选项不少,真正要动的只有两处。

演示会自动播放。鼠标移上去暂停,点任意按钮转为手动,点右上角可以全屏投影。

1

指定文件,然后看预览

右键节点 → 配置 → 文件和工作表 → 浏览

路径填进去之后,下面的预览区就有东西了。预览是用来发现问题的,不是用来欣赏的。如果你看到字段名是 Column1、Column2 这种,说明真正的标题行被当成了第一行数据 – 这就是要去改表头规则的信号。

2

把表头认对

数据区域 → 使用行中的值

这个数字的意思是「第几行才是表头」。改对之后,预览里所有字段名会一次性变成真实名称,那行标题也不再算数据。

填几取决于你这张表:上面空了几行、有没有合并标题,现场数一遍行号就知道。不是固定填 2。这一步做对,后面每个节点都能按字段名选列。

3

数据量大时,取消扫描行数限制

高级 → 限制扫描的数据行数

系统默认只扫描前 10000 行来推断字段类型。数据量超过这个数还不取消,会出现读取不全、字段识别遗漏。

这是整套教程里唯一一个”不报错但结果是错的”陷阱。扫描限制导致的问题不会亮红灯,节点照样是绿灯,控制台一条警告都没有。发现它的唯一办法是核对行数 – 如果读进来正好 10000 行整,那多半不是巧合。

第二步:行过滤器,决定留哪些记录

行过滤和列过滤都在转换节点分组下,图标是扳手。先说行 – 它决定「留哪些记录」。

最常用的是「只有缺失的值才匹配」这一个勾。不用写任何表达式,空值行就全被选出来了。除此之外还支持列值匹配、模式匹配、正则匹配、行号范围。

「保留」还是「排除」,是新手最容易选反的地方。同一套条件选反,结果正好互补,而且两种都不报错。唯一的发现办法是执行完回监控面板核对行数 – 减少的数量和你预期一致,这一步才算做完。

规则复杂到写不出来的时候,把字段样例和你想要的结果描述给 AI,让它给你一段正则再粘回来。这是正常用法,不必回避。

第三步:列过滤器,决定留哪些字段

行过滤决定留哪些记录,列过滤决定留哪些字段。操作就是把不需要的字段从右边的「包括」挪到左边的「排除」。

模式什么时候用
手动字段少,十几个以内,直接点选最快
通配符字段名有规律,比如一次选中所有 扩展字段*
正则规律复杂,比如 ^扩展字段\d+$
类型按数据类型批量选,比如把所有文本字段留下

有一句要说清楚:列过滤器只影响往下游传的字段,源文件一个字都没有动过。很多新手担心”删了原表怎么办”,不会的。

建议养成的习惯:读进来先删掉用不上的列,后面每一步都更快、更清爽。

找不到节点时,直接搜

节点几百个,不用背分类。分类树是给你浏览的,日常干活靠搜 – 这是新手和熟手最明显的效率差别之一。

中文英文都能搜。想不起节点叫什么,就搜你要干的事。搜不到就换个说法:「分组」「聚合」「汇总」经常指向同一个节点。

学完自检

  • 能把 Excel 读进来,字段名是真实名称而不是 Column1
  • 知道数据量大时要去高级页取消扫描行数限制,也知道它不会报错
  • 能用行过滤清掉空白记录,并且清楚「保留」和「排除」的区别
  • 能用列过滤删掉用不上的字段,并且知道源文件不受影响
  • 执行完会回监控面板核对行数,而不是看到绿灯就往下走

用你自己的表跑一遍

这一讲的三个节点,换成你手上那份真实台账做一次,比看十遍都管用。iModel Analytics Studio 个人学习与评估免费。

iModel 专属客服
网页直接对话,无需微信
4008568196 拨打此号码联系我们

微信扫码咨询

iModel 微信咨询二维码

使用微信扫描上方二维码