KNIME中文教程 / 节点手册
每篇的结构是固定的
你不必通读,看惯了结构就知道该跳到哪一段。多数时候你要的是「这个参数到底什么意思」,那就直接翻第三段。
- 它解决什么问题 一句话。判断是不是你要找的节点,看这一句就够。
- 在哪找到、几个端口 节点库里的位置,输入输出各是什么,有没有可选端口。
- 配置项逐条 英文原名、中文界面文案、这项填错会怎样。这是每篇的主体。
- 最小示例 一小张输入表、一份配置、一张输出表,三样并排放。不用大数据集,看清逻辑比看清规模有用。
- 三个常见坑 挑真的会让人卡住的,不凑数。
- 相关节点 什么情况下该换成另一个节点,而不是硬调这个。
部分节点还配了工作流示意条和配置对话框示意,能直接看出这个节点该放在流程的哪一步、哪个参数最要紧。
节点名的中英对照问题
KNIME 原版界面是英文,iModel 中文版把节点名和配置项都译成了中文。同一个节点在两边名字不一样,搜资料时很容易对不上。
本站的处理办法:标题里英文名在前、中文名在后,配置项每一条同时给英文原名和中文界面文案。你用哪个版本都能对上号。
找节点最快的办法不是翻目录树。左侧节点库顶上有搜索框,直接敲英文名的前几个字母。中文版里敲中文名也可以。目录树层级很深,靠翻找通常更慢。
按用途速查
不知道该用哪个节点的时候,先按你要做的事情定位大类。已经成篇的节点名会自动带链接,点进去就是详解。
| 你要做的事 | 对应节点 | 说明 |
|---|---|---|
| 把数据读进来 | CSV Reader、Excel Reader | 整个文件夹批量读也是这两个节点,靠文件夹模式而不是循环 |
| 把结果写出去 | Excel Writer | 多张表写进同一个工作簿的不同工作表,用同一个节点追加 |
| 去掉不要的行 | Row Filter、Rule-based Row Filter | 单条件用前者,多条件组合或按优先级判断用后者 |
| 去掉或改名列 | Column Filter、Column Renamer | 下游报「找不到列」多半是这两步动过 |
| 两张表拼一起 | Joiner、Concatenate | 按键匹配用 Joiner(横向),直接摞起来用 Concatenate(纵向) |
| 按维度汇总 | GroupBy、Pivoting | 出一列结果用 GroupBy,要行列交叉的透视表用 Pivoting |
| 算新列 | Math Formula、String Manipulation、Rule Engine、Column Expressions | 数值、文本、条件判断、复杂多列运算,各管一类 |
| 处理脏数据 | Missing Value、Duplicate Row Filter、String to Date&Time | 空值、重复行、文本日期转成真日期 |
| 排序 | Sorter | 多列排序按先后优先级,顺序在配置里能拖 |
| 把值变成参数 | Table Row to Variable | 让下游节点的配置随数据变,属于进阶用法 |
首批规划二十个高频节点,上表里已成篇的会带链接,其余陆续补齐。有特别想先看到的,告诉我们,更新顺序按实际需求排。
全部条目
Column Filter 列筛选器
留下要的列去掉不要的,行数不变
Column Renamer(列重命名)
Column Renamer, 列重命名
Concatenate 行合并
多张表纵向摞成一张,让表变长。
CSV Reader(CSV 读取器)
读 csv 和 txt,国内文件编码基本要设 GBK。
Excel Reader (Excel 读取器)
读 xlsx 并批量读整个文件夹,不需要写循环。
Excel Writer(Excel 写出器)
Excel Writer, Excel 写出器
GroupBy 分组汇总
按列分组做求和计数,输出每组一行。
Joiner 表连接
按关联键横向拼表,配不上时不报错只丢行。
Math Formula(数学公式)
Math Formula, 数学公式
Missing Value 缺失值处理
统一处理空值,填法选错会改变结论。
Rule Engine 规则引擎
按条件分档打标,规则命中即停。
Sorter 排序器
按列排序,多列时列表先后即优先级。
String Manipulation 字符串
去空格、替换、截取、拼接,清洗阶段的主力
String to Date&Time(文本转日期)
String to Date, 文本转日期
行过滤(Row Filter)
按条件保留或剔除行,数据清洗阶段用得最多的节点。

