用户用例 · 金融服务与审计

欺诈检测:七种异常识别方法的并行比对

欺诈检测,不该只靠一条阈值规则打天下。在同一份交易数据上并行跑通统计、聚类与机器学习七类方法,用同一个测试集比出召回与精确率,再决定上线哪一种。全流程零代码,可在信创环境本地部署。
7 种
异常识别方法并行比对
28.4 万
公开数据集交易样本
0.172%
正样本占比,极度不平衡
0 行
代码,可视化工作流搭建

什么是欺诈检测?

欺诈检测,是指在交易、报销、理赔、采购等业务数据中识别偏离正常模式的异常记录,并据此判断是否存在舞弊风险的一类分析过程。它的技术底色是异常值识别:先刻画什么叫”正常”,再把偏离正常的样本挑出来交给人复核。

难点从来不是算法本身,而是三件事:正样本极少(公开信用卡数据集里舞弊交易只占千分之一点七),业务口径每季度都在变,以及监管要求每一条告警都能解释来源。因此,与其押注单一模型,不如把多种方法放在同一条流水线上横向比对。这正是本用例要做的事。

该场景与金融服务数据分析解决方案企业审计分析解决方案共用同一套数据底座,建模逻辑可直接复用到反洗钱筛查与费用稽核。

欺诈检测:风控与稽核人员在复核可疑交易线索
真正耗时的不是建模,而是复核:把误报压下去,人才有余力盯住真正的高风险线索。

这个用例解决什么问题

从”选一个模型”改成”让方法自己比出来”,风控与稽核团队拿到的不是一个黑箱分数,而是一张可解释的方法效果对照表。

🔍
多方法横向比对
统计法、聚类法、有监督模型放进同一条工作流,输入同源、评估同尺,结果可直接并排看。
⚖️
按不平衡数据评估
准确率在千分之二正样本下毫无意义,用精确率与召回率评估,避免”全判为正常也有 99.8 分”的假象。
🎚️
阈值与超参自动寻优
离群分数阈值、聚类邻域半径等参数用参数优化循环自动搜索,保证每种方法都在自己的最佳状态下被评判。
📊
结果可视化汇总
七种方法的指标汇成一张对比条形图,业务负责人不看代码也能参与选型决策。
🧾
全流程可追溯
每个节点的输入输出、参数、版本都留在工作流里,应对内审与外部监管问询时能逐步回放。
🏛️
信创环境本地部署
交易数据不出域,可运行在麒麟、统信操作系统与达梦、海量等国产数据库之上。

欺诈检测:七种方法的适用边界

有没有历史舞弊标签,直接决定你能用哪一类方法。下表把七种技术按”是否需要标注样本”分成两组,选型时先看这一列。

欺诈检测:金融交易与资金流水中的异常识别场景
方法类型需要标注样本典型适用场景
四分位法(IQR)统计单一金额或频次字段的快速粗筛,规则可直接口头解释
分布法(z-score)统计指标近似正态分布时的离群点识别
DBSCAN 聚类无监督多维行为特征聚簇,落在任何簇之外的即为可疑
孤立森林无监督高维稀疏、样本量大,需要稳定离群分数
自编码器无监督用重构误差刻画异常,适合复杂非线性模式
逻辑回归有监督需要向监管或业务解释每个变量的系数方向
随机森林有监督已积累历史舞弊标签,追求更高召回率

实务里常见的做法是无监督打头、有监督收口:先用统计与聚类方法在无标签阶段积累疑似样本,人工复核后形成标签,再训练有监督模型接管日常打分。想了解这些算法节点的完整清单,可查看统计分析与机器学习功能页

欺诈检测:从数据到告警的四步流程

整条链路由可视化节点串起来,任何一步都可以单独重跑,不需要重新执行全流程。下图是完整工作流的结构:左侧一路数据进入,中段分七路并行建模,右侧汇成一张对比图。

工作流全景 · 从数据读取到方法对比
← 左右滑动查看完整流程 →
统计与聚类 · 无需标注样本
无监督模型
有监督模型 · 需标注样本
读取交易数据交易明细表
构建目标列正常 / 可疑
数据分区训练 80 / 测试 20
数值归一化z-score
训练 / 验证集用于超参寻优
四分位法
分布法
DBSCAN 聚类
孤立森林
自编码器
逻辑回归
随机森林
结果合并七路指标汇总
对比条形图召回率 / 精确率
公开数据集 28.4 万笔交易,可疑样本占 0.172%不做上采样或下采样,用召回率与精确率评估七路共用同一测试集

1. 数据接入与预处理

读取交易明细后先做分区,再对数值字段归一化,确保基于距离的聚类方法不被金额量纲带偏。训练集与测试集在这一步一次切分,之后所有方法共用同一份测试集。

2. 七路方法并行建模

同一份训练数据分发到七个分支,各自完成建模。分支之间互不干扰,新增或替换一种方法只需接上一路,不必改动上下游。

3. 阈值与超参寻优

每个分支内嵌参数优化循环,自动搜索离群分数阈值、聚类邻域半径等关键参数,使每种技术都以最佳配置参与比较,避免”输在没调参”。

4. 评估、可视化与告警

在同一测试集上计算精确率与召回率,汇总成对比条形图。选定方法后,可把打分与告警分发做成定时任务或数据应用,交给一线复核人员使用;结合AI 智能体能力还能自动生成多语种告警说明。

从示例工作流走向生产环境
示例工作流回答的是”哪种方法更合适”,生产环境还要回答三个问题:数据能不能不出域、结果能不能复核、模型能不能定期重训。可视化工作流的优势正在这里,流程本身就是文档,审计人员无需读代码即可逐节点复核。
同类思路在保险稽核场景已有落地参考,可参见保险公司替换 SAS 的分析用例。本用例的技术原型来自开源社区的公开模板,原始英文版本可在 KNIME 官网查阅。
麒麟 / 统信
鲲鹏 / 海光 / 龙芯
达梦数据库
本地化私有部署

常见问题

一条都没有也能开始。四分位法、分布法、DBSCAN、孤立森林与自编码器都属于无监督方法,只需正常业务数据即可跑出离群分数。等人工复核积累到一定量的确认样本后,再引入逻辑回归或随机森林做有监督建模。
有,前提是换掉准确率这个指标。在正样本占千分之几的数据上,把所有交易都判为正常也能得到超过 99% 的准确率,毫无参考价值。应使用精确率与召回率,并结合欠采样、SMOTE、代价敏感学习、Bagging 与 Boosting 等手段处理不平衡。
可以。把训练好的模型保存后,用部署工作流读取模型与新交易数据完成打分,命中阈值时触发邮件或工单通知。部署形态可以是定时任务、REST 服务或面向复核人员的数据应用。
不必推倒重来。规则变化通常影响特征口径与阈值,在工作流里调整对应节点、重跑寻优循环即可,下游评估与告警分支保持不变。这也是把流程做成可视化节点而非脚本的直接收益。
工作流本身即是可视化的过程记录,每个节点的参数、输入输出与执行版本都可回溯,支持逐步复现某一条告警是如何产生的。需要向监管说明变量影响方向时,可优先选用逻辑回归这类系数可读的模型。
iModel 专属客服
网页直接对话,无需微信
4008568196 拨打此号码联系我们

微信扫码咨询

iModel 微信咨询二维码

使用微信扫描上方二维码