← 进入工坊
📊 数据是怎么炼成的

合成数据生成 · 全流程详解

从欺诈知识库到可训练模型,五个阶段各司其职。以下为难度80《暗线-团伙洗钱》真实生成样例。

100,000
客户样本
1,670,779
行为事件
204,240
关系图边
0.8506
模型 AUC
🎁 难度80 完整数据包 · 免费下载
50,000 行客户数据 · 含字段字典 + 一键验证脚本 + 预跑报告 · 无需注册
⬇ 立即免费下载(2.7MB)
STAGE 1

欺诈知识库 · 定义「坏人长什么样」

作用:把公开的欺诈作案手法,变成机器可读的结构化知识
产出 → knowledge.py 知识库 · 6 类 × 全流程定义
STAGE 2

环境模拟 · 给每个客户配「身份+设备+网络」

作用:让每条数据背后有一个真实的「人」和环境,而不是裸数字
产出 → environment.py · 设备/IP/地理三组环境画像
STAGE 3

行为序列 · 把欺诈演出来,而不是贴标签

作用:按时间线生成完整行为事件流——注册→登录→填表→申请→放款→取现→还款/违约
产出 → sequences.py · 170 万条事件流 + 资金网络
STAGE 4

特征工程 · 把行为压缩成模型能吃的数字

作用:原始事件流太稀疏,聚合为 26 个客户维度特征,分 8 组
产出 → feature_engine.py · 100,000 × 26 特征矩阵
STAGE 5

质量验证 · 用模型证明数据能打

作用:每个成品包必须过「体检 + 模型验证」双关,不合格不出厂
产出 → validate.py + train_eval.py · 出厂合格证

难度80《暗线-团伙洗钱》· 样例数据(前 8 行)

真实生成样本 · 红色为欺诈客户 · 字段节选
customer_idrisk_labelagecredit_scoredeviceIP类型IP属地匹配填表秒数养号天数取现间隔h设备共享IP共享
C000001normal34712正常住宅312211
C000002normal27688正常住宅245111
C000003gang_fraud31645模拟器代理4816723
C000004normal42751正常住宅380111
C000005normal29702正常住宅198311
C000006identity_fraud25690新设备住宅520911
C000007normal38735正常住宅290211
C000008loan_fraud33658正常住宅160111

效果验证 · 模型区分欺诈的能力

LightGBM 在「申请时点」特征上训练 · 难度80 · 预跑结果
团伙洗钱 gang_fraud
100.0%
合成身份 synthetic
100.0%
第一方违约
96.2%
包装贷 loan_fraud
35.7%
身份冒用 identity
15.1%
AUC 0.8506 · 难度越高伪装越深,检出率随之下降——这是真实对抗难度,不是刷出来的数据。包装贷/身份冒用检出率低,正是因为 covert 伪装变体只留一个隐蔽异常。