CatBoost结果解读:类别特征编码与过拟合控制.docxVIP

  • 2
  • 0
  • 约1.72千字
  • 约 6页
  • 2026-07-29 发布于北京
  • 举报

CatBoost结果解读:类别特征编码与过拟合控制.docx

CatBoost分类模型结果解读

一、方法概述

CatBoost(CategoricalBoosting)是一种基于梯度提升决策树的机器学习算法,由Yandex公司开发。该算法在处理分类特征和序列数据方面具有显著优势,能够有效减少参数调优的工作量,并通过对称决策树结构降低过拟合风险。本研究利用SPSSAU软件对欺诈检测数据进行CatBoost分类建模分析,旨在通过用户行为特征变量预测欺诈行为,为金融风控提供科学依据。

在SPSSAU【机器学习】模块选择【CatBoost】,将变量拖拽至右侧对应分析框,操作如下图:

二、数据概览

本研究共纳入1000个样本,以换设备次数、支付失败次数、换IP次数、换IP国次数、交易金额5项指标作为自变量,以欺诈标签(0=非欺诈,1=欺诈)作为因变量进行分类建模。因变量分布如下表所示:

由表1可知,1000个样本中非欺诈样本(标签=0)为600例,占比60.00%;欺诈样本(标签=1)为400例,占比40.00%。数据无缺失值,全部纳入分析。

由表2可知,按照8:2的比例将数据划分为训练集(800个样本,占80.00%)和测试集(200个样本,占20.000%),用于模型训练与泛化能力评估。

三、特征权重分析

由表3可知,CatBoost模型的特征权重分布相较于LightGBM更为均衡。换设备次数的权重最高,为0.234(23.36%),对模型构建起

您可能关注的文档

文档评论(0)

1亿VIP精品文档

相关文档