Datawhale&天池贷款违约预测——Task1赛题理解

Datawhale&天池贷款违约预测——Task1赛题理解

文章目录

1 赛题理解

贷款违约预测是赛题以金融风控中的个人信贷为背景,要求选手根据贷款申请人的数据信息预测其是否有违约的可能,以此判
断是否通过此项贷款,这是一个典型的分类问题。通过这道赛题来引导大家了解金融风控中的一些业务背景,解
决实际问题。

1.1 比赛目的

参加这次比赛目的就是入门金融风控的知识,增加知识储备。

1.2 赛题简要介绍

赛题以预测金融风险为任务,数据集报名后可见并可下载,该数据来自某信贷平台的贷款记录,总数据量超过
120w,包含47列变量信息,其中15列为匿名变量。为了保证比赛的公平性,将会从中抽取80万条作为训练集,20万条作为测试集A,20万条作为测试集B,同时会对employmentTitle、purpose、postCode和title等信息进行脱敏。
详细信息参考链接: 比赛链接.

1.3 相关评价指标

赛题最终评价指标提交结果为每个测试样本是1的概率,也就是y为1的概率。评价方法为AUC评估模型效果。
AUC定义为ROC曲线下方与坐标轴围成的面积。
AUC的取值范围在0.5和1之间。AUC越接近1.0,检测方法真实性越高;等于0.5时,则真实性最低,无应用价值。

1.4 分类算法常用的评价指标

  1. 混淆矩阵
    若实例为正类,预测为正类,即为真正类(TP)
    若实例为正类,预测为负类,即为假负类(FN)
    若实例是负类,预测为正类,即为假正类(FP)
    若实例是负类,预测为负类,即为真负类(TN)

  2. 准确率(accuracy)
    准确率是常用的一个评价指标,预测正确的样本数占总预测样本数的比值,不适合样本不均衡的情况。因为如果我们的正负样本数目差别很大,比如正样本1000个,负样本99000个,那么直接把所有的样本都预测为负, 准确率为99%,但是此分类模型实际性能是非常差的,因为它把所有正样本都分错了。
    a c c u r a c y = T P + T N T P + T N + F P + F N accuracy=\cfrac{TP+TN}{TP+TN+FP+FN}accuracy=TP+TN+FP+FNTP+TN

  3. 精确率(precision)
    即为真正类与被预测为正类的的比值。
    p r e c i s i o n = T P T P + F P precision=\cfrac{TP}{TP+FP}precision=TP+FPTP

  4. 召回率(Recall)
    即为真正类与正样本的比值。
    R e c a l l = T P T P + F N Recall=\cfrac{TP}{TP+FN}Recall=TP+FNTP

  5. F1 Score
    精确率和召回率是相互影响的,精确率升高则召回率下降,召回率升高则精确率下降,如果需要兼顾二者,就需要精确率、召回率的结合F1 Score。
    F 1 S c o r e = 2 × p r e c i s o n × r e c a l l p r e c i s o n + r e c a l l F1\;Score=2\times\cfrac{precison\times recall}{precison+recall}F1Score=2×precison+recallprecison×recall

  6. P-R曲线
    描述precision和recall两个值的曲线。

  7. ROC曲线
    ROC空间将假正例率(FPR)定义为 X 轴,真正例率(TPR)定义为 Y 轴。
    TPR:True Positive Rate,真正率, TPR代表能将正例分对的概率。
    FPR: False Positive Rate, 假正率, FPR代表将负例错分为正例的概率。
    roc

roc曲线中的四个点和一条线
  • (0,1) 表示所有样本都正确分类,这是一个完美的分类器;
  • (1,0) 表示所有样本都分类错误,这是一个最糟糕的分类器;
  • (0, 0) 表示所有样本都分类为负;
  • (1,1) 表示左右样本都分类为正;
    结论:当roc曲线越靠近左上角时,分类效果越好。
  1. AUC(Area Under roc CurveROC)
    AUC的面积越大,分类效果越好。 0.5 <= AUC <= 1。

  2. K-S曲线
    KS曲线的横坐标为阈值,纵坐标为在不同阈值划分下的TPR与FPR的差值。
    根据预测的结果的概率值,将样本从大到小排序后,用阈值划分,大于该阈值为正样本,小于该阈值为负样本。然后计算TPR,FPR和它们之间的差值。
    TPR与FPR之间最大的差值,也就是KS曲线的顶点处就是KS值。
    K S = m a x ( T P R − F P R ) KS=max(TPR-FPR)KS=max(TPRFPR)
    阈值为[0,1]之间的数,一般选取(0.1,0.2,0.3,0.4,0.5,0.6,0.7,0.8,0.9,1.0)这十个点,也可以将每个样本点作为阈值。

KS值可以用来评估模型对正负样本的区分能力。
  • KS值<0.2,一般认为模型没有区分能力。
  • KS值[0.2,0.3],模型具有一定区分能力,勉强可以接受。
  • KS值[0.3,0.5],模型具有较强的区分能力。
  • KS值大于0.75,往往表示模型有异常。

版权声明:本文为loft_原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接和本声明。