基于数据挖掘的企业失信识别模型研究

第1页 / 共29页

第2页 / 共29页

第3页 / 共29页

第4页 / 共29页

第5页 / 共29页

第6页 / 共29页

第7页 / 共29页

第8页 / 共29页
试读已结束,还剩21页,您可下载完整版后进行离线阅读

文档主要内容

基于数据挖掘的企业失信识别模型研究,是一篇北京理工大学珠海学院2020届本科生毕业论文,主要面向数据挖掘、企业信用评估领域的研究者、学生及相关从业者。该文档系统阐述了如何运用数据挖掘技术构建企业失信预测模型,为大数据环境下企业违法风险识别提供了可操作的方法论参考。

在数据预处理阶段,研究首先利用Python的pandas包对原始数据进行缺失值统计,剔除缺失率超过30%的指标,随后移除对失信判定无显著影响的19个指标,最终保留12个有效指标。针对剩余缺失数据,基于KNN算法原理,借助R语言的dmwr包完成填充。此外,对数据类型、登记机关、企业状态及管辖机关四个指标进行了可视化分析,以揭示数据分布特征。

模型构建环节,研究分别采用决策树、随机森林和梯度提升决策树三种算法建立企业失信识别模型,并通过准确率、召回率、混淆矩阵及ROC曲线进行综合评估。结果显示,决策树预测准确率为90.9%,随机森林为92%,梯度提升决策树达到92.57%。然而,三种决策树家族模型的AUC值均处于0.51至0.61区间,表明模型预测稳定性不足。为提升性能,研究进一步尝试多层感知机(MLP)模型,其预测准确率同样为92%,但AUC值稳定在0.89,显著优于决策树类模型。

该论文的核心价值在于:第一,完整展示了从数据清洗、特征选择到模型训练与评估的流程,为同类研究提供了标准化步骤;第二,通过对比多种算法,明确了MLP模型在企业失信识别任务中的优势,尤其在稳定性方面表现突出;第三,研究结论可直接应用于企业信用风险预警系统的开发,帮助金融机构、监管部门快速筛选失信企业。文档内容严谨,数据详实,适合作为相关课题的参考范本或教学案例。

基于数据挖掘的企业失信识别模型研究-知知文库网
基于数据挖掘的企业失信识别模型研究
此内容为付费资源,请付费后查看
2.99
限时特惠
20
付费资源
© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发
头像-知知文库网
欢迎您留下宝贵的见解!
提交
头像-知知文库网

昵称

取消
昵称表情代码图片快捷回复

    暂无评论内容