

第1页 / 共29页

第2页 / 共29页

第3页 / 共29页

第4页 / 共29页

第5页 / 共29页

第6页 / 共29页

第7页 / 共29页

第8页 / 共29页
试读已结束,还剩21页,您可下载完整版后进行离线阅读
文档主要内容
基于数据挖掘的企业失信识别模型研究,是一篇北京理工大学珠海学院2020届本科生毕业论文,主要面向数据挖掘、企业信用评估领域的研究者、学生及相关从业者。该文档系统阐述了如何运用数据挖掘技术构建企业失信预测模型,为大数据环境下企业违法风险识别提供了可操作的方法论参考。
在数据预处理阶段,研究首先利用Python的pandas包对原始数据进行缺失值统计,剔除缺失率超过30%的指标,随后移除对失信判定无显著影响的19个指标,最终保留12个有效指标。针对剩余缺失数据,基于KNN算法原理,借助R语言的dmwr包完成填充。此外,对数据类型、登记机关、企业状态及管辖机关四个指标进行了可视化分析,以揭示数据分布特征。
模型构建环节,研究分别采用决策树、随机森林和梯度提升决策树三种算法建立企业失信识别模型,并通过准确率、召回率、混淆矩阵及ROC曲线进行综合评估。结果显示,决策树预测准确率为90.9%,随机森林为92%,梯度提升决策树达到92.57%。然而,三种决策树家族模型的AUC值均处于0.51至0.61区间,表明模型预测稳定性不足。为提升性能,研究进一步尝试多层感知机(MLP)模型,其预测准确率同样为92%,但AUC值稳定在0.89,显著优于决策树类模型。
该论文的核心价值在于:第一,完整展示了从数据清洗、特征选择到模型训练与评估的流程,为同类研究提供了标准化步骤;第二,通过对比多种算法,明确了MLP模型在企业失信识别任务中的优势,尤其在稳定性方面表现突出;第三,研究结论可直接应用于企业信用风险预警系统的开发,帮助金融机构、监管部门快速筛选失信企业。文档内容严谨,数据详实,适合作为相关课题的参考范本或教学案例。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END

















暂无评论内容