来源:Forecasting 发布时间:2026/10/9 15:06:32
选择字号:小 中 大
识别投资准备就绪的中小企业:提升股权获取与经济增长的机器学习框架 | MDPI Forecasting|

论文标题:Identification of Investment-Ready SMEs: A Machine Learning Framework to Enhance Equity Access and Economic Growth

论文链接:https://www.mdpi.com/2571-9394/7/3/51

期刊名:Forecasting

期刊主页:https://www.mdpi.com/journal/forecasting

前言

中小企业是经济增长、就业与创新的核心驱动力,但其获取外部融资常因信息不对称和风险感知而受阻,这一融资缺口成为制约发展的关键瓶颈。早期研究多采用财务比率、评分系统和定性评估等传统方法,这些方法虽有一定参考价值,但受限于模型对线性关系的假设和对历史财务数据的过度依赖,在捕捉创新、管理能力等复杂非线性因素时往往表现不佳。机器学习技术的引入为挖掘多维数据中的复杂交互模式提供了新可能,其中梯度提升、随机森林、支持向量机等模型在处理高维、含噪数据与提升预测精度方面展现出明显优势。

然而,现有模型仍面临四大挑战:一是SAFE(Survey on Access to Finance of Enterprises,企业融资渠道调查)调查数据呈现典型的类别不平衡问题(投资准备就绪企业仅占12%,非投资准备就绪企业占88%),传统准确率指标在此类场景下完全失效;二是问卷数据中存在显著的响应噪声和主观偏差,单一算法难以同时保证对多数类和少数类的高识别能力;三是现有评估体系多仅关注预测精度,忽略了误分类的实际经济后果——漏判一家投资准备就绪企业所产生的机会成本(我们将其称为假阴性)远高于误判一家非投资准备就绪企业(我们将其称为假阳性),而少有模型针对这种不对称成本进行优化;四是专门针对中小企业投资准备就绪预测的机器学习研究极为有限,多数应用集中于信用评分或股市预测等更广泛的金融领域,缺乏针对融资准备度这一特定问题的模型设计与验证。

针对这些问题,本研究提出一种融合不平衡处理与成本敏感评估的机器学习预测框架,系统对比九种算法(LR (Logistic Regression,逻辑回归)、KNN(K-Nearest Neighbors,K-近邻)、RF(Random Forest, 随机森林)、SVM(Support Vector Machin,支持向量机)、NB(Naive Baye,朴素贝叶斯)、AdaBoost(Adaptive Boosting)、EE(Easy Ensemble)、Balanced Bagging(Balanced Bagging Classifier)、GB(Gradient Boosting,梯度提升)在不平衡数据集上的表现,引入平衡准确率、ROC AUC(Receiver Operating Characteristic Curve Area Under the Curve,接收者操作特征曲线和曲线下面积)及不对称误分类成本(假阴性成本为假阳性五倍)作为评估准则,并采用VIM(Variable Importance Measure,变量重要性度量)与SHAP(Shapley Additive exPlanations,沙普利加法解释)进行特征重要性交叉验证,旨在为投资者与政策制定者突破传统评估方法的线性局限、化解数据不平衡与噪声干扰、以及实现经济最优的筛选决策提供可行的技术路径。

研究过程与结果

本研究围绕以下核心方面展开:一是系统比较九种机器学习算法(LR、KNN、RF、SVM、NB、AdaBoost、EE、Balanced Bagging、GB)在识别投资准备就绪中小企业中的表现,以平衡准确率、ROC AUC、精确率、召回率及F1-分数作为评价指标,识别各模型在不平衡数据集上的预测优势与误差特征;二是引入类别权重与成本敏感评估机制,将假负例(漏判投资准备就绪企业)成本设定为假正例的五倍,量化误分类的实际经济后果,从而筛选出经济成本最优的模型;三是构建基于VIM与SHAP的特征重要性交叉验证框架,用于识别谈判信心、融资增长、未来融资规划、外部融资条件、组织自主性及投资者意愿等核心预测因子,并进一步整合多维度问卷变量,以提升模型对复杂非线性关系的建模能力。

针对上述问题,本研究提出了基于平衡类别权重的成本敏感机器学习框架,即通过为少数类(投资准备就绪)分配更高权重并在成本函数中赋予其五倍误分类代价的方式,引导模型优先关注投资准备就绪企业;同时采用分层5折交叉验证与网格搜索进行超参数调优,结合VIM与SHAP双重视角解释模型决策依据。

为验证上述方法的有效性,实验选取了欧洲央行SAFE数据集。该数据集涵盖了欧洲各国中小企业的定性调查回答,包含创新活动、增长状况、融资来源、谈判信心等51个变量,经过清洗后保留10,937条有效样本,呈现典型的类别不平衡特性(投资准备就绪仅占12%,非投资准备就绪占88%),符合真实投资筛选环境的信息不对称、噪声干扰与样本稀疏特征。在模型选择上,研究构建了多层次对比体系:以LR代表传统计量经济学基线;KNN代表基于实例的非参数方法;RF与GB代表Bagging与Boosting集成策略;SVM代表核方法分类器;NB代表概率生成式模型;AdaBoost、EE和Balanced Bagging则代表专门针对不平衡数据设计的集成方法。九类模型在假设复杂度、对不平衡数据的适应性与可解释性方面差异显著,能够全面评估所提方法对不同算法架构的普适性。为评估预测性能,采用平衡准确率、ROC AUC、精确率、召回率、F1-分数及总误分类成本六项指标。实验基于80/20的训练/验证集划分,结合分层5折交叉验证策略,验证了梯度提升模型在实际投资筛选环境中的综合表现。实验结果表明:梯度提升模型实现了75.4%的平衡准确率和0.815的ROC AUC值,在不对称成本条件下总误分类成本最低(908),且VIM与SHAP识别的核心特征高度一致,为突破传统评估方法的线性局限、化解数据不平衡与噪声干扰提供了可行的技术路径。

研究总结

本研究提出的基于梯度提升与成本敏感评估的机器学习框架实现了不平衡数据集上投资准备就绪识别准确率与经济效用的双重突破:GB模型在SAFE数据集上的平衡准确率达到75.4%,ROC AUC达到0.815,假负例识别率(召回率)为71.3%;在不对称误分类成本(假负例成本为假正例的五倍)条件下,总误分类成本降至908,低于逻辑回归的914及随机森林的936,相对成本降低约3.1%。并且VIM与SHAP两种解释方法识别的前六位关键特征(谈判信心、融资增长、未来融资规划、外部融资条件、组织自主性、投资者意愿)排序高度一致,确保了模型决策的可解释性稳定性。该框架为破解中小企业融资评估中的信息不对称与数据不平衡难题、优化投资者筛选效率及降低误分类经济成本提供了高效数据驱动路径。

Forecasting期刊介绍

主编:Prof. Dr. Sonia Leva, Department of Energy, Politecnico di Milano, Italy

Forecasting(ISSN 2571-9394)是一个国际性、同行评审的开放获取期刊,致力于打造预测科学领域的国际化开放交流平台。本刊聚焦前沿预测方法与理论研究,重点关注AI、机器学习等在预测科学研究中的创新应用,鼓励多场景预测应用探索,如经济金融,能源电力,气候环境,灾害安全等。期刊目前已被Scopus、ESCI (Web of Science)、EBSCO、ANVUR等多个重要数据库收录。

分区信息:JCR-Q1 (Multidisciplinary Sciences) /CiteScore- Q1 (Economics, Econometrics and Finance (miscellaneous))

2025 Impact Factor
4.2
2025 CiteScore
7.1
Time to First Decision
23.8 Days
Acceptance to Publication
2.9 Days

所有文章对读者免费,版权由作者持有,重复使用期刊发表的文章无需特别许可。

 
 
 
特别声明:本文转载仅仅是出于传播信息的需要,并不意味着代表本网站观点或证实其内容的真实性;如其他媒体、网站或个人从本网站转载使用,须保留本网站注明的“来源”,并自负版权等法律责任;作者如果不希望被转载或者联系转载稿费等事宜,请与我们接洽。
 
 打印  发E-mail给: 
    
 
相关新闻 相关论文

图片新闻
科学网2026年9月十佳博文榜单公布! 我国科学家首次实验观测到临界拓扑物态
中国科大实现抗噪声量子密钥分发 他们为二维滑移铁电体装原子层“方向盘”
>>更多
 
一周新闻排行
 
编辑部推荐博文