数据集概要

训练集数据预览(前100行)

变量类型分布


数据划分概览


训练集分布

验证集分布

测试集分布


各方法筛选结果汇总

下表展示每种方法筛选出的变量列表。

各方法选出变量数


交集筛选结果

Venn 图

各方法筛选结果集合的维恩图,展示各集合数量及交集数量。

变量被选次数热力图

行=自变量,列=筛选方法。绿色=被选中,灰色=未选中。

交集变量详情


逐步回归结果


              

逐步回归变量变化轨迹

展示每一步加入或剔除的变量及对应的AIC值。

模型摘要


              

变量系数表


训练集 / 验证集 / 测试集 性能对比

Nomogram 列线图

模型评价图

ROC 曲线
校准曲线

混淆矩阵(训练集)
混淆矩阵(验证集)
混淆矩阵(测试集)

DCA 决策曲线

Hosmer-Lemeshow 检验


              

FeatureSelector 使用指南

  1. 数据准备 :选择数据输入方式并指定因变量。支持单文件上传(自动按6:2:2划分)或分别导入训练/验证/测试集。
  2. 特征筛选 :从6种方法中选择>=3种。每种方法在 训练集 上独立运行,选出各自认为重要的变量。
  3. 取交集 :支持严格交集(所有方法都选中)或投票交集(>=N种方法选中)。交集结果作为逐步回归的候选变量。
  4. 逐步回归 :在训练集上进行前向/后向/双向逐步回归,按AIC准则优化模型。
  5. 建模评价 :用逐步回归结果建立Logistic回归模型,在验证集和测试集上评价性能。

6种筛选方法说明

最佳实践建议

  • 推荐组合 :LASSO + Boruta + 互信息(线性多变量 + 非线性多变量 + 非线性单变量)
  • 变量数 > 200 时,先用互信息或卡方/t检验粗筛到50-100个,再用LASSO/Boruta精选
  • 变量间高度相关(cor > 0.8)时,LASSO会随机保留一个,建议查看相关性矩阵
  • 交集后变量 < 3 个时,考虑放宽投票阈值或增加筛选方法
  • 逐步回归前检查VIF,VIF > 5 的变量考虑剔除以避免多重共线性