使用说明

1. 逻辑回归

逻辑回归用于分析自变量(X)与二分类因变量(Y)之间的关系。模型形式:

logit(P) = ln(P/(1-P)) = β₀ + β₁X₁ + β₂X₂ + ... + ε

其中 P 为事件发生的概率。通过极大似然估计回归系数。

2. 优势比 (OR)
  • OR > 1: 该变量为危险因素,增加事件发生概率
  • OR = 1: 该变量对事件发生无影响
  • OR < 1: 该变量为保护因素,降低事件发生概率

对于连续变量,OR 表示每增加 1 个单位时事件优势的变化倍数。

注:OR 的效应量参考基于 |ln(OR)|,实际解读应结合变量单位与专业知识。参考:|ln(OR)| < 0.1 极弱,0.1-0.5 弱,0.5-1.0 中,1.0-2.0 强,> 2.0 极强。

3. 模型拟合指标
  • Null deviance: 仅截距模型的偏差
  • Residual deviance: 完整模型的偏差
  • AIC: 信息准则,越小越好
  • McFadden R²: 伪 R²,0.2-0.4 为良好拟合
  • Cox-Snell R² / Nagelkerke R²: 伪 R² 指标
  • Cox–Snell R² 理论上限小于 1,Nagelkerke R² 将其缩放至 [0,1] 区间以便解释。
4. Hosmer-Lemeshow 检验

H-L 检验评估模型拟合优度。p > 0.05 表示模型拟合良好(不能拒绝拟合好的假设)。

注:H-L 检验对样本量敏感,大样本下可能过度敏感。

5. ROC 曲线与 AUC

ROC 曲线展示不同阈值下灵敏度(Sensitivity)与 1-特异度(Specificity)的关系。

AUC(曲线下面积)衡量模型判别能力:

  • AUC < 0.6:较差
  • 0.6 ≤ AUC < 0.7:可接受
  • 0.7 ≤ AUC < 0.8:良好
  • 0.8 ≤ AUC < 0.9:优秀
  • AUC ≥ 0.9:卓越
6. 混淆矩阵

基于分类阈值(默认 0.5)将预测概率二分类,得到:

  • 灵敏度 (Sensitivity/Recall): TP / (TP + FN),实际阳性中正确预测比例
  • 特异度 (Specificity): TN / (TN + FP),实际阴性中正确预测比例
  • 精确度 (Precision): TP / (TP + FP),预测阳性中正确比例
  • F1 Score: 2 × Precision × Recall / (Precision + Recall)
  • 准确率 (Accuracy): (TP + TN) / (TP + TN + FP + FN)
7. 逐步回归

逐步回归通过 AIC 自动选择变量:

  • 双向 (Both): 结合向前和向后
  • 向前 (Forward): 从空模型开始添加
  • 向后 (Backward): 从全模型开始删除
8. 多重共线性

使用 VIF 检查自变量间共线性。VIF > 5 值得关注,> 10 表示严重共线性。含分类变量时使用 GVIF。

9. 前提假设
  • 因变量为二分类
  • 观测值之间相互独立
  • 自变量与 logit 之间为线性关系(连续变量)
  • 无严重多重共线性
  • 样本量充足(每个自变量至少 10 个事件)

如有问题或建议,请联系管理员。