使用说明
1. 逻辑回归
逻辑回归用于分析自变量(X)与二分类因变量(Y)之间的关系。模型形式:
logit(P) = ln(P/(1-P)) = β₀ + β₁X₁ + β₂X₂ + ... + ε
其中 P 为事件发生的概率。通过极大似然估计回归系数。
2. 优势比 (OR)
- OR > 1: 该变量为危险因素,增加事件发生概率
- OR = 1: 该变量对事件发生无影响
- OR < 1: 该变量为保护因素,降低事件发生概率
对于连续变量,OR 表示每增加 1 个单位时事件优势的变化倍数。
注:OR 的效应量参考基于 |ln(OR)|,实际解读应结合变量单位与专业知识。参考:|ln(OR)| < 0.1 极弱,0.1-0.5 弱,0.5-1.0 中,1.0-2.0 强,> 2.0 极强。
3. 模型拟合指标
- Null deviance: 仅截距模型的偏差
- Residual deviance: 完整模型的偏差
- AIC: 信息准则,越小越好
- McFadden R²: 伪 R²,0.2-0.4 为良好拟合
- Cox-Snell R² / Nagelkerke R²: 伪 R² 指标
- Cox–Snell R² 理论上限小于 1,Nagelkerke R² 将其缩放至 [0,1] 区间以便解释。
4. Hosmer-Lemeshow 检验
H-L 检验评估模型拟合优度。p > 0.05 表示模型拟合良好(不能拒绝拟合好的假设)。
注:H-L 检验对样本量敏感,大样本下可能过度敏感。
5. ROC 曲线与 AUC
ROC 曲线展示不同阈值下灵敏度(Sensitivity)与 1-特异度(Specificity)的关系。
AUC(曲线下面积)衡量模型判别能力:
- AUC < 0.6:较差
- 0.6 ≤ AUC < 0.7:可接受
- 0.7 ≤ AUC < 0.8:良好
- 0.8 ≤ AUC < 0.9:优秀
- AUC ≥ 0.9:卓越
6. 混淆矩阵
基于分类阈值(默认 0.5)将预测概率二分类,得到:
- 灵敏度 (Sensitivity/Recall): TP / (TP + FN),实际阳性中正确预测比例
- 特异度 (Specificity): TN / (TN + FP),实际阴性中正确预测比例
- 精确度 (Precision): TP / (TP + FP),预测阳性中正确比例
- F1 Score: 2 × Precision × Recall / (Precision + Recall)
- 准确率 (Accuracy): (TP + TN) / (TP + TN + FP + FN)
7. 逐步回归
逐步回归通过 AIC 自动选择变量:
- 双向 (Both): 结合向前和向后
- 向前 (Forward): 从空模型开始添加
- 向后 (Backward): 从全模型开始删除
8. 多重共线性
使用 VIF 检查自变量间共线性。VIF > 5 值得关注,> 10 表示严重共线性。含分类变量时使用 GVIF。
9. 前提假设
- 因变量为二分类
- 观测值之间相互独立
- 自变量与 logit 之间为线性关系(连续变量)
- 无严重多重共线性
- 样本量充足(每个自变量至少 10 个事件)
如有问题或建议,请联系管理员。