数据概览
行数 (样本)
列数 (变量)
总缺失值
缺失比例 (%)
缺失变量统计
缺失模式可视化
插补后数据
对比:插补前后分布
收敛诊断 (mice only)
插补值密度
简单插补方法不提供收敛诊断。请使用 mice 方法查看诊断图。
多重插补 (Multiple Imputation) 指南
多重插补是解决缺失数据的统计方法,通过生成 m 个完整数据集来反映插补的不确定性。
缺失机制
- MCAR — 完全随机缺失:缺失与任何变量无关。任何方法都适用。
- MAR — 随机缺失:缺失与其他观测变量有关。mice 等模型插补适用。
- MNAR — 非随机缺失:缺失与缺失值本身有关。需要专门的模型。
插补方法
- PMM (预测均值匹配) — 默认推荐。保留变量间的相关性,避免不合理的值。
- 正态分布插补 — 假设数据正态分布,适合连续变量。
- 随机森林插补 — 非线性关系好,计算量大。
- 均值/中位数 — 简单快速,但不考虑变量间关系,会低估方差。
参考文献
- van Buuren, S. (2018). Flexible Imputation of Missing Data (2nd ed.). Chapman & Hall/CRC.
- Rubin, D.B. (1987). Multiple Imputation for Nonresponse in Surveys. Wiley.