数据概览

行数 (样本)
列数 (变量)
总缺失值
缺失比例 (%)


缺失变量统计

缺失模式可视化


插补后数据


对比:插补前后分布

收敛诊断 (mice only)


插补值密度
简单插补方法不提供收敛诊断。请使用 mice 方法查看诊断图。

多重插补 (Multiple Imputation) 指南

多重插补是解决缺失数据的统计方法,通过生成 m 个完整数据集来反映插补的不确定性。

缺失机制

  • MCAR — 完全随机缺失:缺失与任何变量无关。任何方法都适用。
  • MAR — 随机缺失:缺失与其他观测变量有关。mice 等模型插补适用。
  • MNAR — 非随机缺失:缺失与缺失值本身有关。需要专门的模型。

插补方法

  • PMM (预测均值匹配) — 默认推荐。保留变量间的相关性,避免不合理的值。
  • 正态分布插补 — 假设数据正态分布,适合连续变量。
  • 随机森林插补 — 非线性关系好,计算量大。
  • 均值/中位数 — 简单快速,但不考虑变量间关系,会低估方差。

参考文献

  • van Buuren, S. (2018). Flexible Imputation of Missing Data (2nd ed.). Chapman & Hall/CRC.
  • Rubin, D.B. (1987). Multiple Imputation for Nonresponse in Surveys. Wiley.