Interpretation Guide (Cicchetti, 1994)
| ICC Range | Reliability |
|---|---|
| < 0.40 | Poor |
| 0.40 - 0.59 | Fair |
| 0.60 - 0.74 | Good |
| >= 0.75 | Excellent |
ANOVA Table
Method 1: Variance Components (from Expected Mean Squares)
Method 2: Total Variance (Descriptive / Grand Mean)
Note: This is descriptive spread, NOT the sum of random-effects variance components.
Relationship: Method 1 vs Method 2
Coefficient (n-1)*k/(n*k-1) and (k-1)*n/(n*k-1) are generally not 1, so sigma2_b + sigma2_w + sigma2_r != MS_total.
Rater Profiles
ICC Forest Plot
Subject x Rater Heatmap
Spaghetti Plot
ICCAnalyzer — 算法与帮助文档
1. 数据格式
宽格式(推荐):每行 = 一位受试者,每列 = 一位评定者。第一列可选为受试者编号。
| Subject | Rater_A | Rater_B | Rater_C |
|---|---|---|---|
| S01 | 72 | 70 | 75 |
| S02 | 65 | 68 | 66 |
| S03 | 88 | 85 | 89 |
2. ANOVA 分解(完整计算步骤)
对 n 位受试者、k 位评定者的两因素设计:
步骤 1:计算均值
- 受试者均值:x̄ᵢ = (Σⱼ xᵢⱼ) / k
- 评定者均值:x̄ⱼ = (Σᵢ xᵢⱼ) / n
- 总均值:x̄̄ = (Σᵢ Σⱼ xᵢⱼ) / (nk)
步骤 2:计算平方和
- SS_受试者 = k × Σᵢ (x̄ᵢ − x̄̄)²
- SS_评定者 = n × Σⱼ (x̄ⱼ − x̄̄)²
- SS_总 = Σᵢ Σⱼ (xᵢⱼ − x̄̄)²
- SS_误差 = SS_总 − SS_受试者 − SS_评定者
步骤 3:自由度与均方
- df_受试者 = n − 1, MS_受试者 = SS_受试者 / df_受试者
- df_评定者 = k − 1, MS_评定者 = SS_评定者 / df_评定者
- df_误差 = (n − 1)(k − 1), MS_误差 = SS_误差 / df_误差
- F_受试者 = MS_受试者 / MS_误差
- F_评定者 = MS_评定者 / MS_误差
3. 六种 ICC 公式(Shrout & Fleiss, 1979)
| 形式 | 公式 | 含义 |
|---|---|---|
| ICC(1,1) | (MSb − MSe) / [MSb + (k−1)·MSe] | 单一度量,随机评定者,一致性 |
| ICC(1,k) | (MSb − MSe) / MSb | k 个度量平均,随机评定者 |
| ICC(2,1) | (MSb − MSe) / [MSb + (k−1)·MSe + k·(MSr−MSe)/n] | 单一度量,固定评定者集合,绝对一致 |
| ICC(2,k) | (MSb − MSe) / [MSb + (MSr−MSe)/n] | k 个度量平均,固定评定者集合 |
| ICC(3,1) | (MSb − MSe) / [MSb + (k−1)·MSe] | 单一度量,固定评定者,一致性 |
| ICC(3,k) | (MSb − MSe) / MSb | k 个度量平均,固定评定者 |
注意:ICC(1,·) 和 ICC(3,·) 公式表面相同,但使用场景不同。ICC(1,·) 假设每次测量由不同的随机评定者完成;ICC(3,·) 假设是同一批固定评定者。数值上两者可能相等,但解释不同。
4. 置信区间(F 分布近似法)
使用 F = MS_受试者 / MS_误差,查 F 分布临界值:
- F_L = qf(0.975, df_受试者, df_误差)
- F_U = qf(0.025, df_受试者, df_误差)
| ICC | 下限 | 上限 |
|---|---|---|
| ICC(1,1) | (F−F_L) / [F + (k−1)·F_L] | (F−F_U) / [F + (k−1)·F_U] |
| ICC(1,k) | (F−F_L) / F | (F−F_U) / F |
| ICC(2,1) | (F−F_L) / [F + (k−1)·F_L + k·(F_评定者−1)/n] | 同左,换 F_U |
| ICC(2,k) | (F−F_L) / [F + (F_评定者−1)/n] | 同左,换 F_U |
| ICC(3,1) | (F−F_L) / [F + (k−1)·F_L] | 同左,换 F_U |
| ICC(3,k) | (F−F_L) / F | (F−F_U) / F |
截断规则:CI 下限若计算为负值,截断到 0。点估计保留原始值(可以为负)。
5. 方差分量(两种方法对比)
Method 1:随机效应方差分量(来自期望均方)
这是 ICC 的理论基础。
- σ²_b(受试者间)= (MS_受试者 − MS_误差) / k
- σ²_r(评定者间)= (MS_评定者 − MS_误差) / n
- σ²_w(误差)= MS_误差
- 总方差 = σ²_b + σ²_r + σ²_w
Method 2:描述性总方差(总均值法)
不假设随机效应模型,纯描述统计:
- MS_总 = SS_总 / (nk − 1)
为什么两者不等价?
E(MS_总) = σ²_w + [(n−1)·k / (nk−1)]·σ²_b + [(k−1)·n / (nk−1)]·σ²_r
系数 (n−1)·k/(nk−1) 和 (k−1)·n/(nk−1) 通常不等于 1,因此 Method 1 的方差分量之和不等于 Method 2 的 MS_总。
- Method 1:按研究设计的随机效应模型正确分解方差
- Method 2:忽略设计结构,纯数据驱动的描述性离散度
ICC 使用 Method 1,因为它与随机效应模型的方差分解一致。
6. 负方差分量说明
当 MS_受试者 < MS_误差 或 MS_评定者 < MS_误差 时,Method 1 可能给出负的 σ²_b 或 σ²_r。
原因:
- 方差分量是估计值而非计算值,抽样波动可能导致负值
- 这意味着真实效应很可能接近零,负值是随机抽样的结果
ICCAnalyzer 的处理:
- 保留原始负值(真实反映数据),ICC 值不截断
- Variance Components 表格中若出现负值,自动标注 “Negative estimate (likely near zero)”
7. 完整手算示例
用 3 位受试者 × 3 位评定者的简化数据验证:
| Subject | R1 | R2 | R3 | 行均值 |
|---|---|---|---|---|
| S1 | 10 | 12 | 11 | 11.0 |
| S2 | 15 | 14 | 16 | 15.0 |
| S3 | 20 | 19 | 21 | 20.0 |
| 列均值 | 15.0 | 15.0 | 16.0 | 总均值 = 15.333 |
ANOVA:
- SS_受试者 = 3 × [(11−15.333)² + (15−15.333)² + (20−15.333)²] = 3 × 18.889 + 0.111 + 21.778] = 3 × 40.778 = 122.333
- SS_评定者 = 3 × [(15−15.333)² + (15−15.333)² + (16−15.333)²] = 3 × [0.111 + 0.111 + 0.444] = 2.000
- SS_总 = ΣΣ(x−15.333)² = 125.333
- SS_误差 = 125.333 − 122.333 − 2.000 = 1.000
均方:
- MS_受试者 = 122.333 / 2 = 61.167
- MS_评定者 = 2.000 / 2 = 1.000
- MS_误差 = 1.000 / 4 = 0.250
- F = 61.167 / 0.250 = 244.667
ICC:
- ICC(1,1) = (61.167 − 0.250) / (61.167 + 2×0.250) = 60.917 / 61.667 = 0.988
- ICC(3,1) = 同 ICC(1,1) = 0.988
- ICC(1,k) = (61.167 − 0.250) / 61.167 = 0.996
- ICC(3,k) = 同 ICC(1,k) = 0.996
方差分量:
- σ²_b = (61.167 − 0.250) / 3 = 20.306
- σ²_r = (1.000 − 0.250) / 3 = 0.250
- σ²_w = 0.250
- 总和 = 20.806
Method 2:
- MS_总 = 125.333 / 8 = 15.667
验证关系: E(MS_总) = 0.250 + [(3−1)×3/(9−1)]×20.306 + [(3−1)×3/(9−1)]×0.250 = 0.250 + 0.75×20.306 + 0.75×0.250 = 0.250 + 15.230 + 0.188 = 15.667 ✓
8. 结果解读(Cicchetti, 1994)
| ICC 值 | 可靠性等级 |
|---|---|
| < 0.40 | Poor(差) |
| 0.40 – 0.59 | Fair(一般) |
| 0.60 – 0.74 | Good(良好) |
| ≥ 0.75 | Excellent(优秀) |
9. 选择哪种 ICC?
第一步:评定者是随机的还是固定的?
- 从总体中随机抽取 → Model 1 或 2(ICC(1,·) 或 ICC(2,·))
- 只有这特定几位评定者 → Model 3(ICC(3,·))
第二步:关注单一度量还是平均度量?
- 临床实际只测一次 → ICC(·,1)
- 报告平均值(如 3 次测量取平均)→ ICC(·,k)
第三步:要求绝对一致还是相对一致?
- 绝对一致(评定者评分必须数值接近)→ ICC(2,·)
- 只要求排序一致(允许系统偏差)→ ICC(3,·)(一致性)
参考文献
- Shrout, P.E. & Fleiss, J.L. (1979). Intraclass correlations: uses in assessing rater reliability. Psychological Bulletin, 86(2), 420-428.
- McGraw, K.O. & Wong, S.P. (1996). Forming inferences about some intraclass correlation coefficients. Psychological Methods, 1(1), 30-46.
- Cicchetti, D.V. (1994). Guidelines, criteria, and rules of thumb for evaluating normed and standardized assessment instruments in psychology. Psychological Assessment, 6(4), 284-290.