Upload data in wide format: each column = one rater/method, each row = one subject. Or use long format (Subject, Rater, Score) — auto-detected.
All six ICC forms (Shrout & Fleiss, 1979) calculated simultaneously.

Interpretation Guide (Cicchetti, 1994)

ICC Range Reliability
< 0.40 Poor
0.40 - 0.59 Fair
0.60 - 0.74 Good
>= 0.75 Excellent
ANOVA-based variance decomposition. Two methods are shown: (1) Variance components from expected mean squares (random effects model), (2) Descriptive total variance (grand mean - squared deviations - divided by nk-1). These two are NOT equivalent — see the relationship table below.

ANOVA Table


Method 1: Variance Components (from Expected Mean Squares)



Method 2: Total Variance (Descriptive / Grand Mean)

MS_total = sum((x_ij - grand_mean)^2) / (n*k - 1)

Note: This is descriptive spread, NOT the sum of random-effects variance components.

Relationship: Method 1 vs Method 2

E(MS_total) = sigma2_w + [(n-1)*k / (n*k-1)] * sigma2_b + [(k-1)*n / (n*k-1)] * sigma2_r

Coefficient (n-1)*k/(n*k-1) and (k-1)*n/(n*k-1) are generally not 1, so sigma2_b + sigma2_w + sigma2_r != MS_total.

Rater Profiles

Forest plot of all ICC forms with 95% CI, subject x rater heatmap, and spaghetti plot.

ICC Forest Plot


Subject x Rater Heatmap


Spaghetti Plot

ICCAnalyzer — 算法与帮助文档

1. 数据格式

宽格式(推荐):每行 = 一位受试者,每列 = 一位评定者。第一列可选为受试者编号。

Subject Rater_A Rater_B Rater_C
S01 72 70 75
S02 65 68 66
S03 88 85 89

2. ANOVA 分解(完整计算步骤)

对 n 位受试者、k 位评定者的两因素设计:

步骤 1:计算均值

  • 受试者均值:x̄ᵢ = (Σⱼ xᵢⱼ) / k
  • 评定者均值:x̄ⱼ = (Σᵢ xᵢⱼ) / n
  • 总均值:x̄̄ = (Σᵢ Σⱼ xᵢⱼ) / (nk)

步骤 2:计算平方和

  • SS_受试者 = k × Σᵢ (x̄ᵢ − x̄̄)²
  • SS_评定者 = n × Σⱼ (x̄ⱼ − x̄̄)²
  • SS_总 = Σᵢ Σⱼ (xᵢⱼ − x̄̄)²
  • SS_误差 = SS_总 − SS_受试者 − SS_评定者

步骤 3:自由度与均方

  • df_受试者 = n − 1, MS_受试者 = SS_受试者 / df_受试者
  • df_评定者 = k − 1, MS_评定者 = SS_评定者 / df_评定者
  • df_误差 = (n − 1)(k − 1), MS_误差 = SS_误差 / df_误差
  • F_受试者 = MS_受试者 / MS_误差
  • F_评定者 = MS_评定者 / MS_误差

3. 六种 ICC 公式(Shrout & Fleiss, 1979)

形式 公式 含义
ICC(1,1) (MSb − MSe) / [MSb + (k−1)·MSe] 单一度量,随机评定者,一致性
ICC(1,k) (MSb − MSe) / MSb k 个度量平均,随机评定者
ICC(2,1) (MSb − MSe) / [MSb + (k−1)·MSe + k·(MSr−MSe)/n] 单一度量,固定评定者集合,绝对一致
ICC(2,k) (MSb − MSe) / [MSb + (MSr−MSe)/n] k 个度量平均,固定评定者集合
ICC(3,1) (MSb − MSe) / [MSb + (k−1)·MSe] 单一度量,固定评定者,一致性
ICC(3,k) (MSb − MSe) / MSb k 个度量平均,固定评定者

注意:ICC(1,·) 和 ICC(3,·) 公式表面相同,但使用场景不同。ICC(1,·) 假设每次测量由不同的随机评定者完成;ICC(3,·) 假设是同一批固定评定者。数值上两者可能相等,但解释不同。

4. 置信区间(F 分布近似法)

使用 F = MS_受试者 / MS_误差,查 F 分布临界值:

  • F_L = qf(0.975, df_受试者, df_误差)
  • F_U = qf(0.025, df_受试者, df_误差)
ICC 下限 上限
ICC(1,1) (F−F_L) / [F + (k−1)·F_L] (F−F_U) / [F + (k−1)·F_U]
ICC(1,k) (F−F_L) / F (F−F_U) / F
ICC(2,1) (F−F_L) / [F + (k−1)·F_L + k·(F_评定者−1)/n] 同左,换 F_U
ICC(2,k) (F−F_L) / [F + (F_评定者−1)/n] 同左,换 F_U
ICC(3,1) (F−F_L) / [F + (k−1)·F_L] 同左,换 F_U
ICC(3,k) (F−F_L) / F (F−F_U) / F

截断规则:CI 下限若计算为负值,截断到 0。点估计保留原始值(可以为负)。

5. 方差分量(两种方法对比)

Method 1:随机效应方差分量(来自期望均方)

这是 ICC 的理论基础。

  • σ²_b(受试者间)= (MS_受试者 − MS_误差) / k
  • σ²_r(评定者间)= (MS_评定者 − MS_误差) / n
  • σ²_w(误差)= MS_误差
  • 总方差 = σ²_b + σ²_r + σ²_w

Method 2:描述性总方差(总均值法)

不假设随机效应模型,纯描述统计:

  • MS_总 = SS_总 / (nk − 1)

为什么两者不等价?

E(MS_总) = σ²_w + [(n−1)·k / (nk−1)]·σ²_b + [(k−1)·n / (nk−1)]·σ²_r

系数 (n−1)·k/(nk−1) 和 (k−1)·n/(nk−1) 通常不等于 1,因此 Method 1 的方差分量之和不等于 Method 2 的 MS_总。

  • Method 1:按研究设计的随机效应模型正确分解方差
  • Method 2:忽略设计结构,纯数据驱动的描述性离散度

ICC 使用 Method 1,因为它与随机效应模型的方差分解一致。

6. 负方差分量说明

当 MS_受试者 < MS_误差 或 MS_评定者 < MS_误差 时,Method 1 可能给出负的 σ²_b 或 σ²_r。

原因

  • 方差分量是估计值而非计算值,抽样波动可能导致负值
  • 这意味着真实效应很可能接近零,负值是随机抽样的结果

ICCAnalyzer 的处理

  • 保留原始负值(真实反映数据),ICC 值不截断
  • Variance Components 表格中若出现负值,自动标注 “Negative estimate (likely near zero)”

7. 完整手算示例

用 3 位受试者 × 3 位评定者的简化数据验证:

Subject R1 R2 R3 行均值
S1 10 12 11 11.0
S2 15 14 16 15.0
S3 20 19 21 20.0
列均值 15.0 15.0 16.0 总均值 = 15.333

ANOVA

  • SS_受试者 = 3 × [(11−15.333)² + (15−15.333)² + (20−15.333)²] = 3 × 18.889 + 0.111 + 21.778] = 3 × 40.778 = 122.333
  • SS_评定者 = 3 × [(15−15.333)² + (15−15.333)² + (16−15.333)²] = 3 × [0.111 + 0.111 + 0.444] = 2.000
  • SS_总 = ΣΣ(x−15.333)² = 125.333
  • SS_误差 = 125.333 − 122.333 − 2.000 = 1.000

均方

  • MS_受试者 = 122.333 / 2 = 61.167
  • MS_评定者 = 2.000 / 2 = 1.000
  • MS_误差 = 1.000 / 4 = 0.250
  • F = 61.167 / 0.250 = 244.667

ICC

  • ICC(1,1) = (61.167 − 0.250) / (61.167 + 2×0.250) = 60.917 / 61.667 = 0.988
  • ICC(3,1) = 同 ICC(1,1) = 0.988
  • ICC(1,k) = (61.167 − 0.250) / 61.167 = 0.996
  • ICC(3,k) = 同 ICC(1,k) = 0.996

方差分量

  • σ²_b = (61.167 − 0.250) / 3 = 20.306
  • σ²_r = (1.000 − 0.250) / 3 = 0.250
  • σ²_w = 0.250
  • 总和 = 20.806

Method 2

  • MS_总 = 125.333 / 8 = 15.667

验证关系: E(MS_总) = 0.250 + [(3−1)×3/(9−1)]×20.306 + [(3−1)×3/(9−1)]×0.250 = 0.250 + 0.75×20.306 + 0.75×0.250 = 0.250 + 15.230 + 0.188 = 15.667

8. 结果解读(Cicchetti, 1994)

ICC 值 可靠性等级
< 0.40 Poor(差)
0.40 – 0.59 Fair(一般)
0.60 – 0.74 Good(良好)
≥ 0.75 Excellent(优秀)

9. 选择哪种 ICC?

第一步:评定者是随机的还是固定的?

  • 从总体中随机抽取 → Model 1 或 2(ICC(1,·) 或 ICC(2,·))
  • 只有这特定几位评定者 → Model 3(ICC(3,·))

第二步:关注单一度量还是平均度量?

  • 临床实际只测一次 → ICC(·,1)
  • 报告平均值(如 3 次测量取平均)→ ICC(·,k)

第三步:要求绝对一致还是相对一致?

  • 绝对一致(评定者评分必须数值接近)→ ICC(2,·)
  • 只要求排序一致(允许系统偏差)→ ICC(3,·)(一致性)

参考文献

  • Shrout, P.E. & Fleiss, J.L. (1979). Intraclass correlations: uses in assessing rater reliability. Psychological Bulletin, 86(2), 420-428.
  • McGraw, K.O. & Wong, S.P. (1996). Forming inferences about some intraclass correlation coefficients. Psychological Methods, 1(1), 30-46.
  • Cicchetti, D.V. (1994). Guidelines, criteria, and rules of thumb for evaluating normed and standardized assessment instruments in psychology. Psychological Assessment, 6(4), 284-290.