Definición
Medida de acuerdo entre dos evaluadores para clasificaciones categóricas corregida por el acuerdo esperado por azar; compara el acuerdo observado con el esperado bajo la independencia de los evaluadores y suele oscilar entre −1 y 1 (0 = acuerdo al nivel del azar).

Principio

Principio
Kappa aísla el acuerdo más allá del azar y depende tanto de la concordancia observada como de las prevalencias marginales de las categorías entre los evaluadores.

Demostración

Demostración
Escenario ilustrativo: dos patólogos clasifican de forma independiente 100 muestras como benignas o malignas. El acuerdo observado es 90 %, el acuerdo esperado por azar (dados los marginales) es 70 %, lo que da un kappa de Cohen ≈ 0,67, interpretado como acuerdo sustancial más allá del azar.

Aplicación incorrecta

Aplicación incorrecta
Interpretar valores de kappa sin considerar la prevalencia o el desequilibrio en las distribuciones marginales. El error común es ver un kappa bajo como indicio de mal acuerdo cuando existe un alto porcentaje de acuerdo (la 'paradoja del kappa'), o usar kappa para más de dos evaluadores sin adaptar la medida.

Consecuencia

Consecuencia
Kappa se usa ampliamente para informar sobre la fiabilidad entre evaluadores en clasificaciones categóricas; su uso no crítico puede infravalorar el acuerdo en categorías desequilibradas o inducir decisiones erróneas sobre selección de instrumentos y formación si se ignoran los efectos marginales.

Inversión

Inversión
Cuando las prevalencias de categoría son extremas o los marginales de los evaluadores difieren marcadamente, kappa puede ser bajo pese a un alto acuerdo observado; en esos casos, medidas ajustadas (ajuste por prevalencia/bias) o coeficientes alternativos (Gwet's AC1, porcentaje de acuerdo) pueden reflejar mejor la concordancia práctica.

Límite

Límite
Claramente dentro: dos evaluadores, resultados categóricos nominales. Caso límite: categorías ordinales, donde el kappa ponderado es más apropiado. Claramente fuera: configuraciones con varios evaluadores sin adaptación (usar Fleiss' kappa u otras medidas multi‑evaluador).

Tensión semántica

Tensión semántica
Porcentaje de acuerdo bruto (medida intuitiva) frente a acuerdo corregido por azar (kappa); tensión porque el porcentaje ignora el acuerdo esperado por azar mientras que kappa es sensible a prevalencia y sesgo.

Síntesis

Síntesis
El kappa de Cohen cuantifica el acuerdo más allá del azar entre dos evaluadores categóricos, pero debe interpretarse junto con el porcentaje de acuerdo, las distribuciones marginales y, cuando proceda, con estadísticas alternativas para evitar conclusiones equívocas en situaciones desequilibradas o multi‑evaluador.