Übereinstimmung jenseits des Zufalls
Wenn zwei Personen dieselben Fälle einstufen, etwa Röntgenbilder, Interviewaussagen oder Aufsätze, stimmen sie auch dann teilweise überein, wenn sie raten. Der einfache Anteil gleicher Urteile überschätzt deshalb die Zuverlässigkeit. Jacob Cohen schlug 1960 in Educational and Psychological Measurement ein Maß vor, das die zufällig erwartete Übereinstimmung herausrechnet: Kappa.
Die beobachtete Übereinstimmung p₀ ist die Summe der Diagonale geteilt durch die Fallzahl. Die erwartete Übereinstimmung pₑ ergibt sich aus den Randsummen: Für jede Kategorie werden die Anteile beider Beurteiler multipliziert und die Produkte addiert. Kappa ist der Anteil der möglichen Verbesserung gegenüber dem Zufall, die tatsächlich erreicht wurde. Ein Wert von 1 bedeutet vollständige Übereinstimmung, 0 eine Übereinstimmung wie zufällig, negative Werte weniger als zufällig.
Zusätzlich zeigt der Rechner das maximal mögliche Kappa. Es entsteht, wenn bei den gegebenen Randsummen so viele Fälle wie möglich auf der Diagonale liegen. Weichen die Beurteiler grundsätzlich in der Häufigkeit ab, mit der sie Kategorien vergeben, kann Kappa die 1 gar nicht erreichen.
Kappa bewerten und berichten
Für die Einordnung wird meist die Skala von Landis und Koch (1977) genutzt: bis 0,20 etwas, 0,21 bis 0,40 ausreichend, 0,41 bis 0,60 mittelmäßig, 0,61 bis 0,80 beachtlich und darüber fast vollkommen. Die Grenzen sind Konventionen, keine statistisch begründeten Schwellen. In der Medizin werden für diagnostische Entscheidungen oft deutlich höhere Werte verlangt als in der qualitativen Sozialforschung.
Kappa hängt von der Verteilung der Kategorien ab. Ist eine Kategorie sehr selten, kann Kappa trotz hoher Übereinstimmung niedrig ausfallen; dieses Phänomen ist als Kappa-Paradox bekannt. Berichten Sie deshalb immer auch die beobachtete Übereinstimmung und die Kreuztabelle selbst. Das Konfidenzintervall nutzt den einfachen Standardfehler nach Cohen und ist bei kleinen Stichproben nur eine Näherung.
Der Rechner berechnet das ungewichtete Kappa, bei dem jede Abweichung gleich zählt. Bei geordneten Kategorien wie Schweregraden ist ein gewichtetes Kappa sinnvoller, das kleine Abweichungen weniger bestraft. Für mehr als zwei Beurteiler eignet sich Fleiss' Kappa, für stetige Messwerte der Intraklassen-Korrelationskoeffizient.
Verbessern lässt sich die Übereinstimmung meist durch klarere Kategoriendefinitionen, Ankerbeispiele und gemeinsame Schulungen vor der eigentlichen Codierung. Für die interne Konsistenz einer Skala mit mehreren Items nutzen Sie dagegen Cronbachs Alpha.
Tipps und typische Fehler
Codierung absichern.
- Leitfaden: Mit Ankerbeispielen.
- Schulung: Vorab üben.
- Tabelle: Mitberichten.
- Ordinal: Gewichtet rechnen.
Mehr zum Thema Statistische Tests und Konfidenzintervalle
Häufige Fragen
Ab wann ist Cohens Kappa gut?
Nach Landis und Koch gelten Werte über 0,60 als beachtlich und über 0,80 als fast vollkommen.
Kann Kappa negativ sein?
Ja, wenn die Beurteiler seltener übereinstimmen, als per Zufall zu erwarten wäre.
Wie viele Kategorien sind möglich?
Der Rechner verarbeitet quadratische Tabellen mit 2 bis 10 Kategorien.
Was ist Interrater-Reliabilität?
Das Ausmaß, in dem unabhängige Beurteiler dieselben Fälle gleich einstufen.
Was ist das Kappa-Paradox?
Hohe Übereinstimmung bei niedrigem Kappa, wenn eine Kategorie sehr selten ist.
- Cohens Kappa berechnen
- Interrater-Reliabilität
- Kappa Übereinstimmung
- Kappa Landis Koch
- Beurteilerübereinstimmung
- Kappa Kreuztabelle
Alle Berechnungen erfolgen direkt in Ihrem Browser, Ihre Eingaben werden nicht übertragen oder gespeichert. Die Ergebnisse sind Orientierungswerte ohne Gewähr und ersetzen keine steuerliche, rechtliche oder finanzielle Beratung. Die Erklärtexte auf dieser Seite wurden mit KI erstellt. Letzte inhaltliche Änderung dieser Seite: . Mehr dazu: So entstehen und prüfen wir die Rechner.