Zwei Mittelwerte statistisch vergleichen
Der t-Test prüft, ob sich die Mittelwerte zweier Gruppen so deutlich unterscheiden, dass der Unterschied kaum noch durch Zufall erklärbar ist. Typische Fragen sind: Schneiden Schüler mit neuer Lernmethode besser ab? Hält eine neue Charge länger als die alte? Wirkt ein Dünger auf den Ertrag? Für den Test genügen pro Gruppe drei Kennzahlen: Mittelwert, Standardabweichung und Anzahl der Beobachtungen.
Dieser Rechner nutzt die Variante nach Welch. Sie setzt keine gleichen Varianzen in beiden Gruppen voraus und gilt deshalb heute als Standard für unabhängige Stichproben. Die Freiheitsgrade werden nach der Welch-Satterthwaite-Formel berechnet und sind meist keine ganze Zahl. Sind Varianzen und Gruppengrößen gleich, stimmt das Ergebnis praktisch mit dem klassischen Student-t-Test überein.
Der p-Wert gibt an, wie wahrscheinlich eine mindestens so große Differenz wäre, wenn in Wahrheit kein Unterschied besteht. Liegt er unter dem gewählten Signifikanzniveau, meist 5 Prozent, wird die Nullhypothese gleicher Mittelwerte verworfen. Zusätzlich zeigt der Rechner das Konfidenzintervall der Differenz und die Effektstärke Cohens d.
Ergebnis richtig lesen
Ein nicht signifikantes Ergebnis bedeutet nicht, dass beide Gruppen gleich sind. Es heißt nur, dass die Daten nicht ausreichen, um einen Unterschied nachzuweisen. Im Beispiel liegt die Null knapp im Konfidenzintervall, die Differenz von 4 Punkten könnte aber durchaus real sein. Mit größeren Stichproben würde derselbe Unterschied wahrscheinlich signifikant. Den nötigen Umfang schätzt der Stichprobengrößen-Rechner ab.
Umgekehrt ist ein signifikantes Ergebnis nicht automatisch bedeutsam. Bei sehr großen Stichproben werden auch winzige Unterschiede signifikant. Deshalb lohnt der Blick auf die Effektstärke: Cohens d von etwa 0,2 gilt als kleiner, 0,5 als mittlerer und 0,8 als großer Effekt. Im Beispiel liegt d bei 0,44, also zwischen klein und mittel.
Ein- oder zweiseitig: Der zweiseitige Test fragt nur, ob sich die Mittelwerte unterscheiden. Hatten Sie vorab eine klare Richtung festgelegt, etwa dass Gruppe 1 besser ist, dürfen Sie den einseitigen p-Wert nutzen, der halb so groß ist. Die Richtung muss aber vor der Datenerhebung feststehen, sonst ist das Ergebnis verzerrt.
Voraussetzungen sind unabhängige Stichproben und annähernd normalverteilte Mittelwerte. Ab etwa 30 Beobachtungen pro Gruppe ist der Test auch bei leicht schiefen Daten robust. Für verbundene Messungen, etwa vorher und nachher an denselben Personen, ist der gepaarte t-Test richtig, nicht dieser Rechner. Für Häufigkeiten statt Mittelwerten eignet sich der Chi-Quadrat-Test.
Tipps und typische Fehler
Mittelwerte vergleichen.
- Welch: Als Standard.
- Effekt: Cohens d beachten.
- Einseitig: Nur mit Vorab-Hypothese.
- Gepaart: Anderer Test.
Weitere Rechner: Mathe & Formeln
Häufige Fragen
Was ist der Welch-Test?
Ein t-Test für zwei unabhängige Stichproben, der keine gleichen Varianzen voraussetzt.
Wann ist ein t-Test signifikant?
Wenn der p-Wert kleiner als das gewählte Signifikanzniveau ist, meist 0,05.
Brauche ich die Rohdaten?
Nein, Mittelwert, Standardabweichung und Stichprobenumfang je Gruppe genügen.
Was ist der Unterschied zwischen Welch- und Student-t-Test?
Der Student-Test setzt gleiche Varianzen voraus, der Welch-Test nicht.
Welche Effektstärke ist groß?
Nach Cohen gilt d ab etwa 0,8 als großer Effekt.
- t-Test berechnen
- Welch-Test Rechner
- t-Test zwei Stichproben
- p-Wert berechnen t-Test
- Mittelwertvergleich
- t-Test unabhängige Stichproben
Alle Berechnungen erfolgen direkt in Ihrem Browser, Ihre Eingaben werden nicht übertragen oder gespeichert. Die Ergebnisse sind Orientierungswerte ohne Gewähr und ersetzen keine steuerliche, rechtliche oder finanzielle Beratung. Die Erklärtexte auf dieser Seite wurden mit KI erstellt. Letzte inhaltliche Änderung dieser Seite: . Mehr dazu: So entstehen und prüfen wir die Rechner.