Signifikanz verstehen, ohne Statistikvorlesung

Was „95 % signifikant“ wirklich bedeutet, warum das Intervall wichtiger ist als der p-Wert und woran du einen Scheingewinner erkennst.

Inhalt dieses Artikels
  1. Was 95 % wirklich sagen
  2. Das Intervall sagt mehr als der p-Wert
  3. Vier Anzeichen für einen Scheingewinner
  4. Der Umgang mit „kein Unterschied“

Signifikanz ist der am häufigsten falsch zitierte Begriff im A/B-Testing. Er bedeutet nicht „die Variante ist besser“ und schon gar nicht „die Variante ist 18 % besser“. Er beantwortet eine engere Frage, und die ist trotzdem nützlich.

Was 95 % wirklich sagen

Ein signifikantes Ergebnis auf dem 95-Prozent-Niveau heißt: Wenn es in Wahrheit keinen Unterschied gäbe, würdest du einen so großen gemessenen Unterschied in höchstens 5 von 100 Tests trotzdem sehen. Es ist eine Aussage über die Methode, nicht über deine konkrete Variante.

Daraus folgt etwas Unbequemes: Wer zwanzig Ziele gleichzeitig auswertet, findet im Schnitt einen „signifikanten“ Gewinner allein durch Zufall. Deshalb legst du vor dem Start ein Hauptziel fest, der Rest ist Kontext.

Das Intervall sagt mehr als der p-Wert

„Signifikant“ ist ein Ja/Nein. Das Konfidenzintervall sagt dir dagegen, wie groß der Unterschied plausibel ist. Ein Ergebnis von „+6 Prozentpunkte, Intervall +3 bis +9“ ist eine belastbare Verbesserung. „+6 Prozentpunkte, Intervall −1 bis +13“ ist derselbe Mittelwert, und praktisch wertlos.

Faustregel: Schau zuerst auf das Intervall. Liegt die Null darin, hast du kein Ergebnis, egal wie schön der Mittelwert aussieht. Ist das Intervall sehr breit, brauchst du mehr Daten, nicht mehr Interpretation.

Vier Anzeichen für einen Scheingewinner

  • Der Test wurde beendet, sobald er gut aussah, nicht als die geplante Stichprobe erreicht war.
  • Die Traffic-Aufteilung weicht deutlich von der geplanten ab, dann stimmt die Zuweisung nicht.
  • Der Gewinn kommt aus einem einzelnen Tag oder einem einzelnen Segment.
  • Das Hauptziel wurde nach dem Test gewechselt, weil ein anderes besser aussah.

Der Umgang mit „kein Unterschied“

Etwa die Hälfte aller sauber durchgeführten Tests endet ohne klaren Gewinner. Das ist kein gescheiterter Test, sondern eine beantwortete Frage: Diese Änderung bewegt nichts, also brauchst du sie nicht zu bauen und kannst die nächste Idee testen.

Wertvoll wird das erst, wenn du es festhältst. Sonst testet in zwei Jahren jemand dieselbe Idee noch einmal.

Mach die nächste Änderung zu einer informierten

Weniger raten.
Öfter wissen.

Eine Frage ist ein guter Anfang.