Was ein A/B-Test misst – und was nicht
Beim A/B-Test versendest du zwei Varianten derselben Kampagne an zwei zufällig gebildete Teilgruppen deiner Liste und vergleichst eine vorher festgelegte Kennzahl. Entscheidend ist das Wort „zufällig“: Nur wenn die beiden Gruppen bis auf die getestete Variable gleich zusammengesetzt sind, lässt sich der Unterschied auf die Variable zurückführen. Wer Variante A an die Kontakte aus dem Shop und Variante B an die Messekontakte schickt, misst nicht die Betreffzeile, sondern die Herkunft.
Ein A/B-Test beantwortet immer nur eine Frage: Ist der beobachtete Unterschied größer, als er durch Zufall zustande kommen könnte? Er beantwortet nicht, warum die Variante gewonnen hat, und er sagt auch nichts darüber, ob der Unterschied wirtschaftlich relevant ist. Zwei Prozentpunkte mehr Öffnungen bei einer Liste von 800 Kontakten sind 16 Personen.
Die sechs testbaren Elemente, nach Hebel sortiert
- Betreffzeile. Sieht jeder Empfänger, ändert sich in Minuten, wirkt direkt auf die Öffnung. Sinnvolle Gegensatzpaare: Frage gegen Aussage, mit Zahl gegen ohne Zahl, kurz gegen lang, mit Personalisierung gegen ohne.
- Absendername. Person, Firma oder beides („Anna von Musterfirma“). Der zweitgrößte Hebel und der am seltensten getestete – dabei entscheidet er im Posteingang oft vor der Betreffzeile.
- Pre-Header. Der Vorschautext hinter dem Betreff. Bleibt er leer, zeigen viele Clients die ersten Zeilen des Mailtexts an, im schlechtesten Fall „Wenn diese Mail nicht korrekt dargestellt wird …“.
- Call-to-Action. Beschriftung, Position und Anzahl der Buttons. Zielgröße ist hier die Klickrate, nicht die Öffnungsrate – der Test muss also entsprechend größer ausfallen.
- Versandzeitpunkt. Technisch ein A/B-Test wie jeder andere, praktisch der aufwendigste: Er muss über mehrere Kampagnen wiederholt werden, weil einzelne Tage von Feiertagen, Nachrichtenlagen und Urlaubszeiten überlagert werden.
- Inhaltsstruktur. Lang gegen kurz, mit Bild gegen ohne, ein Thema gegen mehrere. Der Effekt ist meist klein und deshalb nur bei großen Listen sauber nachweisbar.
Schritt für Schritt: den Test im Tool aufsetzen
- Kampagne anlegen und „A/B-Test“ auswählen – je nach Tool heißt der Schalter „Split-Test“, „A/B-Test“ oder „Multivariater Test“. Er muss vor dem Schreiben aktiviert werden; nachträglich lässt sich eine fertige Kampagne in den meisten Tools nicht mehr in einen Test umwandeln.
- Testvariable festlegen. Genau eine. Wer Betreff und Absender gleichzeitig ändert, weiß hinterher nicht, welches der beiden gewirkt hat.
- Varianten schreiben, die sich wirklich unterscheiden. „Unser Newsletter im März“ gegen „Unser Newsletter für März“ ist kein Test, sondern verbrannte Reichweite.
- Zielmetrik auswählen. Öffnungsrate bei Betreff- und Absendertests, Klickrate bei CTA- und Inhaltstests. Manche Tools bieten „Klicks pro Öffnung“ – das ist die sauberere Größe für Inhaltstests, weil sie den Öffnungseffekt herausrechnet.
- Aufteilung wählen. Standard ist 10 / 10 / 80: je zehn Prozent an die Varianten, der Rest bekommt automatisch den Gewinner. Das ist bei großen Listen richtig und bei kleinen der häufigste Fehler – siehe das Rechenbeispiel unten.
- Testdauer setzen. 4 bis 24 Stunden. Kürzer bevorzugt systematisch die Empfänger, die gerade am Rechner sitzen.
- Vor dem Start beide Varianten als Testmail an dich selbst schicken. Ein Tippfehler in Variante B verfälscht das Ergebnis und geht anschließend automatisch an 80 Prozent der Liste.
Wie groß muss der Test sein? Die Zahlen
Die Frage lässt sich rechnen. Für den Vergleich zweier Anteile gilt bei 95 Prozent Konfidenzniveau und 80 Prozent Teststärke die Standardformel n = 7,85 × (p₁(1−p₁) + p₂(1−p₂)) / d², wobei d der Unterschied ist, den du erkennen willst. Bei einer Basis-Öffnungsrate um 22 Prozent ergibt das je Variante:
| Zu erkennender Unterschied | Empfänger je Variante | Gesamtliste bei 10/10/80 |
|---|---|---|
| 5 Prozentpunkte (22 % gegen 27 %) | rund 1.100 | rund 11.000 |
| 3 Prozentpunkte (22 % gegen 25 %) | rund 3.000 | rund 30.000 |
| 2 Prozentpunkte (22 % gegen 24 %) | rund 6.700 | rund 67.000 |
| 1 Prozentpunkt (22 % gegen 23 %) | rund 26.900 | rund 269.000 |
Die dritte Spalte ist der eigentliche Befund: Wer die Standardaufteilung 10 / 10 / 80 benutzt, testet nur mit einem Zehntel seiner Liste. Bei 5.000 Kontakten sind das 500 Empfänger je Variante – damit lassen sich rechnerisch erst Unterschiede ab etwa 7 Prozentpunkten absichern. Betreffzeilen unterscheiden sich selten so deutlich.
Die Konsequenz für kleine Listen
Bei einer Liste unter etwa 10.000 Kontakten ist die 10/10/80-Aufteilung der falsche Weg. Besser: 50 / 50 auf die gesamte Liste, ohne automatischen Gewinnerversand. Bei 5.000 Kontakten sind das 2.500 Empfänger je Variante – damit sind Unterschiede ab rund 3,3 Prozentpunkten nachweisbar statt erst ab 7. Den Gewinner setzt du dann in der nächsten Kampagne ein. Du verlierst die Automatik, gewinnst aber überhaupt erst eine belastbare Aussage.
Warum die Öffnungsrate als Zielgröße schwierig geworden ist
Die Öffnungsrate wird über ein 1×1-Pixel-Bild gemessen, das beim Anzeigen der Mail vom Server geladen wird. Apples Mail Privacy Protection lädt dieses Bild seit iOS 15 vorab über einen Proxy – auch dann, wenn der Empfänger die Mail nie geöffnet hat. Bei Listen mit hohem Apple-Mail-Anteil ist die Öffnungsrate dadurch systematisch nach oben verzerrt, und zwar für beide Varianten gleichermaßen. Für einen Vergleich ist das weniger schlimm als für eine absolute Kennzahl, es verwässert aber den Unterschied: Ein Teil der gezählten Öffnungen reagiert auf keine Betreffzeile.
Deshalb gilt: Betreffzeilen-Tests bleiben sinnvoll, ihre Ergebnisse sollten aber nicht auf die zweite Nachkommastelle interpretiert werden. Wo es geht, ist die Klickrate die ehrlichere Zielgröße. Sie hat allerdings eine kleinere Basis – bei 3 Prozent Klickrate braucht ein Unterschied von einem Prozentpunkt rund 4.600 Empfänger je Variante.
Fünf Fehler, die Ergebnisse wertlos machen
- Ständiges Nachschauen und Abbrechen beim ersten Vorsprung. Wer stündlich prüft und stoppt, sobald eine Variante vorne liegt, findet zuverlässig Gewinner – auch dort, wo keine sind. Testdauer vorher festlegen und einhalten.
- Zwei Variablen gleichzeitig. Neuer Betreff und neuer Absender ergeben ein Ergebnis ohne Ursache.
- Nicht-zufällige Aufteilung. Wenn du die Varianten auf zwei Segmente statt auf zwei Zufallshälften verteilst, misst du das Segment. Wie sich Segmente sauber schneiden lassen, steht in unserer Anleitung zur Newsletter-Segmentierung.
- Ergebnisse aus einer einzigen Kampagne verallgemeinern. Ein gewonnener Emoji-Test im Dezember ist keine Regel für den Rest des Jahres. Belastbar wird ein Muster erst, wenn es sich über mehrere Kampagnen wiederholt.
- Testen, während die Technik nicht steht. Wenn ein Teil der Mails im Spam landet, misst du Zustellbarkeit statt Betreffzeile. Erst SPF, DKIM und DMARC in Ordnung bringen – wie das geht, steht in unserem Leitfaden zur Newsletter-Zustellbarkeit.
Was das Tool automatisch tun sollte
Drei Funktionen unterscheiden brauchbare von rudimentären A/B-Funktionen:
- Automatischer Gewinnerversand nach Ablauf der Testphase, mit frei wählbarer Zielmetrik.
- Mehr als zwei Varianten – manche Tools erlauben drei bis fünf. Achtung: Jede zusätzliche Variante verkleinert die Gruppen und vergrößert das nötige Sample.
- Ergebnisanzeige mit absoluten Zahlen, nicht nur mit Prozentwerten. „24 % gegen 22 %“ ist ohne die dazugehörigen Empfängerzahlen nicht interpretierbar.
A/B-Tests bieten alle acht Tools in unserem Test an; unterschiedlich ist, ab welchem Tarif. In unserer offenen Tool-Datenbank sind zwei Zuordnungen ausdrücklich hinterlegt: Brevo führt A/B-Tests bereits im Starter-Tarif ab 7 €, CleverReach dagegen erst im Pro-Tarif ab 18 € – der Basic-Tarif für 15 € enthält sie nicht. Für die übrigen Tools steht die tarifgenaue Zuordnung nicht im Datensatz; sie gehört vor dem Abschluss auf der Preisseite des Anbieters geprüft.
| Tool | Server | Einstieg | Zustellbarkeit im Test | Note |
|---|---|---|---|---|
| Brevo | Frankreich / Deutschland | ab 7 €/Monat (A/B ab Starter) | 95 % | 4,3/5 |
| Mailerlite | EU (Litauen) | ab 12 USD/Monat | 96 % | 4,5/5 |
| GetResponse | EU (Polen) | ab 16 €/Monat | 95 % | 4,4/5 |
| CleverReach | Deutschland | ab 15 €/Monat (A/B ab Pro, 18 €) | 96 % | 4,2/5 |
| KlickTipp | Deutschland | ab 30 €/Monat | 99,78 % | 4,3/5 |
| Omnisend | EU (AWS Europe) und UK | ab 16 USD/Monat | 95 % | 4,4/5 |
| rapidmail | Deutschland (Freiburg, Frankfurt) | ab 15 €/Monat | 95 % | 4,2/5 |
| ActiveCampaign | USA (EU-Datacenter optional) | ab 15 USD/Monat | 94 % | 4,0/5 |
Mailerlite, Omnisend und ActiveCampaign rechnen in US-Dollar ab – die Beträge sind Original-Angaben der Anbieter, keine Umrechnung. Die Zustellbarkeitswerte stammen aus unserem 12-Wochen-Praxistest, die Methodik dahinter steht auf der Seite Methodik.
Wenn der Tarif über den Test entscheidet
Für kleine Listen ist die Tarifstufe die eigentliche Hürde: Wer A/B-Tests fahren will, aber im günstigsten Tarif bleibt, hat die Funktion je nach Anbieter gar nicht. Brevo bringt sie schon im Starter-Tarif für 7 € mit, CleverReach erst mit dem Pro-Tarif für 18 € – dafür mit deutschen Servern und deutschsprachigem Support.
Brevo kostenlos testen (Anzeige) CleverReach ansehen (Anzeige)
Ein realistischer Testplan über zwölf Wochen
Statt bei jeder Kampagne etwas anderes auszuprobieren, lohnt sich eine feste Reihenfolge – jeweils zwei Kampagnen pro Frage, damit ein Muster überhaupt sichtbar wird:
- Woche 1 bis 4: Absendername. Person gegen Firma. Das Ergebnis gilt danach dauerhaft und muss nie wieder getestet werden.
- Woche 5 bis 8: Betreffzeilen-Stil. Frage gegen Aussage, danach mit Zahl gegen ohne.
- Woche 9 bis 12: Call-to-Action. Ein Button gegen drei, Zielmetrik ist hier die Klickrate.
Notiere für jeden Test die absoluten Zahlen, nicht nur die Prozentwerte – sonst lässt sich später nicht mehr nachvollziehen, ob ein Ergebnis überhaupt tragfähig war. Wer die Grundlagen davor noch aufbauen muss, findet den kompletten Ablauf in unserer Anleitung zum Newsletter erstellen; welches der acht Tools in Preis, Serverstandort und Funktionsumfang zu deinem Fall passt, klärt der große Newsletter-Tool-Vergleich.
Häufige Fragen
Die Betreffzeile, aber nicht wegen der Öffnungsrate allein: Sie ist das einzige Element, das jeder Empfänger sieht, und sie lässt sich in fünf Minuten variieren. Danach folgt der Absendername, dann der Call-to-Action. Layout-Tests lohnen sich zuletzt, weil ihr Effekt am kleinsten und damit am schwersten nachweisbar ist.
Das hängt davon ab, wie groß der Unterschied ist, den du erkennen willst. Bei einer Basis-Öffnungsrate um 22 Prozent braucht man je Variante rund 1.100 Empfänger, um einen Unterschied von 5 Prozentpunkten abzusichern, rund 3.000 für 3 Punkte und rund 6.700 für 2 Punkte. Ein Test mit 200 Empfängern je Variante kann rechnerisch nur Unterschiede jenseits von 11 Punkten belegen.
Mindestens 4 Stunden, besser 24. Kürzer bevorzugt systematisch die Empfänger, die tagsüber am Rechner sitzen. Wichtiger als die Dauer ist aber die Disziplin, das Ergebnis nicht laufend zu beobachten und beim ersten Vorsprung abzubrechen: Wer mehrfach hineinschaut und dann stoppt, wenn es gerade gut aussieht, produziert Scheinsieger.
Weil sie über ein unsichtbares Bild gemessen wird. Apples Mail Privacy Protection lädt dieses Bild seit iOS 15 vorab über einen Proxy, auch wenn der Empfänger die Mail nie öffnet. Bei Listen mit vielen Apple-Mail-Nutzern ist die Öffnungsrate deshalb nach oben verzerrt. Klicks sind die belastbarere Zielgröße, brauchen wegen der kleineren Basisrate aber mehr Empfänger.