Customer Impact

Growth & Strategie

Statistische power voor growth experimenten: zo voorkom je valse conclusies

Kopieer voor AI

De meeste A/B-tests bewijzen niets. Niet omdat het idee slecht was, maar omdat de test te weinig statistische power had om een echt effect te zien. Je draait twee weken, ziet een verschil van een paar procent, roept een winnaar uit en rolt hem uit. Drie maanden later blijkt de winst verdampt. TL;DR: power en het minimum detecteerbaar effect bepalen of een experiment überhaupt een conclusie kán dragen. Plan je ze niet vooraf in, dan stuur je je hele growth programma op toeval. In dit artikel lees je wat statistische power is, hoe je een MDE kiest en waarom je dit op programmaniveau moet bekijken, niet per losse test.

Eerlijk vooraf: dit is het minst sexy onderdeel van experimenteren en tegelijk het belangrijkste. Wie het overslaat, bouwt een testprogramma dat druk oogt maar geen betrouwbare leereffecten oplevert.

Wat statistische power eigenlijk betekent

Statistische power is de kans dat je test een echt bestaand effect ook daadwerkelijk als significant detecteert. Stel dat je nieuwe variant de conversie echt verbetert. Power is dan de waarschijnlijkheid dat je experiment dat verschil oppikt in plaats van het te missen.

Een test met lage power is als een te grofmazig net: er zwemmen vissen in het water, maar je vangt ze niet. Het effect is er, je test ziet het alleen niet. Het gevolg is een vals-negatief: je concludeert “geen verschil” terwijl de variant in werkelijkheid wint. Je gooit een goed idee weg.

Aan de andere kant zit het risico van overhaaste conclusies. Test je op te weinig data en stop je zodra je een mooi getal ziet, dan pik je vooral ruis op. Toevallige schommelingen zien er op kleine schaal uit als echte winst. Dat is de vals-positief: je rolt iets uit dat in de praktijk niets oplevert.

Power gaat dus over de eerste fout (echte effecten missen), het significantieniveau over de tweede (ruis aanzien voor signaal). In de praktijk wordt vaak gewerkt met een power van rond de 80 procent als ondergrens. Lager betekent dat je structureel winnaars laat liggen en niet eens weet welke.

Het minimum detecteerbaar effect: je belangrijkste keuze

Voordat je een test start, moet je één vraag beantwoorden: hoe groot moet het effect minimaal zijn om de moeite waard te zijn? Dat is je minimum detecteerbaar effect, het MDE. Het is het kleinste verschil dat je test betrouwbaar kan oppikken én dat groot genoeg is om er een beslissing op te baseren.

Het MDE is geen statistisch trucje, het is een businesskeuze. Een verbetering van een fractie van een procent op je hoofdconversie is misschien echt, maar levert te weinig op om de implementatie en het risico te rechtvaardigen. Door vooraf te bepalen welk effect ertoe doet, voorkom je dat je weken besteedt aan het najagen van marges die niets veranderen aan je pipeline.

Hier zit een harde wetmatigheid: hoe kleiner het effect dat je wilt kunnen detecteren, hoe meer data je nodig hebt. Een groot effect zie je snel, een klein effect vraagt veel meer bezoekers en dus veel meer tijd. Vier variabelen hangen onlosmakelijk samen:

  • Basisconversie: hoe je huidige variant presteert.
  • MDE: het kleinste verschil dat je wilt kunnen zien.
  • Power: de kans dat je dat verschil detecteert.
  • Steekproefgrootte: het aantal bezoekers per variant.

Zet er drie vast en de vierde ligt vast. Wil je een klein MDE met hoge power op een lage basisconversie? Dan heb je veel verkeer nodig. Heb je dat verkeer niet, dan moet je je MDE vergroten of accepteren dat de test inconclusief blijft. Er is geen ontsnappen aan deze rekensom.

Reken het uit voordat je begint

De fout die de meeste teams maken: een test starten en achteraf kijken of het significant werd. Dat is de omgekeerde wereld. Bereken vooraf hoeveel bezoekers en conversies je per variant nodig hebt, en hoeveel kalenderdagen dat met jouw verkeer kost.

Een eenvoudige steekproefcalculator volstaat. Je voert je basisconversie, gewenste MDE en powerniveau in en krijgt het aantal bezoekers per variant. Deel dat door je dagelijkse verkeer en je weet hoe lang de test moet lopen. Soms is het antwoord ontnuchterend: een test die maanden zou duren is geen test die je moet draaien. Beter dat nu weten dan na drie verspilde weken.

Let ook op de looptijd zelf. Draai altijd in volle weken om dag-van-de-week-effecten en koopcycli mee te nemen. B2B-verkeer op dinsdag gedraagt zich anders dan op zaterdag. Stop je halverwege een week, dan vertekent dat je resultaat. En stop nooit zodra een tussentijdse meting toevallig significant lijkt; dat zogenoemde gluren naar de data blaast je foutmarge op en is een van de grootste bronnen van valse winnaars.

Waarom je power op programmaniveau bekijkt

Hier zit de echte les, en hij wordt bijna altijd gemist. Power is geen eigenschap van één test. Het is een eigenschap van je hele experimenteerprogramma in verhouding tot het verkeer dat je hebt.

Stel: je hebt een bescheiden hoeveelheid verkeer op je belangrijkste landingspagina. Dan kun je per kwartaal maar een beperkt aantal tests met voldoende power afronden. Dat is geen tekortkoming, dat is je realiteit. De vraag is niet “kan ik deze ene test draaien?” maar “welke experimenten kan ik met mijn verkeer betrouwbaar afronden, en welke daarvan hebben de grootste verwachte impact?”

Die framing verandert hoe je prioriteert. Op pagina’s met weinig verkeer hebben kleine optimalisaties geen kans: het MDE dat je realistisch kunt detecteren is zo groot dat alleen ingrijpende veranderingen het halen. Daar test je dus geen knopkleur, maar een compleet andere aanpak. Op pagina’s met veel verkeer kun je wél fijnmaziger werken. Je verdeelt je testcapaciteit naar waar power en impact samenvallen.

Dit is precies waarom experimenteren niet op zichzelf staat maar onderdeel is van een groter geheel. Als je growth marketing ziet als het systeem dat SEO, content, CRO en paid in één groeimotor orkestreert, dan is verkeer geen gegeven maar een hefboom. Meer gekwalificeerd verkeer betekent meer tests met voldoende power, betekent sneller leren, betekent een sneller draaiende motor. Je experimenteerprogramma en je acquisitiekanalen versterken elkaar.

GROWTH-MOTOR Verkeer en experimenten versterken elkaar herhaal & versnel 01 Meer verkeer gekwalificeerd 02 Meer tests met power hogere drempel haalbaar 03 Sneller leren betrouwbare conclusies 04 Snellere groeimotor trekt weer verkeer
Meer gekwalificeerd verkeer maakt meer goed gepowerde tests mogelijk, wat sneller leren en groei oplevert.

Op programmaniveau let je daarom op een paar dingen:

  • Verkeersbudget per test: verdeel je bezoekers bewust over experimenten in plaats van overal tegelijk te testen en alles te onderpoweren.
  • Realistische MDE’s per pagina: stem het effect dat je najaagt af op het verkeer dat de pagina krijgt.
  • Doorlooptijd als beslisfactor: een test die te lang duurt om af te ronden, hoort niet in je roadmap.
  • Leersnelheid boven testaantal: niet het aantal tests telt, maar het aantal betrouwbare conclusies.

Wanneer je een test beter niet draait

Soms is de eerlijkste keuze: niet testen. Heb je te weinig verkeer om binnen een redelijke termijn power te halen op een realistisch MDE, dan levert een A/B-test geen bewijs maar een illusie van bewijs. In dat geval kun je beter beslissen op basis van vuistregels, kwalitatief onderzoek en ervaring, en je testcapaciteit bewaren voor pagina’s waar het wél kan.

Dat is geen capitulatie. Het is het verschil tussen een team dat denkt dat het data-gedreven werkt en een team dat het echt is. Valse zekerheid is duurder dan eerlijke onzekerheid, want op valse zekerheid bouw je verkeerde beslissingen.

Wil je weten hoeveel betrouwbare experimenten jouw verkeer aankan en welke prioriteiten daarbij horen? Onze aanpak als growth marketing agency begint juist hier: niet bij losse tests, maar bij een programma dat past bij je cijfers en stuurt op leads, omzet en pipeline. Voor de bredere context lees je hoe je statistische significantie bij A/B-testen interpreteert en hoe een growth experiment van hypothese naar leereffect loopt.

Conclusie

Statistische power en het minimum detecteerbaar effect zijn geen statistische bijzaak, het zijn de fundering onder elk betrouwbaar experiment. Reken vooraf uit wat je nodig hebt, kies een MDE dat er voor je business toe doet, en beoordeel power niet per test maar op programmaniveau in verhouding tot je verkeer. Zo stop je met sturen op ruis en begin je met leren wat echt werkt.

Wil je een experimenteerprogramma opzetten dat conclusies oplevert in plaats van valse winnaars? Neem contact op en we kijken samen naar je verkeer, je doelen en de tests die jou écht vooruit helpen.

Onderdeel van de gids Wat is Growth Marketing?

Gratis website-scan

Geef je website in en krijg binnen enkele minuten een automatische scan met concrete technische en SEO-verbeterpunten. Geen verkooppraatje.

Waar mogen we je rapport naartoe sturen?

Je gegevens gebruiken we alleen voor je scan. Geen spam, uitschrijven kan altijd.

Gerelateerde dienst Growth Marketing →