Customer Impact

Growth & Strategie

Peeking en te vroeg stoppen: de grootste fout in A/B-testprogramma's

Kopieer voor AI

Je draait een A/B-test, kijkt na twee dagen even mee en ziet variant B met 18% voorsprong staan, mooi groen, significant. Je zet de winnaar live en gaat door. Een maand later blijkt de conversie niet gestegen. Wat is er gebeurd? Grote kans dat je in de val van peeking bent gelopen: te vroeg kijken, te vroeg stoppen, en een toevalstreffer aanzien voor een echte winnaar. Dit is de stilste en duurste fout in de meeste A/B-testprogramma’s. In dit artikel lees je waarom peeking je beslissingen vergiftigt en hoe je het oplost.

Eerlijk vooraf: dit is geen verhaal over “doe gewoon meer tests”. Het gaat over de discipline om een test af te maken. Die discipline is precies waar een groeiprogramma staat of valt, want elke foute winnaar die je live zet, verlaagt het vertrouwen in al je volgende tests.

Wat peeking precies is

Peeking is herhaaldelijk naar de tussenstand van je experiment kijken en de test stopzetten zodra de uitkomst je bevalt, meestal op het moment dat het significantiecijfer onder de 5% duikt. Het klinkt onschuldig. Je kijkt toch alleen maar mee? Het probleem zit niet in het kijken, maar in het beslissen op basis van dat kijken.

Een klassieke A/B-test is gebouwd op één aanname: je legt vooraf vast hoeveel bezoekers of conversies je nodig hebt, je laat de test exact zo lang lopen, en je kijkt pas op het einde één keer naar de uitslag. Die hele statistische machinerie, inclusief de befaamde p-waarde van 0,05, is geijkt op precies één blik aan het einde.

Op het moment dat je elke dag meekijkt en mag stoppen wanneer het je uitkomt, breek je die aanname. Je geeft jezelf tientallen kansen om “significant” te zien, en bij toeval schiet de meter af en toe onder de drempel, ook als er in werkelijkheid geen verschil is tussen A en B.

Waarom te vroeg stoppen je foutkans opblaast

Stel je voor: twee identieke varianten, geen enkel echt verschil. Als je één keer aan het einde kijkt, heb je ongeveer 5% kans om per ongeluk toch een “significant” verschil te zien. Dat is de afgesproken foutmarge, en daar kun je mee leven.

Maar conversiecijfers schommelen van dag tot dag. De ene dag staat A voor, de andere dag B. Als je elke dag opnieuw kijkt en mag stoppen zodra de lijn groen wordt, dan grijp je vroeg of laat een toevallige uitschieter. Hoe vaker je kijkt, hoe groter de kans dat zo’n uitschieter zich minstens één keer voordoet. Je foutkans van 5% per blik stapelt zich op tot een veel hogere kans over de hele looptijd.

VOORBEELD Hoe vaker je kijkt, hoe groter de foutkans 1 keer kijken 5 % de afgesproken foutmarge 2 keer kijken 8 % 5 keer kijken 14 % 10 keer kijken 19 % Voorbeeldcijfers ter illustratie
Elke extra blik op de tussenstand vergroot de kans op een vals-positieve winnaar.

Het gevolg is een vals-positieve winnaar: een variant die in de test wint, maar in de echte wereld niets oplevert. En omdat je de test hebt stopgezet op het hoogtepunt van de toevallige voorsprong, ziet de uplift er ook nog eens overdreven groot uit. Je verwacht 18% meer conversie en krijgt nul. Dat is precies het patroon dat veel teams keer op keer zien: indrukwekkende testresultaten die nooit terugkomen in de omzetcijfers.

Het venijnige is dat peeking zelden kwade wil is. Het is nieuwsgierigheid plus tijdsdruk. Iedereen wil weten of de nieuwe variant werkt, en niemand wil twee weken wachten als het al na drie dagen “duidelijk” lijkt. Maar dat ongeduld kost je de betrouwbaarheid van je hele programma.

De klassieke oplossing: leg alles vooraf vast

De simpelste manier om peeking te vermijden, is de regels van de klassieke test respecteren. Dat betekent vier dingen afspreken voordat de test live gaat:

  • Steekproefgrootte: bereken vooraf hoeveel bezoekers of conversies je per variant nodig hebt om een verschil van een bepaalde grootte betrouwbaar te kunnen zien.
  • Looptijd: laat de test minstens één of twee volledige weken lopen, zodat je weekdagen en weekends meeneemt. Koopgedrag op een maandag verschilt van dat op een zondag.
  • Stopregel: spreek af dat je pas beslist als de steekproef compleet is, niet eerder, wat de tussenstand ook doet.
  • Eén primaire metric: kies vooraf welk getal de winnaar bepaalt, zodat je niet achteraf gaat shoppen in je dashboard tot je iets significants vindt.

Deze aanpak werkt, maar vraagt geduld en een redelijk volume aan verkeer. Hoe je die steekproefgrootte berekent en welke drempels je hanteert, lees je in onze gids over statistische significantie bij A/B-testen. Wil je eerst de basis van het opzetten van een test? Begin dan bij ons artikel over A/B-testen in de praktijk.

Sequential testing: wel mogen kijken, zonder de foutkans op te blazen

Hier wordt het interessant. Het is niet zo dat “kijken” per definitie verboden is. Het is verboden in een test die er niet voor ontworpen is. Sequential testing draait die logica om: het is een familie van statistische methodes die juist wél is gebouwd om herhaaldelijk naar tussenresultaten te kijken zonder dat je foutkans ontspoort.

Het idee erachter is dat de drempel voor “significant” strenger wordt naarmate je vaker kijkt. In ruil voor het recht om tussentijds te beslissen, betaal je een prijs: een hogere lat. Vroeg in de test moet het verschil heel overtuigend zijn voordat je mag stoppen, later wordt de lat geleidelijk redelijker. Zo corrigeert de methode automatisch voor het feit dat je meerdere keren kijkt.

Het grote voordeel is praktisch. Bij een echte, sterke winnaar kun je vroeger stoppen en de winst sneller live zetten. Bij varianten die nauwelijks verschillen, dwingt de methode je om door te gaan of de test eerlijk als onbeslist af te sluiten. Je krijgt dus snelheid waar het kan en discipline waar het moet.

De meeste moderne testtools bieden een vorm van sequential testing of een bayesiaanse variant die met hetzelfde probleem omgaat. De valkuil is dat teams die tools gebruiken alsof het een klassieke test is: ze kijken voortdurend mee maar interpreteren de cijfers nog met de oude bril. Kies één methode, begrijp hoe ze omgaat met tussentijds kijken, en houd je daaraan.

De echte oorzaak zit niet in de statistiek

Het is verleidelijk om dit als een puur technisch probleem te zien. Dat is het niet. Peeking is in de eerste plaats een organisatorisch probleem. Het ontstaat als experimenteren losse hagel is: een testje hier, een testje daar, zonder afspraken over wanneer je beslist en waarom.

Daarom werkt een gestructureerd groeiproces beter dan een verzameling losse trucs. In een volwassen aanpak is testen geen impulsieve actie maar een herhaalbare cyclus met heldere stopregels, gedeelde definities van succes en een ritme dat het ongeduld eruit haalt. Conversieoptimalisatie is binnen zo’n systeem geen op zichzelf staand kanaal, maar één radar in een groeimotor waar SEO, content, paid en leadgen op elkaar zijn afgestemd. Dat is precies hoe wij als growth marketing agency experimenteren benaderen: niet als gokje, maar als gestuurd proces dat op leads, pipeline en omzet stuurt in plaats van op vanity metrics.

Wil je de bredere logica achter die werkwijze begrijpen, lees dan onze pijlerpagina over wat growth marketing als systeem inhoudt. Daar zie je hoe testen, meten en beslissen samenhangen met de rest van je groeiprogramma.

Een praktische checklist tegen peeking

Voor je je volgende test live zet, loop deze punten af:

  • Heb je vooraf je steekproefgrootte en minimale looptijd berekend en opgeschreven?
  • Heb je één primaire metric gekozen die de winnaar bepaalt?
  • Weet je welke methode je tool gebruikt: klassiek met één blik op het einde, of sequential met meerdere blikken?
  • Heb je een eerlijke “geen verschil”-uitkomst als geldige optie, of voelt elke test als iets dat een winnaar móét opleveren?
  • Laat je elke test minstens een volle week lopen, zodat dag-tot-dag-schommelingen elkaar opheffen?

Als je op deze vragen ja antwoordt, verdwijnt het grootste deel van je vals-positieve winnaars vanzelf. De resultaten worden minder spectaculair op papier, maar veel betrouwbaarder in de praktijk. En dat is de hele bedoeling: beslissingen die blijven kloppen als ze live staan.

Conclusie

Peeking en te vroeg stoppen voelen als efficiëntie, maar ze ondermijnen precies datgene waar je een testprogramma voor draait: betrouwbare beslissingen. Een klassieke test vraagt geduld en één blik op het einde. Sequential testing geeft je de vrijheid om mee te kijken, mits je de bijbehorende strengere lat respecteert. In beide gevallen wint discipline het van ongeduld.

Wil je je experimenten inbedden in een groeiproces dat op pipeline en omzet stuurt in plaats van op toevallige uplifts? Neem contact met ons op en we bekijken samen hoe je testprogramma betrouwbaarder en sneller wordt.

Onderdeel van de gids Wat is Growth Marketing?

Gratis website-scan

Geef je website in en krijg binnen enkele minuten een automatische scan met concrete technische en SEO-verbeterpunten. Geen verkooppraatje.

Waar mogen we je rapport naartoe sturen?

Je gegevens gebruiken we alleen voor je scan. Geen spam, uitschrijven kan altijd.

Gerelateerde dienst Growth Marketing →