Customer Impact

SEO

Crawl budget optimaliseren op schaal (100.000+ URL's)

Kopieer voor AI

Op een site met meer dan 100.000 URL’s is crawl budget geen academisch concept meer, maar een dagelijkse beperking. Google heeft niet de tijd of zin om elke pagina even vaak op te halen, en als je structuur lekt, verspilt Googlebot zijn budget aan filterpagina’s en parameter-varianten terwijl je nieuwe productpagina’s wekenlang buiten de index blijven. In dit artikel lees je hoe je crawl budget optimaliseert op schaal: hoe je parameters temt, crawl traps dichtmetselt en met link sculpting je crawlwaarde naar de pagina’s stuurt die omzet opleveren.

Dit is een onderdeel van SEO waar veel grote sites stil bloeden zonder het te merken. Voor de bredere context kun je eerst onze pijler wat is SEO lezen; hier gaan we de diepte in voor sites die echt groot zijn.

Wanneer crawl budget eigenlijk pas telt

Laten we eerlijk beginnen. Google heeft zelf herhaaldelijk gezegd dat de meeste websites zich geen zorgen hoeven te maken over crawl budget. Heb je een B2B-brochuresite van honderd pagina’s, dan crawlt Google die zonder moeite en is sleutelen aan crawl budget tijdverspilling. Je wint daar meer met sterke content en goede technische SEO dan met crawl-microbeheer.

Crawl budget wordt pas een serieus onderwerp wanneer je in de tienduizenden of honderdduizenden URL’s zit: grote webshops met veel varianten, marktplaatsen, vacaturesites, vastgoedportalen of databasegedreven sites die pagina’s genereren uit filters en zoekopdrachten. Daar ontstaat het echte probleem: Google bepaalt een crawl-limiet (hoeveel je server aankan) en een crawl-vraag (hoe belangrijk en vers Google je pagina’s vindt). Zit je daarboven, dan vallen er pagina’s buiten de boot.

Het symptoom herken je zo: nieuwe of bijgewerkte pagina’s worden traag of niet geindexeerd, terwijl Google ondertussen duizenden verzoeken verspilt aan URL’s die er commercieel niet toe doen. Hoeveel verzoeken Google waaraan besteedt, lees je af in het crawlstatistieken-rapport in Search Console. Dat rapport is je startpunt voor elke optimalisatie op schaal.

Het echte lek: parameters en facetnavigatie

Op grote sites zit het grootste crawl-lek bijna nooit in je echte content. Het zit in de combinatorische explosie van URL’s die je systeem genereert zonder dat iemand het doorheeft.

Denk aan facetnavigatie. Een productcategorie met filters voor kleur, maat, merk, prijs en sortering produceert al snel duizenden unieke URL-combinaties die allemaal vrijwel dezelfde producten tonen. ?kleur=blauw&maat=l&sort=prijs en ?sort=prijs&maat=l&kleur=blauw zijn voor Google twee verschillende URL’s met identieke content. Vermenigvuldig dat over honderden categorieen en je hebt miljoenen crawlbare varianten die je echte budget opslokken.

VOORBEELD Waar je crawl budget naartoe lekt Filter- en parameter-URL's 68 % Crawl traps 22 % Geld-pagina's 10 % wat écht telt Voorbeeldcijfers ter illustratie
Op grote sites verdwijnt het gros van het crawl budget naar URL's zonder commerciële waarde.

Hoe pak je dat aan?

  • Bepaal welke parameters indexeerbaar mogen zijn. Een filter die een waardevolle, unieke landingspagina oplevert (bijvoorbeeld een merk binnen een categorie waar mensen actief op zoeken) mag blijven. Pure sorteer- en weergaveparameters niet.
  • Gebruik een canonical naar de schone categorie-URL voor filtercombinaties die geen eigen zoekvraag hebben. Zo consolideer je signalen in plaats van ze te versnipperen.
  • Blokkeer waardeloze parametercombinaties in robots.txt wanneer ze massaal gecrawld worden zonder enige indexeerwaarde. Let op: een via robots.txt geblokkeerde URL kan nog steeds in de index belanden als losse vermelding, dus combineer dit doordacht met canonicals en interne links.
  • Houd je interne links schoon. Als je navigatie en breadcrumbs alleen naar canonieke URL’s linken, voorkom je dat je zelf de parameter-wildgroei aanwakkert.

Het principe: laat Google niet zelf uitvogelen welke van je duizend varianten de echte is. Dat kost crawl budget en levert verwarring op. Wijs het aan.

Crawl traps: waar Googlebot in cirkels loopt

Een crawl trap is een deel van je site dat in theorie oneindig veel URL’s genereert, zodat Googlebot er budget in blijft pompen zonder ooit klaar te zijn. Ze zijn berucht omdat ze sluipend zijn: je merkt ze pas als je crawl-logs analyseert.

De klassiekers op grote sites:

  • Oneindige kalenders. Een evenementen- of boekingskalender met een “volgende maand”-link die eindeloos doorklikt naar jaar 2147. Googlebot volgt die keurig, maand na maand.
  • Gefilterde zoekresultaten zonder grens. Interne zoek-URL’s die elke querycombinatie indexeerbaar maken, inclusief de combinaties die niemand ooit intikt.
  • Sessie-ID’s en tracking-parameters in URL’s. Elke bezoeker krijgt een unieke URL, dus elke pagina bestaat in duizend varianten.
  • Relatieve link-fouten die paden oneindig stapelen, zoals /categorie/categorie/categorie/....
  • Paginering die nooit stopt of pagina’s blijft genereren voorbij de laatste echte resultaten.

De aanpak begint bij meten. Analyseer je serverlogs of het crawlstatistieken-rapport en kijk waar Googlebot zijn verzoeken naartoe stuurt. Vaak zie je dan dat een fors deel van je crawl budget naar een handvol URL-patronen gaat die nul commerciele waarde hebben. Die patronen sluit je af: blokkeer ze in robots.txt, zet noindex op pagina’s die wel bereikbaar moeten blijven maar niet de index in mogen, en verwijder of nofollow de links die de trap voeden. Voor kalenders begrens je simpelweg hoe ver vooruit en achteruit geklikt kan worden.

Eerlijk gezegd is dit detectivewerk dat zich uitbetaalt. Elke verspilde crawl die je terugwint, is een crawl die naar een pagina kan gaan die wel klanten oplevert.

Als je de lekken hebt gedicht, gaat het tweede deel over richting geven. Google crawlt en herindexeert pagina’s vaker naarmate ze intern beter gelinkt zijn en dichter bij de homepage staan. Dat is de hefboom van link sculpting: je interne structuur zo inrichten dat crawl- en linkwaarde naar je belangrijkste commerciele pagina’s stroomt.

Praktisch betekent dat:

  • Maak je belangrijkste pagina’s ondiep bereikbaar. Een pagina die vijf kliks diep ligt, wordt zelden gecrawld. Zorg dat je geld-pagina’s binnen twee of drie kliks vanaf de homepage liggen via categorie-hubs en interne links.
  • Bouw thematische hubs die naar de onderliggende pagina’s linken en omgekeerd, zodat crawlwaarde binnen het cluster blijft circuleren in plaats van weg te lekken naar filterpagina’s. Onze gids over interne links gaat dieper op die structuur in.
  • Snoei links naar lage-waarde URL’s. Elke link die je navigatie naar een sorteerpagina legt, vertelt Google dat die pagina belangrijk is. Verminder die links bewust ten gunste van pagina’s die ertoe doen.
  • Houd je XML-sitemap schoon en actueel. Zet er uitsluitend canonieke, indexeerbare URL’s in. Een sitemap vol redirects, 404’s en parameter-varianten ondermijnt je eigen prioriteitssignaal.

Link sculpting is geen trucje meer met nofollow-attributen zoals tien jaar geleden. Het is architectuur: bepalen welke pagina’s pipeline opleveren en je hele interne linkstructuur daarop afstemmen. Dat is precies het soort werk dat een ervaren seo specialist doet wanneer een grote site wel veel pagina’s heeft maar te weinig van de juiste in de index krijgt.

Optimaliseer voor de juiste uitkomst, niet voor het totaal

De grootste valkuil bij crawl budget is sturen op het verkeerde getal. Een hoog aantal crawls per dag voelt goed, maar het zegt niets als die crawls naar de verkeerde pagina’s gaan. Bij Customer Impact behandelen we SEO als de acquisitielaag van je groeimotor, geoptimaliseerd voor pipeline en niet voor ijdele dashboardcijfers. Dat geldt ook hier.

De vraag die telt is: bereikt en herindexeert Google je commercieel belangrijke pagina’s tijdig? Als je een nieuwe productlijn of dienst lanceert en die staat binnen dagen vers in de index, dan werkt je crawl budget voor je. Staat hij na drie weken nog buiten de index terwijl Googlebot duizenden filterpagina’s afstruint, dan heb je een budgetprobleem dat direct omzet kost.

En vergeet niet dat dezelfde discipline je ook helpt bij AI-zoekmachines. Een schone, goed gestructureerde site die crawlers efficient door je belangrijkste content leidt, wordt niet alleen beter geindexeerd door Google maar ook makkelijker opgepikt en geciteerd door ChatGPT, Google AI en Perplexity. Crawl-efficientie is fundament, geen randzaak.

Aan de slag op jouw schaal

Crawl budget optimaliseren op een grote site is geen eenmalige opkuis maar een doorlopende discipline: parameters temmen, crawl traps dichten en je interne structuur zo sturen dat je geld-pagina’s voorrang krijgen. Het verschil tussen een site die snel indexeert en eentje die maanden achterloopt, zit zelden in meer content en bijna altijd in een schonere, beter gestuurde architectuur.

Loopt jouw site tegen indexeringsproblemen aan, of vermoed je dat Google zijn budget aan de verkeerde URL’s verspilt? Neem contact op en we kijken samen waar je crawl budget naartoe lekt en hoe we het terugsturen naar de pagina’s die pipeline opleveren.

Onderdeel van de gids Wat is SEO? Uitleg, werking en waarom het werkt

Gratis website-scan

Geef je website in en krijg binnen enkele minuten een automatische scan met concrete technische en SEO-verbeterpunten. Geen verkooppraatje.

Waar mogen we je rapport naartoe sturen?

Je gegevens gebruiken we alleen voor je scan. Geen spam, uitschrijven kan altijd.