SEO
Faceted navigation en SEO: filters die je crawl budget opvreten
Kopieer voor AI
Faceted navigation is de filterbalk die je op vrijwel elke webshop ziet: filter op merk, maat, kleur, prijs, beschikbaarheid. Voor de bezoeker is dat fijn. Voor zoekmachines is het een van de hardnekkigste technische SEO-problemen die er bestaan. Elke filtercombinatie genereert namelijk een eigen URL, en die URL’s vermenigvuldigen zich razendsnel. In dit artikel lees je waarom dat je crawl budget opvreet, en welke keuzes je maakt met noindex, canonical en robots.txt om de controle terug te pakken.
Wil je eerst het fundament onder dit alles, lees dan rustig na wat SEO precies inhoudt en hoe het in een bredere groeistrategie past. Dit artikel bouwt daarop voort met een specifiek e-commerceprobleem. Dezelfde filterexplosie speelt trouwens op vacaturesites, waar filters op functie, regio en sector duizenden URL’s opleveren; onze aanpak daarvoor lees je in SEO voor recruitment- en uitzendbureaus.
Waarom filters een URL-explosie veroorzaken
Stel je hebt een webshop met 300 producten. Overzichtelijk. Maar je productoverzicht heeft vijf filtergroepen: merk (10 opties), maat (6), kleur (8), prijsklasse (4) en beschikbaarheid (2). Een bezoeker kan die filters in elke denkbare combinatie aanklikken, en elke combinatie krijgt vaak een eigen URL met parameters, bijvoorbeeld ?merk=x&maat=42&kleur=zwart.
Het aantal combinaties is geen optelsom, maar een vermenigvuldiging. Tel daar de volgorde van parameters bij op, sorteeropties en paginering, en je zit zomaar aan tienduizenden unieke URL’s voor een catalogus van een paar honderd producten. Google ziet die allemaal als aparte pagina’s die het kan ontdekken, crawlen en mogelijk indexeren.
Dat veroorzaakt drie concrete problemen:
- Crawl budget verspilling. Googlebot heeft per site een eindig aantal pagina’s dat het binnen een bepaalde tijd crawlt. Verspilt het dat aan duizenden filtercombinaties, dan blijven je belangrijke product- en categoriepagina’s langer onbezocht of onveranderd in de index.
- Duplicate en thin content. Veel filtercombinaties tonen vrijwel dezelfde of bijna lege productlijsten. Google moet dan beslissen welke versie de echte is, en die beslissing valt niet altijd in je voordeel.
- Verwaterde signalen. Interne links en eventuele externe links verdelen zich over tientallen varianten van dezelfde lijst, in plaats van zich te concentreren op de pagina die je echt wil laten ranken.
De drie keuzes per filtertype
Er bestaat geen knop die dit in een keer oplost. De aanpak is een bewuste beslissing per filtertype: laat je het indexeren, consolideer je het, of blokkeer je het volledig? Drie instrumenten, drie verschillende rollen.
1. Indexeren: filters met echte zoekvraag
Sommige filtercombinaties komen overeen met hoe mensen daadwerkelijk zoeken. Denk aan een merk in combinatie met een productcategorie (“Nike hardloopschoenen”) of een maat die veel gevraagd wordt. Zulke pagina’s hebben commerciële waarde en mogen je in de index hebben.
Daar tel je twee voorwaarden bij op. De pagina moet een statische, schone URL hebben in plaats van een parameterketen, en ze moet voldoende unieke inhoud tonen: een eigen titel, een beschrijvende tekst, een gevulde productlijst. Behandel zulke filterpagina’s als volwaardige landingspagina’s, niet als toevallige filterresultaten. Hoe je zulke URL’s opbouwt, lees je in onze uitleg over de SEO-vriendelijke URL.
2. Canonicaliseren: varianten van dezelfde lijst
Voor filters die wel een logische pagina opleveren maar geen eigen zoekvraag hebben, gebruik je de canonical tag. Een sorteervolgorde, een prijsfilter of een kleurfilter wijst dan via rel="canonical" terug naar de schone hoofdcategorie.
Daarmee vertel je Google: deze varianten bestaan, maar de hoofdpagina is de versie die je moet ranken. De canonical consolideert de signalen naar een pagina. Let wel: een canonical is een sterk advies, geen bevel. Google mag het negeren wanneer de inhoud te sterk afwijkt. En, belangrijk voor het crawl budget: Google moet de pagina nog steeds crawlen om de canonical te lezen. Je lost dus duplicatie op, maar je bespaart geen crawltijd.
3. Blokkeren: ruis die niemand zoekt
Sorteerrichting, sessie-ID’s, tracking-parameters en oneindige filtercombinaties zonder waarde horen niet in een zoekmachine thuis. Die blokkeer je het liefst voordat Google ze crawlt, via robots.txt. Een regel als Disallow: /*?sort= houdt hele klassen parameter-URL’s uit de crawl.
Hier zit precies de afweging die veel webshops verkeerd inschatten. Een via robots.txt geblokkeerde URL wordt niet gecrawld, dus bespaar je crawl budget. Maar Google leest de pagina dan ook niet, en ziet dus geen noindex of canonical erop staan. Blokkeer je een pagina die elders nog gelinkt wordt, dan kan een kale URL zonder omschrijving alsnog in de index belanden. Robots.txt en noindex zijn geen synoniemen: het een regelt crawlen, het ander regelt indexeren.
Robots.txt, noindex en canonical: wie doet wat
Dit is het stuk waar de meeste fouten ontstaan, dus zet de rollen scherp naast elkaar:
- robots.txt (Disallow) regelt of Google een URL mag crawlen. Het bespaart crawl budget, maar consolideert geen signalen en garandeert geen uitsluiting uit de index.
- meta robots noindex regelt of een gecrawlde pagina in de index mag. Het houdt de pagina uit de zoekresultaten, maar de pagina moet wel crawlbaar zijn om de tag te kunnen lezen.
- rel=“canonical” regelt welke versie als de echte geldt. Het consolideert duplicaten, maar bespaart geen crawltijd en is een advies, geen garantie.
De fout die je wil vermijden: een pagina tegelijk blokkeren in robots.txt en er een noindex op zetten. Google kan de noindex dan namelijk nooit lezen, omdat het de pagina niet mag crawlen. Het resultaat is het tegenovergestelde van wat je wilde. Wil je een pagina echt uit de index, laat hem dan crawlbaar met een noindex, en blokkeer pas in robots.txt nadat hij uit de index verdwenen is.
In de praktijk gebruik je de drie dus gelaagd. De grote massa ruis blokkeer je preventief in robots.txt. De zinvolle maar dubbele varianten laat je crawlbaar met een canonical. En de pagina’s met echte zoekvraag maak je tot schone, indexeerbare landingspagina’s.
Hoe je controleert of het werkt
Je raadt niet of het lukt, je meet het. In Google Search Console laten de crawlstatistieken zien hoeveel van je crawl budget naar parameter-URL’s gaat. Loopt dat de spuigaten uit, dan zie je het daar terug. We schreven een aparte uitleg over hoe je crawlstatistieken in Search Console leest en interpreteert.
Het rapport Pagina-indexering toont vervolgens welke URL’s uitgesloten zijn en waarom: “Gecrawld, niet geindexeerd”, “Duplicaat zonder door gebruiker geselecteerde canonical”, “Geblokkeerd door robots.txt”. Die labels zijn je dashboard. Stijgt het aantal dubbele en uitgesloten parameter-URL’s, dan is je filterstrategie nog niet op orde. Werk je vooral met een grote catalogus, dan is dit een van de eerste dingen die we bekijken wanneer een webshop zijn e-commerce SEO uitbesteedt.
Waarom dit verder reikt dan crawlen
Faceted navigation netjes inrichten is geen losstaande technische klus. Het bepaalt of je crawl budget naar je geldpagina’s gaat of verdampt in filterruis, en of je catalogus als een geordend geheel overkomt of als een wildgroei van halve duplicaten. Dat raakt direct je organische zichtbaarheid, en steeds vaker ook of AI-zoekmachines je productpagina’s als betrouwbare bron oppikken in plaats van een willekeurige filtervariant.
Bij Customer Impact behandelen we SEO niet als losse technische trucs, maar als de acquisitielaag van een orkestrerende groeimotor. Filterstrategie, indexering en interne links bouwen we zo dat ze pipeline opleveren, niet alleen nette grafieken. Wil je dat een ervaren seo specialist eens kritisch naar de filterstructuur van je webshop kijkt, dan denken we graag mee.
Conclusie
Faceted navigation is onmisbaar voor de gebruiker en gevaarlijk voor je SEO als je het op zijn beloop laat. De oplossing is geen enkele instelling, maar een bewuste keuze per filtertype: indexeren wat zoekvraag heeft, canonicaliseren wat dubbel is, blokkeren wat ruis is. Begrijp daarbij scherp wat robots.txt, noindex en canonical elk wel en niet doen, want juist daar ontstaan de dure fouten.
Twijfel je hoeveel crawl budget je nu verspeelt aan filtercombinaties, of belanden de verkeerde URL’s in Google? Neem contact op en we doorlichten je filterstructuur concreet.
Gratis website-scan
Geef je website in en krijg binnen enkele minuten een automatische scan met concrete technische en SEO-verbeterpunten. Geen verkooppraatje.
Je gegevens gebruiken we alleen voor je scan. Geen spam, uitschrijven kan altijd.