Customer Impact

SEO & GEO

Common Crawl en je zichtbaarheid in ChatGPT: wat B2B-merken moeten weten

Kopieer voor AI

Wie vandaag in ChatGPT of een andere AI-assistent genoemd wil worden, denkt vaak meteen aan GPTBot, de live-crawler van OpenAI. Maar er loopt een tweede, stillere route naar de kennis van taalmodellen: Common Crawl. Dit openbare web-archief is jarenlang een van de belangrijkste tekstbronnen geweest voor het trainen van grote taalmodellen, en het bepaalt mee welke merken een model “kent” zonder dat het live hoeft te zoeken.

Voor B2B-marketeers is dat geen technisch detail. Als je site niet in Common Crawl zit, mis je een fundamenteel kanaal waarlangs AI-modellen kennis over jouw bedrijf, producten en expertise opbouwen. In dit artikel leggen we uit wat Common Crawl is, hoe het samenhangt met de trainingsdata van ChatGPT, en welke concrete stappen je zet om ervoor te zorgen dat jouw site crawlbaar en leesbaar is voor deze datasets.

Check je AI-toegang: test of AI-bots je site mogen lezen met onze AI-zichtbaarheidscheck.

Wat is Common Crawl precies?

Common Crawl is een non-profit organisatie die sinds 2008 op grote schaal het web crawlt en de resultaten gratis en openbaar beschikbaar stelt. Volgens Common Crawl zelf gaat het om petabytes aan data: ruwe webpagina’s, metadata en tekstextracten, die periodiek worden verzameld en via Amazon Web Services voor iedereen toegankelijk zijn. Elke crawl draagt een naam als CC-MAIN-2026-XX, en er verschijnen meerdere keren per jaar nieuwe versies.

Het idee erachter is dat hoogwaardige webdata niet exclusief van enkele techgiganten mag zijn. Iedereen, van onderzoekers tot startups, kan de dataset downloaden en gebruiken. Net die openheid maakt Common Crawl tot een standaardingrediënt voor het bouwen van taalmodellen: het is groot, gratis en zonder dat je zelf een eigen crawl-infrastructuur hoeft op te zetten.

Voor jou als merk betekent dit dat Common Crawl functioneert als een soort openbare bibliotheek van het web. Of jouw pagina’s in die bibliotheek staan, bepaalt mee of AI-systemen die jouw content als trainings- of referentiemateriaal kunnen gebruiken.

Hoe Common Crawl samenhangt met ChatGPT en andere LLM’s

Common Crawl is geen abstracte dataset: het zit aantoonbaar in de fundamenten van de bekendste taalmodellen, of foundation models. Onderzoek van de Mozilla Foundation beschrijft Common Crawl als een van de meest invloedrijke bronnen voor generatieve AI, juist door de schaal en de lage kosten van toegang.

De cijfers maken het concreet. In de oorspronkelijke trainingsdata van OpenAI’s GPT-3 vormde Common Crawl veruit de grootste component. Naast Common Crawl gebruiken modellen ook andere bronnen zoals boeken, Wikipedia en gefilterde webteksten, maar geen ervan benadert de omvang van het open web-archief. Ook andere modellenfamilies, waaronder Llama van Meta, leunen voor een groot deel van hun trainingsmateriaal op afgeleiden van Common Crawl.

Belangrijk nuance: modellenbouwers gebruiken de ruwe data zelden ongefilterd. Common Crawl bevat veel duplicaten en lage kwaliteit, dus er gaat zware filtering overheen. Toch geldt: als je content niet in de bron zit, kan ze die filtering nooit overleven. Aanwezigheid in Common Crawl is geen garantie op opname, maar afwezigheid is wel een gegarandeerde uitsluiting via dit kanaal.

VAN WEB TOT AI-ANTWOORD Hoe je content in een AI-model belandt 1 Jouw pagina's op het web Crawlbaar en server-side gerenderd 2 Opgehaald door CCBot Geen Disallow in je robots.txt 3 Overleeft de filter Duplicaten en ruis vallen af 4 Geciteerd in ChatGPT Afwezigheid sluit je uit Alleen wie elke stap haalt, wordt bronmateriaal voor AI.
Van crawlbare pagina tot citaat in een AI-model: elke stap kan je uitsluiten.

Dit verklaart waarom Common Crawl een aparte aandacht verdient naast live-crawlers. Het werkt op een andere logica: trainingsdata wordt op een bepaald moment “bevroren” en daarna gebruikt. Wat toen niet in de dataset zat, ontbreekt blijvend in die specifieke modelversie. Dat maakt vroeg crawlbaar zijn waardevoller dan veel marketeers vermoeden. Wil je dieper begrijpen hoe je structureel bronmateriaal voor AI wordt, dan is Common Crawl een van de eerste bouwstenen. Persvermeldingen versterken datzelfde effect; lees hoe je met digital PR voor AI-citaties werkt.

De crawlers op een rij: CCBot, GPTBot en de rest

Om grip te krijgen op je AI-zichtbaarheid moet je weten welke bots welke rol spelen. Ze worden vaak door elkaar gehaald, maar dienen verschillende doelen en respecteren elk hun eigen regels in je robots.txt.

CrawlerBeheerderDoelUser-agent (verkort)
CCBotCommon CrawlVult het openbare web-archief dat als trainingsbron dientCCBot/2.0 (https://commoncrawl.org/faq/)
GPTBotOpenAIVerzamelt data om generatieve AI-modellen te trainenGPTBot/1.3; +https://openai.com/gptbot
OAI-SearchBotOpenAIVoedt de zoekfunctie binnen ChatGPTOAI-SearchBot/1.3; +https://openai.com/searchbot
ChatGPT-UserOpenAIHaalt pagina’s op bij directe gebruikersvragenChatGPT-User/1.0; +https://openai.com/bot

De user-agent strings van CCBot komen rechtstreeks van Common Crawl, die van OpenAI uit de officiële crawler-documentatie. Volgens die documentatie geldt: “Disallowing GPTBot indicates a site’s content should not be used in training generative AI foundation models” en “Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers.”

De kern: CCBot en GPTBot zijn twee onafhankelijke routes naar trainingskennis. CCBot vult de openbare dataset waar veel modellen uit putten, GPTBot voedt rechtstreeks de modellen van OpenAI. Wie maximaal zichtbaar wil zijn in AI-antwoorden, laat ze allebei binnen. Wil je het hele speelveld van toelaten versus weren overzien, lees dan onze gids over AI-bots blokkeren of binnenlaten via robots.txt.

Controleren of je site in Common Crawl staat

Voor je iets aanpast, wil je weten waar je vandaag staat. Common Crawl biedt daarvoor een doorzoekbare index aan. Wil je je bredere AI-zichtbaarheid structureel opvolgen, dan helpt een monitoringtool zoals we testen in onze Otterly.ai review.

  1. Doorzoek de Common Crawl URL-index. Via de Common Crawl URL Index kun je per crawl opzoeken welke URL’s van jouw domein zijn opgenomen. Vind je je belangrijkste pagina’s daar terug, dan zit je goed in het archief.
  2. Controleer je robots.txt op een CCBot-blokkade. Open jouwdomein.be/robots.txt en zoek naar een regel die CCBot weert. Staat er een Disallow: / onder User-agent: CCBot (of een algemene User-agent: * met een brede blokkade), dan houd je het archief structureel buiten.
  3. Let op terugwerkende kracht. Een nieuwe blokkade haalt je niet uit oudere crawls, maar zorgt wel dat toekomstige versies je overslaan. Andersom geldt: pas na het openzetten begin je in nieuwe crawls te verschijnen, niet met terugwerkende kracht. Geduld is dus deel van de strategie.

Merk je dat je hele site of cruciale secties geblokkeerd zijn, dan is dat vaak een erfenis van een oude beslissing of een standaardinstelling van je CMS, zelden een bewuste keuze.

Wat je concreet doet om crawlbaar en leesbaar te zijn

Crawlbaar zijn is de basisvoorwaarde, leesbaar zijn maakt het verschil. Deze stappen zorgen dat je content niet alleen wordt opgehaald, maar ook bruikbaar in de dataset belandt.

Zet CCBot en GPTBot expliciet open. Wil je in trainingsdata terechtkomen, vermijd dan een blokkade. Een open instelling ziet er zo uit:

User-agent: CCBot
Disallow:

User-agent: GPTBot
Disallow:

Een lege Disallow: betekent: niets geblokkeerd. Als je deze bots gewoon niet in je robots.txt vermeldt, zijn ze standaard ook toegelaten. Wil je het omgekeerde, dan vervang je de lege regel door Disallow: /.

Zorg voor server-side rendering. Dit is de meest onderschatte valkuil. Crawlers zoals CCBot voeren geen JavaScript uit; ze lezen de HTML die de server teruggeeft. Bouwt je site de content pas op in de browser, dan ziet de crawler een lege of half-lege pagina. De oplossing is dat je belangrijkste tekst al in de initiële HTML staat, via server-side rendering of statische generatie. We gaan dieper in op de gevaren in ons artikel over JavaScript-rendering en SEO-problemen.

Maak je content machineleesbaar met structuur. Heldere koppen, beknopte paragrafen en gestructureerde data helpen modellen je content correct te interpreteren. Schema-markup geeft expliciet context mee over wat je pagina beschrijft, wat de kans vergroot dat je correct wordt begrepen en geciteerd.

Verifieer echte bots tegen spoofing. Zowel Common Crawl als OpenAI waarschuwen dat crawlers zich vals als hun bot kunnen voordoen. Je controleert echtheid via de officiële IP-ranges, voor CCBot beschikbaar via index.commoncrawl.org/ccbot.json. Relevant als je serverlogs analyseert of selectief toegang verleent.

Veelgestelde vragen

Komt mijn site automatisch in Common Crawl terecht?

Niet gegarandeerd, maar wel mogelijk zonder dat je iets doet, zolang je CCBot niet blokkeert en je pagina’s vindbaar en crawlbaar zijn. Common Crawl crawlt een groot deel van het publieke web, maar dekt nooit alles. Je kansen verhoog je door een propere robots.txt, interne links naar je belangrijkste pagina’s en een actuele sitemap.

Als ik vandaag CCBot openzet, sta ik dan meteen in ChatGPT?

Nee. Common Crawl verzamelt data in periodieke crawls, en taalmodellen worden op een bepaald moment getraind op een momentopname daarvan. Tussen crawlbaar worden en effectief in een modelversie opduiken zit dus tijd. Het is een investering op middellange termijn, geen knop met directe impact.

Moet ik CCBot blokkeren om mijn content te beschermen?

Alleen als je echt niet wil dat content als trainingsmateriaal dient. Hou er rekening mee dat robots.txt een instructie is, geen slot: het werkt omdat grote spelers de afspraak respecteren, maar het versleutelt niets. Content die je echt wil afschermen, hoort achter een login of betaalmuur, niet enkel achter een robots-regel.

Wat is het verschil tussen Common Crawl en GPTBot voor mijn zichtbaarheid?

Common Crawl vult een openbare dataset waaruit veel modellen putten; GPTBot voedt rechtstreeks de modellen van OpenAI. Het zijn twee onafhankelijke routes naar dezelfde AI-kennis. Voor maximale zichtbaarheid in AI-antwoorden laat je ze allebei toe in plaats van te kiezen.

Hulp nodig?

Wil je dit vertalen naar uitvoering? Bekijk hoe we dit aanpakken met AI-vindbaarheid.

Onderdeel van de gids De ultieme GEO-handleiding: generative engine optimization van nul tot citaties meten

Gratis website-scan

Geef je website in en krijg binnen enkele minuten een automatische scan met concrete technische en SEO-verbeterpunten. Geen verkooppraatje.

Waar mogen we je rapport naartoe sturen?

Je gegevens gebruiken we alleen voor je scan. Geen spam, uitschrijven kan altijd.