Customer Impact

SEO & GEO

Common Crawl et votre visibilité dans ChatGPT : ce que les marques B2B doivent savoir

Copier pour l'IA

Qui veut être mentionné aujourd’hui dans ChatGPT ou un autre assistant IA pense souvent immédiatement à GPTBot, le crawler en direct d’OpenAI. Mais il existe une seconde route, plus discrète, vers la connaissance des modèles de langage : Common Crawl. Cette archive web publique a été pendant des années l’une des principales sources de texte pour entraîner les grands modèles de langage, et elle détermine en partie quelles marques un modèle “connaît” sans devoir chercher en direct.

Pour les marketeurs B2B, ce n’est pas un détail technique. Si votre site ne figure pas dans Common Crawl, vous ratez un canal fondamental par lequel les modèles d’IA construisent leur connaissance de votre entreprise, de vos produits et de votre expertise. Dans cet article, nous expliquons ce qu’est Common Crawl, comment il s’articule avec les données d’entraînement de ChatGPT, et quelles étapes concrètes poser pour que votre site soit crawlable et lisible pour ces jeux de données.

Vérifiez votre accès IA : testez si les bots d’IA peuvent lire votre site avec notre contrôle de visibilité IA.

Qu’est-ce que Common Crawl exactement ?

Common Crawl est une organisation à but non lucratif qui, depuis 2008, explore le web à grande échelle et met les résultats à disposition gratuitement et publiquement. Selon Common Crawl elle-même, il s’agit de pétaoctets de données : pages web brutes, métadonnées et extraits de texte, collectés périodiquement et accessibles à tous via Amazon Web Services. Chaque crawl porte un nom du type CC-MAIN-2026-XX, et de nouvelles versions paraissent plusieurs fois par an.

L’idée derrière tout cela : des données web de qualité ne doivent pas rester la propriété exclusive de quelques géants technologiques. Tout le monde, des chercheurs aux start-ups, peut télécharger et utiliser le jeu de données. C’est précisément cette ouverture qui fait de Common Crawl un ingrédient standard pour construire des modèles de langage : c’est vaste, gratuit, et cela vous évite de monter votre propre infrastructure de crawl.

Pour vous en tant que marque, cela signifie que Common Crawl fonctionne comme une sorte de bibliothèque publique du web. Le fait que vos pages figurent ou non dans cette bibliothèque détermine en partie si les systèmes d’IA peuvent utiliser votre contenu comme matériel d’entraînement ou de référence.

Comment Common Crawl s’articule avec ChatGPT et les autres LLM

Common Crawl n’est pas un jeu de données abstrait : il se trouve démontrablement dans les fondations des modèles de langage les plus connus, ou foundation models. Une recherche de la Mozilla Foundation décrit Common Crawl comme l’une des sources les plus influentes pour l’IA générative, justement en raison de son échelle et du faible coût d’accès.

Les chiffres rendent la chose concrète. Dans les données d’entraînement originales du GPT-3 d’OpenAI, Common Crawl constituait de loin la plus grande composante. À côté de Common Crawl, les modèles utilisent aussi d’autres sources comme des livres, Wikipédia et des textes web filtrés, mais aucune n’approche l’ampleur de l’archive web ouverte. D’autres familles de modèles, dont Llama de Meta, s’appuient également sur des dérivés de Common Crawl pour une grande partie de leur matériel d’entraînement.

Nuance importante : les constructeurs de modèles utilisent rarement les données brutes sans filtrage. Common Crawl contient beaucoup de doublons et de contenu de faible qualité, un filtrage lourd est donc appliqué. Il n’empêche : si votre contenu n’est pas dans la source, il ne pourra jamais survivre à ce filtrage. La présence dans Common Crawl ne garantit pas l’inclusion, mais l’absence est une exclusion garantie via ce canal.

DU WEB À LA RÉPONSE IA Comment votre contenu entre dans un modèle d'IA 1 Vos pages sur le web Crawlables et rendues côté serveur 2 Récupérées par CCBot Aucun Disallow dans votre robots.txt 3 Survit au filtrage Doublons et bruit sont écartés 4 Cité dans ChatGPT L'absence vous exclut Seul celui qui franchit chaque étape devient matériau source pour l'IA.
De la page crawlable à la citation dans un modèle d'IA : chaque étape peut vous exclure.

Cela explique pourquoi Common Crawl mérite une attention distincte à côté des crawlers en direct. Il fonctionne selon une autre logique : les données d’entraînement sont “gelées” à un moment donné, puis utilisées. Ce qui n’était pas dans le jeu de données à ce moment-là manque durablement dans cette version précise du modèle. Cela rend le fait d’être crawlable tôt plus précieux que ne le soupçonnent beaucoup de marketeurs. Si vous voulez comprendre en profondeur comment devenir structurellement du matériau source pour l’IA, Common Crawl est l’une des premières briques. Les mentions dans la presse renforcent ce même effet ; découvrez comment travailler le digital PR pour les citations IA.

Les crawlers en revue : CCBot, GPTBot et les autres

Pour avoir prise sur votre visibilité IA, vous devez savoir quel bot joue quel rôle. On les confond souvent, mais ils servent des objectifs différents et respectent chacun leurs propres règles dans votre robots.txt.

CrawlerGestionnaireObjectifUser-agent (abrégé)
CCBotCommon CrawlAlimente l’archive web publique qui sert de source d’entraînementCCBot/2.0 (https://commoncrawl.org/faq/)
GPTBotOpenAICollecte des données pour entraîner les modèles d’IA générativeGPTBot/1.3; +https://openai.com/gptbot
OAI-SearchBotOpenAIAlimente la fonction de recherche au sein de ChatGPTOAI-SearchBot/1.3; +https://openai.com/searchbot
ChatGPT-UserOpenAIRécupère des pages lors de questions directes des utilisateursChatGPT-User/1.0; +https://openai.com/bot

Les chaînes user-agent de CCBot proviennent directement de Common Crawl, celles d’OpenAI de la documentation officielle des crawlers. Selon cette documentation : “Disallowing GPTBot indicates a site’s content should not be used in training generative AI foundation models” et “Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers.”

L’essentiel : CCBot et GPTBot sont deux routes indépendantes vers la connaissance d’entraînement. CCBot alimente le jeu de données public dans lequel puisent de nombreux modèles, GPTBot alimente directement les modèles d’OpenAI. Qui veut une visibilité maximale dans les réponses des IA les laisse entrer tous les deux. Si vous voulez embrasser tout le terrain de jeu entre autoriser et bloquer, lisez notre guide sur bloquer ou autoriser les bots d’IA via robots.txt.

Vérifier si votre site figure dans Common Crawl

Avant de modifier quoi que ce soit, vous voulez savoir où vous en êtes aujourd’hui. Common Crawl propose pour cela un index consultable. Si vous voulez suivre structurellement votre visibilité IA au sens large, un outil de monitoring aide, comme celui que nous testons dans notre revue d’Otterly.ai.

  1. Fouillez l’index d’URL de Common Crawl. Via le Common Crawl URL Index, vous pouvez chercher par crawl quelles URL de votre domaine ont été reprises. Si vous y retrouvez vos pages les plus importantes, vous êtes bien présent dans l’archive.
  2. Contrôlez votre robots.txt pour un blocage de CCBot. Ouvrez votredomaine.be/robots.txt et cherchez une règle qui écarte CCBot. S’il y a un Disallow: / sous User-agent: CCBot (ou un User-agent: * général avec un blocage large), vous tenez l’archive structurellement à l’écart.
  3. Attention à l’effet rétroactif. Un nouveau blocage ne vous retire pas des crawls plus anciens, mais fait bien en sorte que les versions futures vous ignorent. L’inverse vaut aussi : ce n’est qu’après avoir ouvert l’accès que vous commencez à apparaître dans les nouveaux crawls, jamais rétroactivement. La patience fait donc partie de la stratégie.

Si vous constatez que tout votre site ou des sections cruciales sont bloquées, c’est souvent l’héritage d’une vieille décision ou un réglage par défaut de votre CMS, rarement un choix conscient.

Ce que vous faites concrètement pour être crawlable et lisible

Être crawlable est la condition de base, être lisible fait la différence. Ces étapes garantissent que votre contenu est non seulement récupéré, mais atterrit aussi de façon exploitable dans le jeu de données.

Ouvrez explicitement CCBot et GPTBot. Si vous voulez atterrir dans les données d’entraînement, évitez un blocage. Un réglage ouvert ressemble à ceci :

User-agent: CCBot
Disallow:

User-agent: GPTBot
Disallow:

Un Disallow: vide signifie : rien n’est bloqué. Si vous ne mentionnez tout simplement pas ces bots dans votre robots.txt, ils sont également autorisés par défaut. Si vous voulez l’inverse, remplacez la ligne vide par Disallow: /.

Assurez un rendu côté serveur. C’est le piège le plus sous-estimé. Des crawlers comme CCBot n’exécutent pas de JavaScript ; ils lisent le HTML que le serveur renvoie. Si votre site ne construit le contenu que dans le navigateur, le crawler voit une page vide ou à moitié vide. La solution : que votre texte le plus important figure déjà dans le HTML initial, via un rendu côté serveur ou une génération statique. Nous approfondissons les dangers dans notre article sur le rendu JavaScript et les problèmes SEO.

Rendez votre contenu lisible par la machine grâce à la structure. Des titres clairs, des paragraphes concis et des données structurées aident les modèles à interpréter correctement votre contenu. Le balisage schema donne explicitement le contexte de ce que décrit votre page, ce qui augmente la chance d’être compris et cité correctement.

Vérifiez les vrais bots contre l’usurpation. Common Crawl comme OpenAI avertissent que des crawlers peuvent se faire passer à tort pour leur bot. Vous contrôlez l’authenticité via les plages d’IP officielles, disponibles pour CCBot via index.commoncrawl.org/ccbot.json. Pertinent si vous analysez vos logs serveur ou accordez l’accès de façon sélective.

Questions fréquentes

Mon site atterrit-il automatiquement dans Common Crawl ?

Ce n’est pas garanti, mais c’est possible sans que vous fassiez quoi que ce soit, tant que vous ne bloquez pas CCBot et que vos pages sont trouvables et crawlables. Common Crawl explore une grande partie du web public, mais ne couvre jamais tout. Vous augmentez vos chances avec un robots.txt propre, des liens internes vers vos pages les plus importantes et un sitemap à jour.

Si j’ouvre CCBot aujourd’hui, suis-je immédiatement dans ChatGPT ?

Non. Common Crawl collecte des données lors de crawls périodiques, et les modèles de langage sont entraînés à un moment donné sur un instantané de celles-ci. Il s’écoule donc du temps entre le fait de devenir crawlable et celui d’apparaître effectivement dans une version de modèle. C’est un investissement à moyen terme, pas un bouton à effet immédiat.

Dois-je bloquer CCBot pour protéger mon contenu ?

Uniquement si vous ne voulez vraiment pas que votre contenu serve de matériel d’entraînement. Gardez à l’esprit que le robots.txt est une instruction, pas une serrure : cela fonctionne parce que les grands acteurs respectent la convention, mais rien n’est chiffré. Le contenu que vous voulez vraiment protéger doit se trouver derrière un login ou un mur payant, pas seulement derrière une règle robots.

Quelle est la différence entre Common Crawl et GPTBot pour ma visibilité ?

Common Crawl alimente un jeu de données public dans lequel puisent de nombreux modèles ; GPTBot alimente directement les modèles d’OpenAI. Ce sont deux routes indépendantes vers la même connaissance IA. Pour une visibilité maximale dans les réponses des IA, vous les autorisez tous les deux plutôt que de choisir.

Besoin d’aide ?

Vous voulez traduire cela en exécution ? Découvrez comment nous abordons cela avec la visibilité dans l’IA.

Scan gratuit de votre site

Indiquez votre site et recevez en quelques minutes une analyse automatique avec des points d'amélioration techniques et SEO concrets. Sans discours commercial.

Où envoyons-nous votre rapport ?

Nous utilisons vos données uniquement pour votre scan. Pas de spam, désinscription à tout moment.