Customer Impact

SEO & GEO

Citation mining : mesurer systématiquement vos citations IA

Copier pour l'IA

Quand j’explique à des clients qu’un modèle d’IA fait chaque jour des millions de choix sur les sources qui méritent d’être visibles, ils acquiescent. Quand je leur demande ensuite quelles sources sont citées dans leur catégorie, c’est le silence. La plupart des entreprises volent à l’aveugle. Elles posent une question de temps en temps à ChatGPT, tombent par hasard sur une citation et s’en font une opinion. Ce n’est pas une méthode de mesure, c’est de la devinette.

Le citation mining résout ce problème. Dans cet article, j’explique ce que c’est, quelles métriques en tirer et comment le mettre en place vous-même. Il s’inscrit dans le guide ultime du GEO, où je décris l’ensemble du terrain de jeu du generative engine optimization (GEO).

Testez votre visibilité IA : évaluez votre page en trente secondes avec notre GEO-check.

Ce qu’est le citation mining

Le citation mining consiste à extraire et analyser systématiquement les citations que les systèmes d’IA affichent dans leurs réponses. Chaque fois qu’un modèle cite une source, il rend un jugement : ce contenu mérite d’être visible pour cette question. Si vous rassemblez et ordonnez des milliers de ces jugements, vous obtenez une source d’information très riche.

Ces données vous indiquent :

  • Quels domaines les systèmes d’IA jugent fiables pour quels sujets.
  • Quelles pages précises remportent la sélection sur les questions concurrentielles.
  • Comment les schémas de citation évoluent dans le temps.
  • Où vous vous situez par rapport à vos concurrents.
  • Quelles caractéristiques de contenu sont corrélées à la sélection.

La différence avec des observations isolées, c’est la méthode. Au lieu de retenir que vous avez été « cité une fois par Perplexity », vous mesurez de façon structurée à quelle fréquence et avec quelle proéminence vous apparaissez, et qui vous battez.

Ce que les données vous montrent

Quand j’agrège les citations pour un sujet, des schémas remontent que vous ne verriez jamais autrement.

Autorité de domaine

Comptez toutes les citations pour un sujet et vous voyez immédiatement qui domine. Ce sont souvent les suspects habituels (Google, Microsoft, AWS) plus un ou deux acteurs spécialisés qui ont bâti leur autorité. Si vous êtes à 2 pour cent de share, vous savez qu’il y a du travail, et face à qui vous vous mesurez.

Les gagnants par question

Au sein d’un même sujet, différentes questions ont différents gagnants. Les questions de définition (« qu’est-ce que X ? ») citent des sources encyclopédiques. Les questions de comparaison (« meilleurs outils X 2026 ») citent des sites d’avis. Les questions d’implémentation citent la documentation. Cette nuance détermine où vous pouvez réalistement gagner. Inutile de défier Wikipédia sur une question de définition si vous performez mieux sur l’angle de l’implémentation.

Caractéristiques de contenu

En décortiquant les pages citées, vous voyez ce que les modèles valorisent : longueur moyenne, densité de titres, usage de listes, fraîcheur de la dernière mise à jour, présence de balisage schema. Si les modèles citent surtout des pages récemment actualisées alors que votre article a deux ans, vous tenez une action concrète et mesurable.

Les métriques qui comptent

Le citation mining ne prend de la valeur que lorsque vous le traduisez en chiffres suivis dans la durée. Voici les formules que j’utilise, basées sur la documentation source.

MétriqueFormuleCe qu’elle mesure
Citation sharevos citations / total des citationsVotre part de toutes les citations dans un jeu de requêtes
Citation frequencyquestions où vous êtes cité / nombre total de questionsÀ quelle fréquence vous apparaissez tout court
Primary citation ratecitations primaires / total des citationsÀ quelle fréquence vous êtes la source principale quand vous êtes cité
Citation velocity(citations actuelles - citations période précédente) / citations période précédenteLa vitesse à laquelle votre position évolue
Competitive citation indexvos citations / citations du concurrentSi vous êtes cité plus ou moins souvent qu’un rival

Quelques interprétations qui me semblent importantes :

  • Frequency élevée, share faible signifie que vous apparaissez souvent mais rarement de façon proéminente. Vous êtes présent, pas dominant.
  • Frequency faible, share relativement élevé signifie que vous apparaissez rarement, mais que vous dominez quand vous apparaissez. Un signe qu’il faut élargir votre couverture.
  • La citation velocity est votre système d’alerte précoce. Une velocity négative trahit une perte de position avant qu’elle ne devienne visible dans votre trafic.
  • Un competitive citation index supérieur à 1 signifie que vous êtes cité plus souvent que le concurrent, inférieur à 1 qu’il mène. Suivez-le face à plusieurs rivaux pour avoir une image complète.

Ces métriques de citation approfondissent les 5 indicateurs clés de la visibilité IA, comme le prompt recall rate. Là où le prompt recall rate mesure si vous êtes mentionné tout court, le citation mining zoome sur l’attribution de source elle-même.

Comment le mesurer : le processus étape par étape

Vous n’avez pas besoin d’une infrastructure lourde pour démarrer. La discipline compte plus que l’outillage. Voici la méthode que j’applique.

Étape 1 : définissez votre corpus de requêtes

Déterminez les questions que vous voulez suivre. Un bon corpus mélange trois types :

  • Questions de marque sur votre entreprise et vos produits (« qu’est-ce que [produit] ? », « avis [marque] », « [marque] vs [concurrent] »).
  • Questions de catégorie où vous voulez être visible (« meilleur logiciel [catégorie] », « comment aborder [tâche de la catégorie] »).
  • Questions d’intention autour des problèmes que vous résolvez (« comment résoudre [problème] ? », « solutions [point de douleur] »).

Visez 100 à 500 questions, selon votre marché. Astuce : récupérez de vraies requêtes dans la Google Search Console et convertissez-les en forme conversationnelle. Ce sont les questions que les gens posent réellement.

Étape 2 : exécutez les requêtes

Posez vos questions aux plateformes pertinentes (Google AI Mode, ChatGPT avec search, Perplexity, Claude avec search) et enregistrez pour chaque réponse :

  • Le texte complet de la réponse.
  • Toutes les citations (URL).
  • La position de chaque citation (dans le texte ou dans une liste de sources).
  • Un horodatage et la plateforme.

Fixez votre fréquence selon l’enjeu : quotidienne pour de l’intelligence concurrentielle, hebdomadaire pour les tendances, mensuelle au minimum pour une base de référence.

Étape 3 : extrayez les citations

Sortez les URL de chaque réponse. Normalisez-les au niveau du domaine (toutes les variantes de microsoft.com comptent ensemble), afin d’agréger correctement. Décidez à l’avance si vous comptez les citations uniques ou totales quand une même source revient plusieurs fois.

Étape 4 : analysez et construisez une base de données

Pour une intelligence continue, stockez chaque citation de façon structurée. Les champs essentiels sont : un ID unique, la requête et sa catégorie, la plateforme, l’horodatage, l’URL citée et le domaine normalisé, la position dans la réponse, le type de citation, si vous étiez la source primaire, et le passage de texte précis (le grounding snippet) qui renvoyait vers votre page.

Avec cette base, vous lancez des analyses de share, des mappings requête-domaine, des tendances et des analyses d’écart. Une base de données relationnelle avec un index sur vos requêtes suffit largement pour démarrer.

Des snippets à l’optimisation du contenu

Au-delà des URL, il vaut la peine d’analyser le texte réellement cité. Pour chaque citation, vous pouvez récupérer le grounding snippet : le passage exact de votre page qui a atterri dans la réponse. En faisant cela sur de nombreuses citations, vous voyez ce que les modèles extraient bel et bien (définitions, statistiques, descriptions de processus, comparaisons) et ce qu’ils ignorent (remplissage introductif, langage marketing, affirmations vagues).

C’est là qu’intervient la citation coverage : la part d’une page réellement citée, calculée comme le nombre de caractères cités divisé par le nombre total de caractères. Une page de 800 mots dont 290 mots sont cités atteint une coverage plus élevée qu’une page massive de 2.400 mots dont seulement 380 mots sont retenus. Une coverage élevée indique un contenu efficace et extractible. Une coverage faible trahit un texte gonflé ou une structure que le modèle n’arrive pas à traverser.

De l’intelligence à l’action

Le citation mining génère de l’insight, mais l’insight sans action est une peine perdue. Je boucle toujours la boucle de mesure :

  1. Identifiez une opportunité dans les données : des questions où vous avez zéro citation alors que vous devriez concourir, ou des pages dont les citations reculent.
  2. Passez à l’action : créez du nouveau contenu, rafraîchissez des pages obsolètes, ou analysez pourquoi un concurrent gagne soudainement.
  3. Remesurez les citations après un certain temps.
  4. Attribuez le changement à votre action.
  5. Affinez votre approche sur la base du résultat.

Visuellement, cette boucle de mesure ressemble à ceci, où chaque tour part d’une opportunité et se termine par un affinage qui rend le tour suivant plus précis :

BOUCLE DE MESURE De l'insight à la remesure répéter & accélérer 01 Opportunité trouver un trou 02 Action ajuster le contenu 03 Remesurer compter les citations 04 Attribuer relier l'effet 05 Affiner ajuster l'approche La boucle fait du citation mining un moteur d'optimisation actif.

Cette boucle fait du citation mining non pas un rapport passif, mais un moteur d’optimisation actif. Si vous voulez regrouper ces insights pour vos parties prenantes, lisez comment créer un rapport de visibilité IA dans lequel les données de citation occupent une place centrale.

Questions fréquentes

Quelle est la différence entre le citation mining et le rank tracking classique ?

Le rank tracking mesure des positions dans les résultats de recherche classiques. Le citation mining mesure quelles sources les systèmes d’IA citent dans leurs réponses générées, y compris les passages exacts qu’ils extraient. C’est une discipline à part, car les réponses IA ne fonctionnent pas avec dix liens bleus, mais avec une sélection de sources tissées dans une réponse cohérente.

De combien de requêtes ai-je besoin pour démarrer ?

Pour une image significative, visez 100 à 500 questions, selon l’ampleur de votre marché. Si vous voulez simplement commencer, 25 à 50 prompts soigneusement choisis suffisent déjà à poser une base de référence utilisable. Plus important que le nombre : mesurer le même jeu de façon répétée, afin de voir des tendances plutôt que des instantanés.

Toutes les plateformes IA citent-elles de la même manière ?

Non, et c’est précisément pour cela que vous mesurez par plateforme. Certains systèmes citent plusieurs sources par affirmation, d’autres privilégient une seule source complète. Certains pondèrent fortement la fraîcheur, d’autres valorisent la diversité des sources. Si vous êtes fort sur une plateforme et faible sur une autre, c’est une opportunité spécifique à la plateforme pour adapter votre contenu.

Dois-je construire cela moi-même ou acheter un outil ?

Cela dépend de vos moyens. Construisez vous-même si vous voulez une intelligence sur mesure et approfondie, disposez de capacité d’ingénierie et si la propriété des données est cruciale. Achetez un outil si le time-to-value compte et que les fonctionnalités standard suffisent. Une voie médiane courante est l’hybride : un outil externe pour la collecte et l’analyse de base, et vos propres analyses pour l’intelligence concurrentielle qui vous donne une longueur d’avance.

Besoin d’aide ?

Vous voulez traduire cela en exécution ? Découvrez comment nous abordons cela avec la visibilité IA.

Scan gratuit de votre site

Indiquez votre site et recevez en quelques minutes une analyse automatique avec des points d'amélioration techniques et SEO concrets. Sans discours commercial.

Où envoyons-nous votre rapport ?

Nous utilisons vos données uniquement pour votre scan. Pas de spam, désinscription à tout moment.