Combien de sources ChatGPT utilise-t-il ? Notre étude sur 100 interrogations
Combien de sources ChatGPT lit-il vraiment avant de répondre ? Nous avons mesuré : en moyenne, 22 sources citées par réponse, mais jusqu'à 132 sources différentes mobilisées quand on pose 100 fois la même question. Ces deux chiffres, issus de nos mesures quotidiennes, changent la façon de travailler sa visibilité, en SEO comme en GEO (generative engine optimization). Voici l'étude, la méthode, et ce qu'il faut en faire.
La méthode : 100 interrogations, une même question
Une interrogation isolée de ChatGPT, l'intelligence artificielle d'OpenAI, ne dit rien : les réponses de ChatGPT varient d'une session à l'autre. Demander à ChatGPT ses sources dans l'interface ne montre d'ailleurs qu'une partie du réservoir. Nous avons donc posé la même question 100 fois, en collectant à chaque interrogation les sources citées dans la réponse. Résultat : chaque réponse individuelle s'appuie sur une vingtaine de sources (22 en moyenne), mais l'ensemble des 100 interrogations fait apparaître jusqu'à 132 domaines différents. Autrement dit, ChatGPT pioche à chaque fois une combinaison différente dans un réservoir bien plus large que ce qu'une réponse laisse voir. Chez Perplexity, le même protocole donne une dizaine de sources par réponse et un réservoir d'environ 40 domaines : un moteur beaucoup plus stable.
D'où viennent ces sources ?
Quand la question exige du frais, ChatGPT déclenche une recherche web : décomposition de la question (le query fan-out), collecte du haut du classement Google (et historiquement un peu de Bing) par la recherche web, sélection sur la base de l'autorité de domaine perçue et des titres et descriptions, lecture. S'y ajoutent deux autres canaux. Les données d'entraînement du modèle GPT d'abord, avec leurs biais : les biais des données d'entraînement des modèles GPT expliquent pourquoi certaines marques historiques dominent des réponses sans être citées via une source fraîche. Les contenus sous licence ensuite : OpenAI signe des partenariats avec de grands éditeurs comme Axel Springer, Associated Press ou News Corp, dont les contenus alimentent les réponses avec un statut privilégié. Reddit occupe une place à part : la plateforme communautaire est devenue l'une des sources les plus citées, tous sujets confondus, et Reddit pèse en France comme ailleurs. Enfin, pour les usages en entreprise, les connecteurs MCP branchent ChatGPT sur des données internes, hors de portée du GEO.
Le détail par type de question : le réservoir n'a pas toujours la même taille
Les 22 sources et les 132 domaines sont des moyennes sur des questions comparatives de type « quel est le meilleur outil pour ». Le réservoir varie fortement selon l'intention. Sur une question factuelle simple (une définition, une date, un chiffre), ChatGPT lit peu et cite peu : cinq à huit sources, un réservoir d'une trentaine de domaines, souvent dominé par Wikipedia et une poignée de sites de référence. Sur une question comparative ou de recommandation, on retrouve nos chiffres : une vingtaine de sources par réponse, plus d'une centaine de domaines mobilisés sur cent interrogations, avec une forte présence des comparateurs, des sites d'avis et des articles de presse spécialisée. Sur une question d'achat, la recherche produit ajoute une couche : les fiches marchands, les places de marché et les guides d'achat entrent dans le réservoir, et le carrousel de produits qui en résulte pioche dans un sous-ensemble encore différent. Sur une question locale, enfin, les sources se concentrent sur les annuaires, les fiches Google Business et les avis, avec un réservoir plus étroit mais très volatil. Pour votre marque, la conséquence est simple : le nombre de sources à conquérir dépend d'abord du type de questions que vos clients posent. Un audit sérieux commence par classer vos requêtes stratégiques par intention, puis mesure le réservoir de chacune, plutôt que d'appliquer une moyenne à tout le monde.
Ce que ces chiffres changent pour votre marque
Premier enseignement : sur ChatGPT, viser « la » bonne source n'existe pas. Puisque le moteur pioche dans un réservoir de plus de cent domaines, votre marque et votre contenu doivent être présents dans beaucoup de sources bien classées sur Google pour apparaître régulièrement dans les réponses générées. C'est l'inverse de Perplexity, où cibler les quarante domaines clés suffit. Deuxième enseignement : la fiabilité des réponses se mesure, elle ne se constate pas. Pour une équipe marketing digital, tester ChatGPT une fois et copier coller le résultat dans un reporting n'a aucune valeur : seule une mesure répétée (15 à 30 interrogations minimum par question) donne un chiffre exploitable. Troisième enseignement : l'audit de sources est le levier numéro un, et c'est le cœur de la generative engine optimization (GEO) ; le duo SEO GEO se pilote sur les mêmes données. Identifier les domaines du réservoir qui citent vos concurrents sans vous citer, c'est votre plan d'action tout tracé.
Ce que la sélection des sources dit de la méthode à suivre
Deux observations complémentaires de notre étude éclairent la stratégie. D'abord, la sélection est décidée avant la lecture : ChatGPT filtre les résultats de recherche sur leurs titres et descriptions, puis ne visite qu'une partie. Une page invisible dans les premiers résultats de Google ou de Bing, ou dont le titre ne promet pas de réponse, n'entre jamais dans le réservoir, quelle que soit la qualité de son contenu. C'est le point de jonction entre référencement classique et GEO : le SEO fait entrer vos pages dans la liste, le GEO fait qu'elles sont lues et citées. Ensuite, le réservoir se renouvelle : sur nos cent interrogations, environ un tiers des domaines n'apparaissent qu'une ou deux fois. Ce sont les entrants, les sources que le modèle teste. Une source nouvellement citée sur votre requête (un article de presse récent, une fiche fraîchement mise à jour, un fil de discussion actif) a une fenêtre de quelques semaines pour s'installer ou disparaître. Le contenu frais, daté, structuré, avec de l'autorité visible (auteur identifié, données sourcées) tend à rester ; le contenu générique sort. Pour une équipe marketing, cela dessine une routine : publier régulièrement sur les questions à fort réservoir, surveiller les entrants chaque semaine, et travailler en priorité les domaines tiers qui restent d'une interrogation à l'autre, car ce sont eux qui structurent durablement la réponse.
Mesurer votre propre réservoir de sources
Ces chiffres sont des moyennes : votre secteur, en France comme ailleurs, a son propre réservoir de sites web, sa propre volatilité. Meteoria applique ce protocole chaque jour à vos requêtes stratégiques : interrogations multiples, collecte des sources citées, sentiment, et restitution du paysage concurrentiel complet. Pour comprendre la mécanique amont, notre article sur le fonctionnement d'une réponse ChatGPT détaille les neuf étapes, notre analyse des sources de ChatGPT explore la typologie des domaines cités, et notre guide du query fan-out montre comment connaître les mots-clés réels que l'intelligence artificielle tape à votre sujet.
Questions fréquentes sur les sources de ChatGPT
Peut-on voir toutes les sources d'une réponse ? Non. L'interface affiche une sélection de citations, généralement bien moins que les 22 sources lues en moyenne. Le reste est invisible côté utilisateur, ce qui rend l'observation manuelle trompeuse : la source qui a orienté la réponse n'est pas forcément celle qui est affichée. Seule une collecte outillée, répétée sur des dizaines d'interrogations, reconstitue le réservoir complet.
Les sources changent-elles d'un pays à l'autre ? Oui, nettement. La même question posée en France, en Espagne ou en Allemagne mobilise des réservoirs différents, avec quelques domaines internationaux communs (Wikipedia, Reddit, la presse anglophone) et une majorité de sources locales. Une marque présente sur plusieurs marchés doit donc mesurer chaque pays séparément, et son plan de sources aussi.
Combien de sources faut-il conquérir pour être cité régulièrement ? Il n'y a pas de seuil universel, mais nos mesures donnent un repère : sur une question comparative, une marque présente dans une quinzaine des domaines les plus stables du réservoir apparaît dans une majorité de réponses. En dessous de cinq, la présence est intermittente. L'objectif n'est donc pas de couvrir les 132 domaines, mais d'identifier le noyau stable et de s'y installer.
Reddit compte-t-il vraiment dans le réservoir français ? Oui, même sur des questions posées en français. Les fils Reddit, souvent anglophones, entrent dans le réservoir dès que la question est comparative, et le modèle les traduit et les résume sans difficulté. Sur certaines catégories de produits, deux ou trois fils de discussion pèsent autant qu'un comparateur français établi. C'est une raison de plus de surveiller les communautés, sans y intervenir de façon artificielle : les modèles comme les modérateurs repèrent vite les contributions promotionnelles.
22 sources par réponse, 132 au total : et pour vos requêtes à vous ? Meteoria mesure votre réservoir de sources réel, chaque jour. Essai gratuit d'une semaine, toutes fonctions incluses.



