Chaque jour, des dizaines de robots parcourent votre site sans que vous les voyiez. Certains travaillent pour Google, d'autres pour OpenAI, Anthropic ou Perplexity. Ces visiteurs automatiques collectent vos pages pour nourrir l'entraînement des systèmes génératifs, pour alimenter la recherche web de l'assistant d'OpenAI ou pour répondre en direct à la question d'une personne. Savoir qui ils sont et comment les piloter est devenu un préalable du GEO, au même titre que le référencement classique l'était hier. Ce guide passe en revue GPTBot, ChatGPT-User, OAI-SearchBot et les autres user agents, avec les lignes de robots.txt qui vont avec.
Pourquoi ces robots ne ressemblent pas à Googlebot
Le crawler historique de Google cherche des mots-clés et des liens pour construire un index. Les crawlers IA cherchent autre chose : du sens, des faits et des relations entre entités, ce qui change la façon de préparer un contenu pour eux. Ces données servent soit à l'entraînement, le corpus qui façonne ce qu'un LLM sait, soit à la recherche en temps réel, le mécanisme RAG alimenté par un crawler propriétaire qui permet de citer une source publiée la veille.
La distinction est décisive pour une marque. Refuser l'accès à un crawler d'entraînement protège vos contenus d'une réutilisation sans contrepartie. Refuser l'accès à un moteur d'indexation vous fait disparaître des réponses génératives, et donc de la visibilité que vos concurrents captent à votre place. Avant de toucher au fichier robots.txt, identifiez donc chaque agent et sa famille.
La cartographie des bots IA en 2026
Chaque éditeur d'intelligence artificielle opère plusieurs bots, avec une signature distincte par usage. La liste des crawlers connus évolue vite, et il vaut la peine de la surveiller à chaque annonce afin d'autoriser les bons et de bloquer les autres.
OpenAI : trois agents à ne pas confondre
- GPTBot assure la collecte de données destinée à l'entraînement des versions futures. Le bloquer n'a aucun effet sur votre présence dans les réponses aujourd'hui.
- OAI-SearchBot construit l'index qui alimente la recherche web de l'assistant. Lui fermer la porte vous retire des sources citables.
- ChatGPT-User n'est pas un crawler : c'est l'agent qui ouvre une page à la demande d'un utilisateur, pendant une conversation ou une user action. Derrière chaque visite, il y a une personne réelle.
Ces trois agents sont reconnaissables dans vos journaux serveur. Le premier se présente ainsi :
Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; GPTBot/1.2; +https://openai.com/gptbot
Le préfixe Mozilla et la mention KHTML, like Gecko sont un héritage du web : la plupart des bots les reprennent pour être traités comme un client compatible. Seule la fin de la chaîne identifie le visiteur.
Google : Googlebot, Google-Extended et Gemini
Google n'a pas de robot séparé pour ses modèles. C'est Googlebot qui explore les URL utilisées par les AI Overviews, l'AI Mode et Gemini. Google-Extended n'apparaît pas dans vos journaux : c'est un jeton de contrôle qui indique si vos contenus peuvent servir à l'entraînement de Gemini et de Vertex AI. Le refuser ne retire rien de la recherche ni des aperçus. Refuser Googlebot, en revanche, vous coûte tout votre référencement.
Anthropic, Perplexity et les autres
- ClaudeBot collecte pour l'entraînement des modèles Claude, tandis que Claude-User et Claude-SearchBot couvrent les visites à la demande et l'indexation.
- PerplexityBot construit l'index de Perplexity, et Perplexity-User ouvre les pages citées dans une réponse.
- Bingbot alimente Bing et Copilot ; Meta-ExternalAgent, Amazonbot et Applebot-Extended travaillent pour Meta, Amazon et Apple Intelligence.
- CCBot constitue le corpus ouvert Common Crawl, réutilisé par des laboratoires dont vous ignorez encore le nom.
Le tableau ci-dessous résume qui fait quoi, et ce que nous recommandons pour chacun.
| Robot | Éditeur | Rôle | Recommandation |
|---|---|---|---|
| GPTBot | OpenAI | Collecte pour l'entraînement | Décision éditoriale |
| OAI-SearchBot | OpenAI | Index de la recherche web | Autoriser |
| ChatGPT-User | OpenAI | Visite à la demande d'une personne | Autoriser |
| Googlebot | Recherche, AI Overviews, AI Mode, Gemini | Ne jamais bloquer | |
| Google-Extended | Jeton d'entraînement (pas un robot) | Décision éditoriale | |
| ClaudeBot | Anthropic | Collecte pour l'entraînement | Décision éditoriale |
| Claude-User, Claude-SearchBot | Anthropic | Visite à la demande, index | Autoriser |
| PerplexityBot, Perplexity-User | Perplexity | Index, visite à la demande | Autoriser |
| Bingbot | Microsoft | Bing et Copilot | Ne jamais bloquer |
| CCBot | Common Crawl | Corpus ouvert | Décision éditoriale |
Faut-il bloquer les crawlers IA ?
La réponse dépend de votre modèle. Un média qui vit de son audience peut refuser que ses articles nourrissent une IA sans compensation. Une marque qui veut être recommandée a l'intérêt inverse : un contenu inaccessible ne sera jamais cité. Notre position, mesurée sur les sites que nous suivons, tient en trois règles.
- Toujours autoriser les agents « User » et les moteurs d'indexation (ChatGPT-User, OAI-SearchBot, Claude-User, PerplexityBot). Ils correspondent à des questions réelles et à la visibilité qui en découle.
- Trancher séparément le cas de l'entraînement (GPTBot, ClaudeBot, Google-Extended, CCBot). Le refuser est défendable pour un éditeur ; pour une marque, c'est renoncer à figurer dans la connaissance de base des systèmes génératifs, celle qu'ils mobilisent sans passer par la recherche.
- Ne jamais bloquer Googlebot ni Bingbot pour des raisons IA : le coût sur le SEO serait immédiat.
Le fichier robots.txt : un exemple prêt à l'emploi
Ce fichier reste le mécanisme standard. Les grands éditeurs déclarent le respecter, mais il s'agit d'une convention, pas d'une barrière. Voici la configuration que nous recommandons à une marque soucieuse de sa visibilité et de la maîtrise de son contenu :
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: PerplexityBot
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /
Si votre priorité est la présence maximale, remplacez les lignes Disallow par Allow. Dans les deux cas, gardez un bloc explicite : une règle générique bloquerait aussi Googlebot et votre référencement avec. Deux compléments aident. Le fichier llms.txt, pendant du robots.txt pensé pour les LLM, décrit vos pages clés en markdown ; son impact reste à prouver, son coût est nul. Et les en-têtes Last-Modified et ETag signalent vos mises à jour sans obliger à tout recharger.
Lire ses journaux : ce que révèlent les visites
Autoriser ou refuser n'a de sens que si vous savez ce qui se passe. Vos journaux serveur, ou ceux de votre CDN, enregistrent chaque requête avec son IP, son URL, son code HTTP et sa signature. C'est la seule source qui dit combien de fois un crawler d'entraînement est passé cette semaine, et si l'agent utilisateur a ouvert votre page tarifs après la question d'un prospect. Trois enseignements ressortent des sites que nous observons.
- Ces visiteurs sont moins patients que Googlebot. Au-delà de dix secondes de chargement, ils abandonnent. Un TTFB sous 500 ms et des pages lisibles sans JavaScript restent la base.
- Les agents « User » ciblent des pages précises, souvent produit, tarifs ou comparatifs, quand les crawlers d'entraînement balaient le site en largeur. Cette répartition indique les questions que vos prospects posent aux assistants.
- Ce trafic n'apparaît pas dans GA4. Un bot n'exécute pas le script de mesure. Vos sessions génératives dans Google Analytics correspondent aux clics humains sur les liens cités, pas aux passages automatisés.
C'est pour rendre cette lecture accessible que Meteoria propose l'analytique crawlers IA : vous transmettez les métadonnées de vos requêtes (Cloudflare, Vercel, CloudFront, Nginx, WordPress ou un simple snippet) et le tableau de bord sépare les données d'entraînement du trafic réel, URL par URL. Croisée avec le suivi quotidien de vos prompts, la donnée montre le lien entre ce que les modèles lisent et les réponses où votre marque apparaît. Pour la suite du mécanisme, notre article sur le fonctionnement d'une réponse ChatGPT détaille la sélection des sources.
Vérifier l'identité d'un robot
Une signature se falsifie en une ligne. Des scrapers se font passer pour un bot légitime afin de profiter des règles Allow. OpenAI, Google et Anthropic publient les plages d'IP de leurs agents : une vérification par DNS inversé confirme l'identité avant d'ouvrir ou de fermer la porte. Les CDN comme Cloudflare intègrent ce contrôle et proposent d'écarter les bots non déclarés en un clic, option à manier avec précaution pour ne pas exclure les agents utiles.
De la surveillance à la stratégie
Une fois vos journaux lisibles, trois actions produisent un effet mesurable. Vérifiez que vos pages stratégiques répondent vite et sans erreur aux crawlers de recherche, comme vous le feriez pour un audit SEO. Enrichissez-les avec les faits, les chiffres et les entités que les modèles recherchent, en gardant une structure Hn nette, des méta descriptions soignées et des données structurées à jour, puisque l'extraction porte sur le sens. Puis surveillez dans la durée : fréquence des passages, part des pages indexées, réponses générées sur vos prompts cibles. Le GEO se pilote avec des données, exactement comme le SEO. Notre méthode d'audit GEO et notre article sur les délais de résultats détaillent comment suivre ces indicateurs semaine après semaine.
Questions fréquentes
Voyez quels bots IA lisent vos contenus, et pour quoi faire
Meteoria sépare le trafic d'entraînement du trafic réel, URL par URL, et le relie à vos réponses dans ChatGPT, Perplexity, Gemini et Copilot.


