121 articles · 8 rubriques Mise à jour 20.08.2026
SEO et visibilité 08.08.2026 8 min de lecture

Faut-il bloquer GPTBot et ClaudeBot dans son robots.txt ?

Ce que font vraiment GPTBot, ClaudeBot et les autres, ce que vous perdez en les bloquant, et le réglage intermédiaire à retenir.

Faut-il bloquer GPTBot et ClaudeBot dans son robots.txt ?
Photo : Brett Sayles via Pexels

En bref. Si votre site vit de sa visibilité — vitrine, blog, e-commerce, service local — bloquez les robots d’IA est presque toujours une mauvaise idée : vous disparaissez des réponses de ChatGPT, Perplexity et Gemini, qui envoient déjà du trafic qualifié. Le réglage raisonnable consiste à distinguer les robots d’entraînement des robots de recherche : vous pouvez refuser les premiers et autoriser les seconds. Bloquer tout n’a de sens que pour les sites dont le contenu est le produit : médias payants, bases de données, cours en ligne.

Ces robots ne font pas tous la même chose

La confusion vient de là. On parle des « bots IA » comme d’un bloc, alors qu’ils remplissent trois fonctions très différentes, avec des conséquences opposées sur votre visibilité.

Les robots d’entraînement collectent des pages pour constituer les corpus qui serviront à entraîner les futures versions des modèles. Le bénéfice pour vous est indirect et lointain : votre marque et votre expertise finissent dans la connaissance générale du modèle, sans lien cliquable.

Les robots de recherche alimentent un index consulté en direct quand un utilisateur pose une question. C’est eux qui produisent les liens sources affichés sous une réponse. Les bloquer revient à se retirer d’un moteur de recherche.

Les robots de consultation à la demande vont chercher une page précise au moment où un utilisateur la mentionne ou clique dessus dans une conversation. Les bloquer, c’est empêcher un prospect de faire lire votre page à son assistant.

User-agentÉditeurFonctionRecommandation courante
GPTBotOpenAIEntraînement des modèlesAu choix
OAI-SearchBotOpenAIIndex de ChatGPT SearchAutoriser
ChatGPT-UserOpenAIConsultation en direct pendant une conversationAutoriser
ClaudeBotAnthropicEntraînement et rechercheAutoriser
PerplexityBotPerplexityIndex de recherche avec citation des sourcesAutoriser
Google-ExtendedGoogleEntraînement de Gemini et réponses généréesAu choix
CCBotCommon CrawlCrawl public réutilisé par de nombreux modèlesAu choix

Point important souvent ignoré : Googlebot et Google-Extended sont deux choses distinctes, mais bloquer Google-Extended ne vous retire pas des AI Overviews affichés dans les résultats Google. Ces résumés s’appuient sur l’index classique de Googlebot. Vous ne pouvez donc pas rester dans Google et sortir de ses réponses générées, sauf à refuser l’indexation tout court.

Ce que vous perdez concrètement en bloquant

Le trafic issu des assistants reste minoritaire en volume — quelques pour cent des sessions pour la plupart des sites français — mais il présente deux caractéristiques mesurables dans les statistiques : une intention d’achat plus avancée, parce que le visiteur a déjà obtenu ses réponses générales et vient chercher une décision, et un taux de rebond plus faible que le trafic de recherche classique.

Bloquer les robots de recherche revient donc à renoncer à ce flux. Pire, l’effet n’est pas symétrique : votre concurrent, lui, sera cité. Sur les requêtes du type « meilleur prestataire pour X à Lyon » ou « comparaison entre A et B », l’assistant construit sa réponse avec les pages qu’il peut lire. Un site absent n’est pas mentionné comme absent, il n’existe simplement pas dans la réponse.

À l’inverse, autoriser ces robots ne vous garantit rien. Être lisible est une condition nécessaire, pas suffisante. Les pages effectivement citées sont celles qui répondent directement à une question, avec une structure claire, des chiffres datés et un vocabulaire proche de celui de la question.

Quand le blocage se défend

  • Votre contenu est votre produit. Un média sur abonnement, une base de données professionnelle, un catalogue de formations : laisser un modèle absorber l’intégralité de votre valeur pour la restituer gratuitement est un problème économique réel.
  • Vos serveurs souffrent. Certains robots, notamment ceux qui ne respectent pas les délais entre requêtes, représentent une charge non négligeable sur un hébergement mutualisé. Regardez vos journaux avant de conclure : le problème vient plus souvent de robots de scraping non déclarés que des robots officiels.
  • Vous êtes en litige ou en négociation. Plusieurs éditeurs français bloquent par stratégie, en vue d’un accord de licence. C’est une position de négociation, pas une position technique.
  • Vos pages contiennent des données que vous ne voulez pas voir reprises : annuaires de membres, contenus réservés, documents internes indexés par erreur. Dans ce cas, le vrai correctif est une protection par mot de passe, pas une ligne dans un fichier texte.

Le fichier robots.txt est une convention, pas une barrière. Il repose sur la bonne volonté du robot qui le lit. Les acteurs établis le respectent et le documentent ; les scrapers opportunistes l’ignorent totalement. Si votre objectif est de protéger un contenu, seul un contrôle d’accès côté serveur — authentification, filtrage par user-agent, pare-feu applicatif — a un effet réel.

Le réglage recommandé, ligne par ligne

Le fichier se trouve à la racine de votre domaine, à l’adresse votresite.fr/robots.txt. Voici la configuration intermédiaire qui convient à la grande majorité des sites d’entreprise : on refuse l’entraînement, on garde la visibilité.

  • User-agent: GPTBot — puis — Disallow: /
  • User-agent: Google-Extended — puis — Disallow: /
  • User-agent: CCBot — puis — Disallow: /
  • User-agent: OAI-SearchBot — puis — Allow: /
  • User-agent: ChatGPT-User — puis — Allow: /
  • User-agent: ClaudeBot — puis — Allow: /
  • User-agent: PerplexityBot — puis — Allow: /

Chaque bloc s’écrit sur deux lignes consécutives, la déclaration du user-agent puis la directive, avec une ligne vide entre les blocs. Trois règles de syntaxe font échouer la moitié des fichiers que l’on rencontre : les noms de robots sont sensibles à la casse, une seule règle s’applique par robot — la plus spécifique — et une directive placée après une règle générale ne l’annule pas automatiquement.

Si vous préférez tout autoriser, ce qui est le choix par défaut recommandé pour un site vitrine ou un blog d’entreprise, ne mettez simplement rien : l’absence de directive vaut autorisation. Ajouter des lignes inutiles augmente seulement le risque d’erreur.

Sur WordPress, le fichier est souvent virtuel et généré par l’extension de référencement : modifiez-le depuis son interface plutôt que de déposer un fichier par FTP, sinon les deux entrent en conflit. Sur Shopify et Wix, l’édition se fait depuis les paramètres du site. Si vous n’avez pas accès à la racine de votre serveur, c’est une modification de dix minutes pour la personne qui gère votre site, ou pour un prestataire comme WDesigner si vous n’avez pas d’interlocuteur technique.

Vérifier que la configuration fonctionne

  1. Ouvrez votresite.fr/robots.txt dans un navigateur. Vous devez voir exactement le texte attendu. Un code 404 signifie que le fichier n’est pas là où vous croyez.
  2. Consultez les journaux de votre serveur sur trente jours et filtrez sur les noms de user-agents. Vous verrez qui passe réellement, à quelle fréquence, et sur quelles pages.
  3. Posez la question à l’assistant lui-même. Demandez à ChatGPT ou à Perplexity de résumer une de vos pages en donnant l’adresse. Un refus ou une erreur de récupération confirme le blocage.
  4. Suivez le trafic référent dans votre outil de statistiques : les visites provenant des domaines des assistants apparaissent comme sources classiques. Un blocage se traduit par leur disparition sous six à huit semaines.

Une décision prise aujourd’hui n’est pas définitive : le fichier se modifie en une minute, et la remise à disposition d’un site précédemment bloqué prend généralement quelques semaines pour se traduire dans les réponses. Fixez-vous simplement un point de contrôle deux fois par an, car de nouveaux robots apparaissent régulièrement.

Questions fréquentes

Bloquer GPTBot fait-il baisser mon référencement sur Google ?

Non. GPTBot appartient à OpenAI et n’a aucun lien avec l’indexation de Google. Votre positionnement dans les résultats classiques dépend de Googlebot, qui est un robot distinct. En revanche, bloquer Google-Extended agit sur l’entraînement de Gemini, sans effet sur votre classement.

Comment savoir si les robots IA visitent déjà mon site ?

Regardez les journaux d’accès de votre hébergement, section statistiques ou accès brut selon le panneau, et cherchez les chaînes GPTBot, ClaudeBot, PerplexityBot dans la colonne user-agent. Sur un site publiant régulièrement, ces passages sont visibles dès les premiers mois de mise en ligne.

Peut-on bloquer les robots IA sur une partie du site seulement ?

Oui, en remplaçant la barre oblique par le chemin concerné dans la directive. Beaucoup d’éditeurs laissent le blog accessible et ferment l’espace client ou les contenus réservés aux abonnés. C’est souvent le meilleur compromis pour un site qui vend de la documentation.

Faut-il ajouter une balise dans le code des pages en plus du robots.txt ?

Ce n’est pas nécessaire dans la plupart des cas. Certains éditeurs interprètent des directives placées dans l’en-tête HTTP ou dans une balise meta pour affiner le comportement page par page, mais le support varie d’un acteur à l’autre. Commencez par le fichier robots.txt, qui est la méthode la plus largement respectée.

Mis à jour le 08.08.2026 Version .md Plus dans SEO et visibilité →
WDesigner.fr

Votre site, livré avant le paiement.

On conçoit le site complet, vous le voyez en ligne, vous payez seulement s'il vous plaît.

Voir avant de payer →