// guide
Comment configurer robots.txt pour les crawlers IA ?
Mis à jour: 2026-08-19
// réponse courte
Configurer robots.txt pour les crawlers IA revient à prendre trois décisions distinctes, pas une : admettre ou non les robots d'entraînement, les robots d'indexation de recherche et les fetchers initiés par l'utilisateur. Chaque éditeur exploite des user-agents différents pour chaque tâche. La plupart des sites devraient autoriser la recherche et les récupérations utilisateur, décider délibérément pour l'entraînement — et savoir que certains fetchers ignorent totalement robots.txt.
Une décision qui en cache trois
« Faut-il bloquer les bots d'IA ? » n'a pas de réponse, parce que ce n'est pas une seule question. Chaque grande entreprise d'IA exploite des robots distincts pour des tâches distinctes : les robots d'entraînement alimentent les corpus des modèles, les robots d'indexation de recherche alimentent les réponses qui vous citent, et les fetchers initiés par l'utilisateur lisent une page parce qu'une personne vient d'interroger l'assistant à son sujet. Bloquez-les tous d'une seule ligne et vous n'avez pas pris position sur l'entraînement des IA — vous vous êtes retiré des réponses des IA.
Les coûts sont asymétriques. Bloquer un robot d'entraînement est un choix philosophique sans, dans la plupart des cas, prix en visibilité : Google et Apple le documentent explicitement, et pour OpenAI et Anthropic cela découle de la séparation des bots — la recherche fonctionne sur des agents distincts, aux conséquences documentées séparément. Bloquer un agent de recherche ou de récupération utilisateur a un prix direct et documenté — OpenAI, par exemple, indique que les sites ayant refusé OAI-SearchBot « ne seront pas affichés dans les réponses de recherche de ChatGPT ». La mécanique par moteur est couverte dans nos guides sur la citation par ChatGPT, Claude et Perplexity ; cette page en est la carte complète.
Deux chiffres cadrent l'échange. Cloudflare a mesuré combien de pages les entreprises d'IA explorent pour chaque visite qu'elles renvoient en retour : selon les données de Cloudflare Radar pour juin 2025, environ 1 700 explorations par visite référée pour OpenAI et environ 70 900 pour Anthropic. Les ratios baissent depuis — le tableau de bord AI Insights de Cloudflare les suit en direct — mais la forme du marché est claire : vous échangez une exploration intensive contre des citations. Le tableau ci-dessous vous permet d'en fixer les termes.
La liste complète des crawlers IA, vérifiée dans la documentation des éditeurs
Chaque ligne ci-dessous est vérifiée dans la documentation de l'opérateur lui-même, à jour d'août 2026. « Token » signifie que le nom ne fonctionne que comme groupe robots.txt — il n'existe pas de robot distinct avec ce user-agent.
| User-agent | Rôle | Respecte robots.txt | Ce que le blocage vous coûte |
|---|---|---|---|
| GPTBot — OpenAI | Entraînement | Oui | Contenu futur exclu de l'entraînement des modèles OpenAI ; la recherche ChatGPT fonctionne sur OAI-SearchBot |
| OAI-SearchBot — OpenAI | Index de recherche | Oui | « Ne seront pas affichés dans les réponses de recherche de ChatGPT » |
| ChatGPT-User — OpenAI | Récupération utilisateur | « Les règles peuvent ne pas s'appliquer » (officiel) | Déclaratif seulement — les récupérations sont initiées par l'utilisateur |
| ClaudeBot — Anthropic | Entraînement | Oui | Contenu futur exclu des jeux de données d'entraînement d'Anthropic |
| Claude-SearchBot — Anthropic | Index de recherche | Oui | Non indexé — « peut réduire la visibilité de votre site » |
| Claude-User — Anthropic | Récupération utilisateur | Oui | La page ne peut pas être récupérée à la demande d'un utilisateur Claude |
| PerplexityBot — Perplexity | Index de recherche | Oui | Hors de l'index de recherche et des citations de Perplexity |
| Perplexity-User — Perplexity | Récupération utilisateur | « Ignore généralement robots.txt » (officiel) | Déclaratif seulement |
| Google-Extended — Google (token) | Contrôle de l'entraînement et du grounding | Honoré via Googlebot | Hors de l'entraînement et du grounding de Gemini ; Search et AI Overviews non affectés |
| Applebot — Apple | Index de recherche (Siri, Spotlight, Safari) | Oui — suit les règles de Googlebot s'il n'est pas nommé | Hors des surfaces de recherche Apple |
| Applebot-Extended — Apple (token) | Contrôle de l'entraînement | Honoré via Applebot | Hors de l'entraînement des modèles de fondation d'Apple ; reste dans Siri et Spotlight |
| Meta-ExternalAgent — Meta | Entraînement + indexation | Oui | Hors de l'entraînement de Meta AI et de son index |
| Meta-ExternalFetcher — Meta | Récupération utilisateur | « Peut contourner robots.txt » (officiel) | Déclaratif seulement |
| CCBot — Common Crawl | Archive du web ouvert | Oui | Hors des jeux de données publics sur lesquels de nombreux laboratoires d'IA s'entraînent — un retrait en bloc |
| Amazonbot — Amazon | Amélioration des produits ; peut entraîner les modèles d'IA d'Amazon | Oui | Hors de l'exploration Amazon, y compris tout entraînement de modèles |
| Amzn-SearchBot — Amazon | Index de recherche (expériences de recherche Alexa ; pas d'entraînement) | Oui — suit les règles génériques des robots de recherche s'il n'est pas nommé | Hors des expériences de recherche Alexa |
| Amzn-User — Amazon | Récupération utilisateur (requêtes Alexa) | « Peut ne pas suivre toutes les directives robots.txt » (officiel) | Déclaratif seulement |
| DuckAssistBot — DuckDuckGo | Réponses en temps réel (pas d'entraînement) | Oui (appliqué sous 72 h) | Hors des réponses DuckAssist |
| Bytespider — ByteDance | Entraînement (non documenté) | Non — l'ignore en pratique mesurée | Rien via robots.txt ; exige un blocage au niveau du serveur |
Comment bloquer les crawlers IA — ou non : trois configurations prêtes à l'emploi
Le tableau se traduit en trois politiques viables.
Config 1 — priorité à la visibilité. Tout autoriser, explicitement : un groupe Allow par agent pour chaque bot documenté du tableau (tous sauf Bytespider — un Allow pour un bot qui ignore le fichier n'est que du bruit), plus un attrape-tout. Adaptée aux sites qui vivent d'être trouvés et cités — entreprises de contenu, agences, la plupart des B2B. C'est ce que nous utilisons nous-mêmes ; voir « Comment nous gérons le nôtre » ci-dessous.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /…et ainsi de suite pour chaque agent du tableau. Notre fichier de production sur get-geo.ai/robots.txt en est la version complète.
Config 2 — sans entraînement. Le choix délibéré le plus courant : rester hors des corpus de modèles, rester dans les réponses. Interdisez les robots et tokens d'entraînement, autorisez le reste. Deux réserves avant de copier-coller : la ligne Bytespider est déclarative (la section suivante explique pourquoi), et retirer Meta-ExternalAgent est le seul refus d'entraînement à prix de visibilité — il vous sort aussi de l'index de Meta :
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /Config 3 — verrouillage. Légitime pour du contenu payant ou propriétaire. Robots.txt permet à plusieurs lignes User-agent de partager un même bloc de règles, l'ensemble reste donc compact — nous laissons Applebot de côté ici, car le bloquer vous retire aussi de la recherche Siri et Spotlight, une décision plus lourde que les réponses des IA :
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: Meta-ExternalFetcher
User-agent: CCBot
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: Bytespider
Disallow: /Lisez la section suivante avant de déployer ceci : pour plusieurs des agents ci-dessus, le fichier est une demande, pas une barrière.
Quels crawlers IA ignorent robots.txt
Robots.txt est une politique publiée, pas un mécanisme d'application — et pour toute une classe d'agents, les éditeurs le disent eux-mêmes. OpenAI à propos de ChatGPT-User : « Comme ces actions sont initiées par un utilisateur, les règles robots.txt peuvent ne pas s'appliquer. » Meta à propos de Meta-ExternalFetcher : il « peut contourner robots.txt parce qu'il effectue des récupérations demandées par l'utilisateur ». Le fetcher utilisateur de Perplexity « ignore généralement les règles robots.txt ». Amazon à propos d'Amzn-User : il « peut ne pas suivre toutes les directives robots.txt ». La logique est cohérente : un humain a demandé, la récupération est donc traitée comme la visite de l'humain, pas comme une exploration.
Vient ensuite Bytespider, qui n'a aucune documentation et ignore le fichier en pratique mesurée : Cloudflare l'a vu frapper plus de sites protégés que tout autre crawler IA (40,4 % à la mi-2024), et HAProxy l'a mesuré à près de 90 % de son trafic de crawlers IA, en notant qu'il ignore les instructions de robots.txt.
L'application des règles se joue donc un niveau plus bas. Vérifiez les robots avec les listes d'IP que la plupart des éditeurs publient — OpenAI, Anthropic, Apple, Common Crawl et DuckDuckGo maintiennent des listes JSON, Amazon publie ses plages sur sa page développeur — et bloquez au niveau du CDN ou du WAF ce que vous voulez réellement arrêter. La vérification compte plus qu'il n'y paraît : HUMAN Security a mesuré qu'une requête sur dix-huit portant un user-agent de crawler IA connu est usurpée.
Comment nous gérons le nôtre
Notre propre robots.txt est la configuration priorité à la visibilité : dix-neuf groupes Allow explicites par agent — chaque agent du tableau qui honore le fichier, les fetchers utilisateur que nous accueillons de toute façon, et le Bingbot classique — suivis d'un Allow attrape-tout. Nous l'avons refondu sous cette forme en août 2026, en supprimant au passage l'ancien groupe anthropic-ai — et, lors du fact-checking de ce guide, un groupe cohere-ai spéculatif aussi : la propre documentation de Cohere indique qu'elle n'exploite aucun crawler à l'heure actuelle.
L'objection évidente : un « User-agent: * / Allow: / » d'une seule ligne produirait un comportement de crawler identique. C'est vrai. Les groupes explicites apportent trois choses que la ligne unique n'apporte pas. Chaque éditeur reçoit un signal d'intention sans ambiguïté plutôt qu'une absence d'objection. Les modifications futures sont plus sûres — un Disallow ajouté pour un agent ne peut pas s'appliquer en silence à des agents auxquels personne n'a pensé. Et le fichier sert aussi de liste de contrôle : quand un éditeur lance un nouvel agent, comme OpenAI et Anthropic l'ont fait tous deux au cours des deux dernières années, le manque est visible dans le fichier lui-même et dans nos journaux d'exploration.
Le fichier n'est qu'une pièce du dispositif que nous documentons dans notre guide sur la façon dont nous faisons du GEO sur notre propre site. C'est la politique d'un site qui gagne sa vie grâce aux citations des IA. Un éditeur avec des archives payantes choisirait raisonnablement la config 2 ou 3 — l'intérêt de ce guide n'est pas notre réponse, mais le tableau qui vous permet de choisir la vôtre. Quelle que soit la configuration retenue, inscrivez une revue trimestrielle au calendrier : la liste ne cesse de bouger — OpenAI a ajouté OAI-SearchBot en 2024, Anthropic a ajouté Claude-SearchBot en 2025, Amazon a scindé son exploration en trois agents d'ici 2026 — et un robots.txt écrit en 2024 se trompe déjà sur les crawlers d'aujourd'hui.
Questions liées
Faut-il bloquer les crawlers IA ?
Séparez la question par fonction. Bloquer les robots d'entraînement (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, Amazonbot) ne coûte aucune visibilité de recherche — explicitement documenté par Google et Apple, structurel pour les autres. L'exception est Meta-ExternalAgent, qui entraîne et indexe avec un seul agent : le bloquer vous sort des deux. Bloquer les agents d'index de recherche et de récupération utilisateur vous retire des réponses des IA, là où se pose une part croissante des questions d'achat. Tranchez la question de l'entraînement par principe ; tranchez la question de la visibilité selon la provenance de vos citations et de votre trafic.
Bloquer GPTBot retire-t-il mon site de ChatGPT ?
Non. GPTBot n'alimente que l'entraînement des modèles. La recherche de ChatGPT fonctionne sur OAI-SearchBot, et les lectures de pages demandées par l'utilisateur passent par ChatGPT-User — bloquez GPTBot et les deux continuent de fonctionner. C'est la même séparation qu'Anthropic applique avec ClaudeBot face à Claude-SearchBot et Claude-User.
Google-Extended affecte-t-il les AI Overviews ?
Non — et c'est l'erreur la plus courante du genre. Google documente que Google-Extended contrôle l'entraînement et le grounding de Gemini et « n'a pas d'impact sur l'inclusion d'un site dans la recherche Google ». Les AI Overviews et le AI Mode font partie de Search lui-même : ils sont régis par l'accès de Googlebot et les contrôles d'extraits — nosnippet, data-nosnippet, max-snippet, noindex. La mécanique complète est dans notre guide sur l'apparition dans les AI Overviews de Google.
Comment vérifier qu'un crawler est authentique ?
Ne vous fiez jamais à la seule chaîne user-agent — une requête sur dix-huit se réclamant d'un crawler IA connu est usurpée, selon les mesures 2026 de HUMAN Security. Comparez l'IP source avec la liste publiée par l'éditeur : OpenAI, Anthropic, Apple, Common Crawl et DuckDuckGo publient des listes d'IP en JSON, Amazon publie ses plages sur sa page développeur, et Google et Apple prennent en charge la vérification par DNS inverse. Tout ce qui échoue au contrôle est traité comme un scraper, quel que soit le nom qu'il se donne.
Robots.txt suffit-il, ou faut-il aussi llms.txt ?
Ils font des travaux différents. Robots.txt contrôle l'accès — qui peut récupérer quoi. llms.txt est une aide à la navigation — une carte lisible par machine qui aide les modèles à trouver et interpréter vos pages clés une fois entrés. L'accès d'abord : un llms.txt derrière un Disallow général n'aide personne. llms.txt a son propre guide dans cette série.
Guides associés
Sources
- 01Notre guide : Comment apparaître dans les AI Overviews de Google ?
- 02Notre guide : Comment faire du GEO sur son propre site en pratique ?
- 03OpenAI — documentation des bots : GPTBot, OAI-SearchBot, ChatGPT-User
- 04Anthropic — documentation des robots : ClaudeBot, Claude-SearchBot, Claude-User
- 05Perplexity — documentation des robots : PerplexityBot, Perplexity-User
- 06Google — robots d'exploration courants et Google-Extended
- 07Google — fonctionnalités d'IA dans la recherche et contrôles pour les propriétaires de sites
- 08Apple — Applebot et Applebot-Extended
- 09Meta — robots d'exploration web : Meta-ExternalAgent, Meta-ExternalFetcher
- 10Common Crawl — documentation de CCBot
- 11Amazon — documentation d'Amazonbot
- 12DuckDuckGo — documentation de DuckAssistBot
- 13Cloudflare — le ratio exploration/visite référée des plateformes d'IA (juillet 2025) et AI Insights en direct
- 14Cloudflare — Bytespider en tête du trafic et des blocages de bots IA (juillet 2024)
- 15HAProxy — ~90 % de notre trafic de crawlers IA vient de Bytespider (oct. 2024)
- 16HUMAN Security — State of AI traffic 2026 : mesures de l'usurpation de crawlers
// partager