// guía
¿Cómo configurar robots.txt para los rastreadores de IA?
Actualizado: 2026-08-19
// respuesta breve
Configurar robots.txt para los rastreadores de IA implica tomar tres decisiones separadas, no una: si admite los rastreadores de entrenamiento, los rastreadores de índice de búsqueda y los fetchers iniciados por el usuario. Cada proveedor opera user-agents distintos para cada trabajo. La mayoría de los sitios debería permitir la búsqueda y las recuperaciones de usuario, decidir deliberadamente sobre el entrenamiento — y saber que algunos fetchers ignoran robots.txt por completo.
Una decisión que en realidad son tres
«¿Debería bloquear los bots de IA?» no tiene respuesta, porque no es una sola pregunta. Cada gran empresa de IA opera rastreadores separados para trabajos separados: los rastreadores de entrenamiento alimentan los corpus de los modelos, los rastreadores de índice de búsqueda alimentan las respuestas que le citan, y los fetchers iniciados por el usuario leen una página porque una persona acaba de preguntar por ella al asistente. Bloquéelos todos con una sola línea y no habrá tomado postura sobre el entrenamiento de IA: se habrá eliminado de las respuestas de IA.
Los costes son asimétricos. Bloquear un rastreador de entrenamiento es una elección filosófica que, en la mayoría de los casos, no tiene precio en visibilidad: Google y Apple lo documentan de forma explícita, y para OpenAI y Anthropic se deduce de la separación de bots — la búsqueda funciona con agentes independientes cuyas consecuencias están documentadas por separado. Bloquear un agente de búsqueda o de recuperación de usuario tiene un precio directo y documentado — OpenAI, por ejemplo, declara que los sitios excluidos de OAI-SearchBot «no se mostrarán en las respuestas de búsqueda de ChatGPT». La mecánica por motor se trata en nuestras guías sobre cómo conseguir que le citen ChatGPT, Claude y Perplexity; esta página es el mapa completo.
Dos cifras enmarcan el trato. Cloudflare midió cuántas páginas rastrean las empresas de IA por cada visita que devuelven a cambio: según los datos de Cloudflare Radar de junio de 2025, aproximadamente 1.700 rastreos por derivación en el caso de OpenAI y unos 70.900 en el de Anthropic. Las proporciones han ido bajando desde entonces — el panel AI Insights de Cloudflare las sigue en directo —, pero la forma del trato está clara: usted cambia un rastreo intensivo por citas. La tabla siguiente es la forma de fijar las condiciones.
La lista completa de rastreadores de IA, verificada con la documentación de los proveedores
Cada fila de abajo está contrastada con la documentación del propio operador a fecha de agosto de 2026. «Token» significa que el nombre solo funciona como grupo de robots.txt: no existe un rastreador independiente con ese user-agent.
| User-agent | Función | Respeta robots.txt | Bloquearlo le cuesta |
|---|---|---|---|
| GPTBot — OpenAI | Entrenamiento | Sí | El contenido futuro queda excluido del entrenamiento de modelos de OpenAI; la búsqueda de ChatGPT funciona con OAI-SearchBot |
| OAI-SearchBot — OpenAI | Índice de búsqueda | Sí | «No se mostrarán en las respuestas de búsqueda de ChatGPT» |
| ChatGPT-User — OpenAI | Recuperación de usuario | «Es posible que las reglas no se apliquen» (oficial) | Solo declarativo — las recuperaciones las inicia el usuario |
| ClaudeBot — Anthropic | Entrenamiento | Sí | El contenido futuro queda excluido de los conjuntos de entrenamiento de Anthropic |
| Claude-SearchBot — Anthropic | Índice de búsqueda | Sí | No se indexa — «puede reducir la visibilidad de su sitio» |
| Claude-User — Anthropic | Recuperación de usuario | Sí | La página no puede obtenerse a petición de un usuario de Claude |
| PerplexityBot — Perplexity | Índice de búsqueda | Sí | Fuera del índice de búsqueda y de las citas de Perplexity |
| Perplexity-User — Perplexity | Recuperación de usuario | «Generalmente ignora robots.txt» (oficial) | Solo declarativo |
| Google-Extended — Google (token) | Control de entrenamiento y grounding | Se respeta vía Googlebot | Fuera del entrenamiento y el grounding de Gemini; la Búsqueda y AI Overviews no se ven afectados |
| Applebot — Apple | Índice de búsqueda (Siri, Spotlight, Safari) | Sí — sigue las reglas de Googlebot si no se le nombra | Fuera de las superficies de búsqueda de Apple |
| Applebot-Extended — Apple (token) | Control de entrenamiento | Se respeta vía Applebot | Fuera del entrenamiento de los modelos fundacionales de Apple; permanece en Siri y Spotlight |
| Meta-ExternalAgent — Meta | Entrenamiento e indexación | Sí | Fuera del entrenamiento de Meta AI y de su índice |
| Meta-ExternalFetcher — Meta | Recuperación de usuario | «Puede omitir robots.txt» (oficial) | Solo declarativo |
| CCBot — Common Crawl | Archivo abierto de la web | Sí | Fuera de los conjuntos de datos públicos con los que entrenan muchos laboratorios de IA — una exclusión al por mayor |
| Amazonbot — Amazon | Mejora de productos; puede entrenar modelos de IA de Amazon | Sí | Fuera del rastreo de Amazon, incluido cualquier entrenamiento de modelos |
| Amzn-SearchBot — Amazon | Índice de búsqueda (experiencias de búsqueda de Alexa; sin entrenamiento) | Sí — sigue las reglas genéricas de bots de búsqueda si no se le nombra | Fuera de las experiencias de búsqueda de Alexa |
| Amzn-User — Amazon | Recuperación de usuario (peticiones de Alexa) | «Puede no seguir todas las directivas de robots.txt» (oficial) | Solo declarativo |
| DuckAssistBot — DuckDuckGo | Respuestas en tiempo real (sin entrenamiento) | Sí (se aplica en un plazo de 72 horas) | Fuera de las respuestas de DuckAssist |
| Bytespider — ByteDance | Entrenamiento (sin documentar) | No — lo ignora en la práctica medida | Nada vía robots.txt; requiere un bloqueo a nivel de servidor |
Cómo bloquear los rastreadores de IA — o no: tres configuraciones listas para usar
La tabla se traduce en tres políticas viables.
Configuración 1 — visibilidad primero. Permitir todo, de forma explícita: un grupo Allow por agente para cada bot documentado de la tabla (todos menos Bytespider — un Allow para un bot que ignora el archivo es ruido), más un grupo comodín. Adecuada para sitios que viven de ser encontrados y citados: negocios de contenidos, agencias, la mayoría del B2B. Es la que usamos nosotros mismos; vea «Cómo lo gestionamos nosotros» más abajo.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /…y así sucesivamente para cada agente de la tabla. Nuestro archivo de producción en get-geo.ai/robots.txt es la versión completa.
Configuración 2 — sin entrenamiento. La elección deliberada más común: quedarse fuera de los corpus de los modelos y dentro de las respuestas. Disallow para los rastreadores y tokens de entrenamiento, Allow para el resto. Dos advertencias antes de copiarla: la línea de Bytespider es declarativa (la siguiente sección explica por qué), y excluir Meta-ExternalAgent es la única exclusión de entrenamiento con precio en visibilidad — también le saca del índice de Meta:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: *
Allow: /Configuración 3 — cierre total. Legítima para contenido de pago o propietario. Robots.txt permite que varias líneas User-agent compartan un mismo bloque de reglas, así que el conjunto queda compacto — aquí dejamos fuera a Applebot porque bloquearlo también le elimina de la búsqueda de Siri y Spotlight, una decisión mayor que las respuestas de IA:
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
User-agent: Perplexity-User
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: Meta-ExternalAgent
User-agent: Meta-ExternalFetcher
User-agent: CCBot
User-agent: Amazonbot
User-agent: Amzn-SearchBot
User-agent: Amzn-User
User-agent: DuckAssistBot
User-agent: Bytespider
Disallow: /Lea la sección siguiente antes de publicar esta configuración: para varios de los agentes anteriores, el archivo es una petición, no una barrera.
Qué rastreadores de IA ignoran robots.txt
Robots.txt es una política publicada, no un mecanismo de aplicación — y para toda una clase de agentes, los propios proveedores lo dicen. OpenAI sobre ChatGPT-User: «Dado que estas acciones las inicia un usuario, es posible que las reglas de robots.txt no se apliquen». Meta sobre Meta-ExternalFetcher: «puede omitir robots.txt porque realiza recuperaciones solicitadas por el usuario». El fetcher de usuario de Perplexity «generalmente ignora las reglas de robots.txt». Amazon sobre Amzn-User: «puede no seguir todas las directivas de robots.txt». La lógica es consistente: un humano lo pidió, así que la recuperación se trata como la visita del humano, no como un rastreo.
Y luego está Bytespider, que carece por completo de documentación e ignora el archivo en la práctica medida: Cloudflare lo encontró accediendo a más sitios protegidos que ningún otro rastreador de IA (el 40,4 % a mediados de 2024), y HAProxy lo midió en cerca del 90 % de su tráfico de rastreadores de IA, señalando que ignora las instrucciones de robots.txt.
Así que la aplicación real vive una capa más abajo. Verifique los rastreadores con las listas de IP que publican la mayoría de proveedores — OpenAI, Anthropic, Apple, Common Crawl y DuckDuckGo mantienen listas JSON, Amazon publica sus rangos en su página para desarrolladores — y bloquee en el CDN o WAF lo que de verdad quiera detener. La verificación importa más de lo que parece: HUMAN Security midió que una de cada dieciocho peticiones con un user-agent de rastreador de IA conocido está suplantada.
Cómo lo gestionamos nosotros
Nuestro propio robots.txt es la configuración de visibilidad primero: diecinueve grupos Allow explícitos por agente — cada agente de la tabla que respeta el archivo, los fetchers de usuario que de todos modos damos la bienvenida y el clásico Bingbot — seguidos de un Allow comodín. Lo reescribimos con esta forma en agosto de 2026, eliminando en la misma pasada el grupo heredado anthropic-ai — y, al verificar los datos de esta guía, también un grupo especulativo cohere-ai: la propia documentación de Cohere declara que por ahora no opera rastreadores.
La objeción obvia: un «User-agent: * / Allow: /» de una línea produciría un comportamiento de rastreo idéntico. Cierto. Los grupos explícitos aportan tres cosas que la línea única no da. Cada proveedor recibe una señal inequívoca de intención en lugar de una ausencia de objeción. Las ediciones futuras son más seguras: un Disallow añadido para un agente no puede aplicarse en silencio a agentes en los que nadie pensó. Y el archivo sirve además de lista de revisión: cuando un proveedor lanza un agente nuevo, como hicieron OpenAI y Anthropic en los últimos dos años, el hueco es visible en el propio archivo y en nuestros registros de rastreo.
El archivo es una pieza del montaje que documentamos en nuestra guía sobre cómo hacemos GEO en nuestro propio sitio. Esa es la política de un sitio que vive de las citas de IA. Un editor con archivos de pago haría bien en usar la configuración 2 o la 3 — el sentido de esta guía no es nuestra respuesta, sino la tabla que le permite elegir la suya. Elija la configuración que elija, ponga una revisión trimestral en el calendario: la nómina no deja de moverse — OpenAI añadió OAI-SearchBot en 2024, Anthropic añadió Claude-SearchBot en 2025, Amazon dividió su rastreo en tres agentes para 2026 — y un robots.txt escrito en 2024 ya se equivoca sobre los rastreadores de hoy.
Preguntas relacionadas
¿Debería bloquear los rastreadores de IA?
Divida la pregunta por función. Bloquear los rastreadores de entrenamiento (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot, Amazonbot) no cuesta visibilidad en búsqueda — Google y Apple lo documentan de forma explícita, y para el resto es estructural. La excepción es Meta-ExternalAgent, que entrena e indexa con un solo agente: bloquearlo le saca de ambas cosas. Bloquear los agentes de índice de búsqueda y de recuperación de usuario le elimina de las respuestas de IA, que es donde se hace una parte creciente de las preguntas de compra. Decida la cuestión del entrenamiento por principios; decida la de la visibilidad según de dónde vienen sus citas y su tráfico.
¿Bloquear GPTBot elimina mi sitio de ChatGPT?
No. GPTBot solo alimenta el entrenamiento de modelos. La búsqueda de ChatGPT funciona con OAI-SearchBot, y las lecturas de página a petición del usuario pasan por ChatGPT-User — bloquee GPTBot y ambos siguen funcionando. Es la misma separación que aplica Anthropic con ClaudeBot frente a Claude-SearchBot y Claude-User.
¿Google-Extended afecta a AI Overviews?
No — y este es el error más común del género. Google documenta que Google-Extended controla el entrenamiento y el grounding de Gemini y «no afecta a la inclusión de un sitio en la Búsqueda de Google». AI Overviews y AI Mode forman parte de la propia Búsqueda: se rigen por el acceso de Googlebot y los controles de fragmentos — nosnippet, data-nosnippet, max-snippet, noindex. La mecánica completa está en nuestra guía sobre cómo aparecer en Google AI Overviews.
¿Cómo verifico que un rastreador es genuino?
Nunca confíe solo en la cadena de user-agent: una de cada dieciocho peticiones que dicen ser de un rastreador de IA conocido está suplantada, según las mediciones de 2026 de HUMAN Security. Compare la IP de origen con la lista publicada por el proveedor: OpenAI, Anthropic, Apple, Common Crawl y DuckDuckGo publican listas JSON de IP, Amazon publica sus rangos en su página para desarrolladores, y Google y Apple admiten verificación por DNS inverso. Todo lo que no pase la comprobación se trata como un scraper, se llame como se llame.
¿Basta con robots.txt o también necesito llms.txt?
Hacen trabajos distintos. Robots.txt controla el acceso: quién puede obtener qué. llms.txt es una ayuda de navegación: un mapa legible por máquinas que ayuda a los modelos a encontrar e interpretar sus páginas clave una vez dentro. Primero el acceso: un llms.txt detrás de un Disallow general no ayuda a nadie. llms.txt tiene su propia guía en esta serie.
Guías relacionadas
Fuentes
- 01Nuestra guía: ¿Cómo aparecer en Google AI Overviews?
- 02Nuestra guía: ¿Cómo hacemos GEO en nuestro propio sitio en la práctica?
- 03OpenAI — documentación de bots: GPTBot, OAI-SearchBot, ChatGPT-User
- 04Anthropic — documentación de rastreadores: ClaudeBot, Claude-SearchBot, Claude-User
- 05Perplexity — documentación de rastreadores: PerplexityBot, Perplexity-User
- 06Google — rastreadores comunes y Google-Extended
- 07Google — funciones de IA en la Búsqueda y controles para propietarios de sitios
- 08Apple — Applebot y Applebot-Extended
- 09Meta — rastreadores web: Meta-ExternalAgent, Meta-ExternalFetcher
- 10Common Crawl — documentación de CCBot
- 11Amazon — documentación de Amazonbot
- 12DuckDuckGo — documentación de DuckAssistBot
- 13Cloudflare — la proporción rastreo-derivación de las plataformas de IA (julio de 2025) y AI Insights en directo
- 14Cloudflare — Bytespider lidera el tráfico y los bloqueos de bots de IA (julio de 2024)
- 15HAProxy — cerca del 90 % de nuestro tráfico de rastreadores de IA es Bytespider (octubre de 2024)
- 16HUMAN Security — 2026 State of AI traffic: referencias de suplantación de rastreadores
// compartir