Cómo controlar qué inteligencia artificial puede leer tu web (GPTBot, ClaudeBot, PerplexityBot y más)

Guía práctica sobre robots.txt y los bots de IA (GPTBot, ClaudeBot, PerplexityBot, Google-Extended): qué son, cómo bloquearlos o permitirlos y qué conviene para tu estrategia de GEO.

Hasta hace poco, cuando hablábamos de «bots» que visitan una web, pensábamos casi exclusivamente en Googlebot: el rastreador que recorre internet para armar el índice de Google.

Hoy la situación cambió. Además de Googlebot, existe un grupo cada vez más grande de bots de inteligencia artificial: programas que recorren tu web para entrenar modelos de IA, o para buscar información en tiempo real cuando alguien le hace una pregunta a ChatGPT, Claude o Perplexity.

Si tu contenido no es accesible para estos bots, es más difícil que aparezcas mencionado en una respuesta generada por IA. Y si no sabés qué bots existen, no podés decidir con criterio a cuáles dejar entrar y a cuáles no.

En esta guía vamos a explicar, en un lenguaje simple, qué es el archivo robots.txt, cuáles son los principales bots de IA que existen hoy y cómo configurarlos según tu estrategia de SEO, AEO y GEO.

¿Qué es el archivo robots.txt?

El robots.txt es un archivo de texto muy simple que vive en la raíz de tu sitio web (por ejemplo, tusitio.com/robots.txt).

Sirve para darles instrucciones a los rastreadores (bots) sobre qué partes de tu web pueden recorrer y cuáles no.

Es importante entender algo desde el principio: el robots.txt es una solicitud, no una barrera de seguridad. Los bots «serios» (Google, OpenAI, Anthropic, Perplexity, etc.) lo respetan porque forma parte de las buenas prácticas de internet, pero no impide técnicamente que alguien acceda a tu contenido si decide ignorarlo.

¿Por qué ahora hay tantos bots distintos?

Cada empresa de inteligencia artificial necesita «alimentar» sus sistemas de dos maneras distintas:

  • Entrenamiento: recorren millones de páginas para entrenar el modelo con datos generales.
  • Respuesta en tiempo real: cuando una persona le hace una pregunta al asistente, el sistema puede salir a buscar información actualizada en ese momento, similar a como lo hace un buscador.

Por eso, es habitual que una misma empresa tenga más de un bot: uno para entrenar el modelo y otro distinto para buscar y citar fuentes cuando alguien pregunta algo.

Esta diferencia es clave para tu estrategia de GEO: quizás no querés que tu contenido se use para entrenar un modelo, pero sí querés que ese mismo modelo pueda leer tu página y citarte cuando alguien pregunta algo relacionado con tu negocio.

Los principales bots de IA que tenés que conocer

Esta es una lista con los bots más relevantes hoy en día, para qué se usa cada uno y de qué empresa es:

  • GPTBot (OpenAI): recorre contenido para entrenar los modelos de OpenAI.
  • OAI-SearchBot (OpenAI): es el que permite que ChatGPT busque y cite fuentes cuando responde preguntas en tiempo real.
  • ChatGPT-User (OpenAI): se activa cuando una persona le pide a ChatGPT que abra o lea una página puntual.
  • ClaudeBot (Anthropic): recorre contenido para entrenar los modelos de Claude.
  • Claude-User y Claude-SearchBot (Anthropic): permiten que Claude busque y lea páginas en tiempo real cuando responde.
  • PerplexityBot (Perplexity): es el que le permite a Perplexity buscar y citar fuentes en sus respuestas.
  • Google-Extended (Google): controla si tu contenido se puede usar para entrenar los modelos de IA de Google (Gemini, funciones de IA en Search), separado de Googlebot, que sigue siendo el rastreador normal de búsqueda.
  • Applebot-Extended (Apple): controla el uso de tu contenido para entrenar Apple Intelligence.
  • CCBot (Common Crawl): un rastreador que arma una base de datos pública usada por muchos modelos de IA distintos.
  • Amazonbot (Amazon): asociado a Alexa y a los sistemas de IA de Amazon.

Esta lista cambia con frecuencia, porque cada empresa va agregando o renombrando bots a medida que lanza nuevos productos. Conviene revisarla cada tanto.

Cómo bloquear o permitir un bot específico

La estructura del robots.txt es muy simple. Cada bloque tiene un User-agent (el nombre del bot) seguido de una regla de Allow (permitir) o Disallow (bloquear).

Por ejemplo, si quisieras bloquear específicamente a GPTBot en todo tu sitio, el código sería:

User-agent: GPTBot
Disallow: /

Si en cambio quisieras permitirle el acceso completo a un bot, por ejemplo a OAI-SearchBot (que es el que ayuda a que ChatGPT te cite como fuente), el código sería:

User-agent: OAI-SearchBot
Allow: /

Podés combinar varias reglas, una para cada bot, dentro del mismo archivo robots.txt.

¿Conviene bloquear todos los bots de IA?

No hay una respuesta única, depende de tu objetivo.

Si tu prioridad es proteger tu contenido para que no se use como material de entrenamiento sin tu consentimiento, tiene sentido bloquear los bots de entrenamiento (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot).

Si en cambio tu prioridad es ganar visibilidad dentro de las respuestas de IA (que es el objetivo del GEO), conviene dejar pasar a los bots que se usan para buscar y citar en tiempo real (OAI-SearchBot, PerplexityBot, Claude-SearchBot), incluso si bloqueás los de entrenamiento.

Muchas marcas están optando por un punto intermedio: bloquear el entrenamiento, pero permitir la búsqueda y la cita en tiempo real. De esa forma cuidan su contenido y, al mismo tiempo, siguen apareciendo como fuente en las respuestas generadas por IA.

Cómo saber qué bots están visitando tu sitio

Podés revisar los logs del servidor (el registro de accesos de tu hosting) para ver qué user-agents están entrando a tu web y con qué frecuencia. La mayoría de los paneles de hosting permiten exportar o filtrar esta información.

También existen herramientas específicas que analizan estos accesos y te muestran, de forma más visual, qué bots de IA visitaron tu sitio en los últimos días.

Un ejemplo de robots.txt pensado para GEO

Un enfoque posible, pensado para proteger el contenido de entrenamiento pero mantener la visibilidad en respuestas de IA, podría verse así:


User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

Este es solo un ejemplo de referencia. Lo ideal es revisarlo según tu propia estrategia y, si tenés dudas, consultarlo con quien administre tu sitio antes de modificar el robots.txt, porque un error en este archivo puede afectar también a los buscadores tradicionales.

Preguntas frecuentes sobre bots de IA y robots.txt

¿Bloquear estos bots afecta mi posicionamiento en Google?

No necesariamente. Googlebot (el rastreador de búsqueda tradicional) es distinto de Google-Extended (el que se usa para entrenar IA). Podés bloquear Google-Extended sin afectar tu aparición en los resultados normales de Google.

¿Es obligatorio tener reglas para bots de IA en el robots.txt?

No es obligatorio. Si no agregás ninguna regla específica, por defecto muchos de estos bots pueden acceder a tu contenido igual que lo haría cualquier otro rastreador.

¿Bloquear un bot garantiza que mi contenido nunca se use para entrenar IA?

No de forma absoluta. El robots.txt depende de que el bot decida respetarlo. Las empresas más conocidas (OpenAI, Anthropic, Google, Perplexity) declaran públicamente que lo respetan, pero no existe una garantía técnica al cien por ciento.

¿Cómo elijo qué bots permitir si tengo un negocio local?

Si tu objetivo es aparecer cuando alguien pregunta por tu negocio en una IA, priorizá permitir los bots de búsqueda y cita en tiempo real. Podés profundizar en esto en nuestra guía sobre SEO para inteligencia artificial: cómo aparecer en ChatGPT, Google AI Overviews y los nuevos buscadores de IA. Si tenés un negocio con ubicación física o área de servicio, sumá también nuestra guía de GEO local.

Para resumir

El robots.txt dejó de ser un archivo pensado solamente para Google. Hoy es una herramienta clave dentro de cualquier estrategia de SEO, AEO y GEO, porque te permite decidir qué inteligencias artificiales pueden leer tu contenido, y con qué propósito.

No se trata de bloquear todo por precaución, ni de dejar todo abierto sin revisar nada. Se trata de tomar una decisión informada: proteger lo que querés proteger, y dejar pasar a los bots que te pueden ayudar a que tu marca aparezca en las respuestas que la gente recibe de la inteligencia artificial todos los días. Otro paso técnico que conviene sumar es el schema markup para AEO y GEO.

Pablo Pena
Pablo Pena

Publisher Digital especializado en contenidos, SEO, Relaciones Públicas Online y comunicación estratégica.

Artículos: 482