Robots.txt y bots de IA: cuáles permitir para ChatGPT
Qué bots de IA dejar entrar en tu robots.txt para aparecer en ChatGPT, Perplexity y Copilot, cuáles bloquear para no entrenar modelos y el error más común.
Fundador de JustSEO, hace sitios web y SEO para empresas chilenas desde 2019
Publicado el
Revisado el
7 min de lectura

En este artículo
- ¿Qué es el robots.txt?
- ¿Qué tipos de bots de IA existen?
- ¿Qué bot de IA es de qué empresa?
- ¿Qué bots de IA permitir en tu robots.txt para aparecer y no entrenar?
- El error más común: el bloque que borra tus reglas
- ¿Y los AI Overviews de Google?
- Desde la práctica: los robots.txt de nuestros clientes
- ¿Cómo revisar tu robots.txt hoy?
- ¿Abrir el robots.txt basta para aparecer en ChatGPT?
- Preguntas frecuentes
- Fuentes
Para aparecer en ChatGPT, Perplexity y Copilot, tu robots.txt debe dejar entrar a los bots de IA que buscan: OAI-SearchBot, PerplexityBot y Bingbot. Para los AI Overviews de Google, a Googlebot. Los bots que recogen contenido para entrenar modelos, como GPTBot, Google-Extended o ClaudeBot, se pueden bloquear sin salir de esas respuestas, porque cada bot se configura por separado. El error más común no es bloquear de más: es escribir mal el archivo.
¿Qué es el robots.txt?
El robots.txt es un archivo de texto en la raíz de un sitio (tusitio.cl/robots.txt) que les dice a los rastreadores qué partes pueden visitar y cuáles no. Los bots de las empresas serias lo respetan; no es un candado, es una instrucción.
Cada bloque del archivo empieza con User-agent:, el nombre del bot, y sigue con reglas Allow (permitir) y Disallow (no permitir). El asterisco (*) vale para todos los bots que no tengan un bloque propio.
¿Qué tipos de bots de IA existen?
Tres, y confundirlos es el origen de casi todas las malas decisiones:
- Bots de búsqueda. Leen tu sitio para mostrarlo y enlazarlo en las respuestas. Si los bloqueas, no te citan.
- Bots de entrenamiento. Recogen contenido para entrenar modelos de IA. Bloquearlos no te saca de las respuestas de búsqueda.
- Visitas a pedido del usuario. Cuando alguien pega tu enlace en un chat o le pide al asistente que lea una página. Varias empresas advierten que estas visitas pueden no seguir el robots.txt.
¿Qué bot de IA es de qué empresa?
Esta es la lista de los que importan hoy, según la documentación de cada empresa, consultada el 7 de octubre de 2026:
| Empresa | User-agent | Tipo | Si lo bloqueas |
|---|---|---|---|
| OpenAI | OAI-SearchBot | Búsqueda | No apareces en las respuestas de búsqueda de ChatGPT |
| OpenAI | GPTBot | Entrenamiento | Tu contenido no se usa para entrenar sus modelos |
| OpenAI | ChatGPT-User | A pedido del usuario | Puede no aplicar: OpenAI dice que el robots.txt podría no regir |
| Perplexity | PerplexityBot | Búsqueda | No apareces enlazado en Perplexity |
| Perplexity | Perplexity-User | A pedido del usuario | Perplexity dice que en general ignora el robots.txt |
| Googlebot | Búsqueda (incluye AI Overviews y AI Mode) | Sales de Google, no solo de la IA | |
| Google-Extended | Entrenamiento y Gemini fuera de la Búsqueda | No afecta tu presencia en Google Search | |
| Microsoft | Bingbot | Búsqueda (Bing y Copilot) | Sales de Bing y de las respuestas de Copilot |
| Anthropic | Claude-SearchBot | Búsqueda | No te indexa para sus respuestas con búsqueda |
| Anthropic | ClaudeBot | Entrenamiento | Tu contenido futuro sale de su entrenamiento |
| Apple | Applebot-Extended | Uso para IA (no rastrea) | Applebot sigue rastreando; solo limitas el uso para modelos |
| Meta | meta-externalagent | Entrenamiento | Tu contenido no se usa para entrenar sus modelos |
| Common Crawl | CCBot | Archivo abierto de la web | No entras a su archivo público |
Fuentes: OpenAI, Perplexity, Google, Bing, Anthropic, Apple, Meta y Common Crawl.
Dos aclaraciones sobre la tabla. Microsoft no tiene un bot separado para Copilot: sus pautas para webmasters dicen que Bing y Copilot usan la misma base de rastreo e índice, y piden dejar pasar a Bingbot. Y OpenAI advierte que puede tomar cerca de 24 horas que sus sistemas se ajusten a un robots.txt nuevo.
¿Qué bots de IA permitir en tu robots.txt para aparecer y no entrenar?
Si quieres que te citen pero no que entrenen con tu contenido, esta es una base razonable:
User-agent: *
Allow: /
Disallow: /admin
User-agent: GPTBot
User-agent: Google-Extended
User-agent: ClaudeBot
User-agent: Applebot-Extended
User-agent: meta-externalagent
User-agent: CCBot
Disallow: /
Sitemap: https://tusitio.cl/sitemap.xml
Lo que hace: todos los bots entran a todo menos a /admin, incluidos OAI-SearchBot, PerplexityBot, Claude-SearchBot, Googlebot y Bingbot, que no tienen bloque propio y caen en el *. Los seis bots de entrenamiento quedan fuera. OpenAI lo dice sin rodeos: cada configuración es independiente, así que bloquear GPTBot no toca a OAI-SearchBot.
Si en cambio quieres estar en todas partes, incluido el entrenamiento, no necesitas nombrar a nadie: un User-agent: * con Allow: / deja pasar a todos.
El error más común: el bloque que borra tus reglas
Este es el que más vemos al revisar sitios. Alguien agrega un bloque para un bot de IA pensando que suma a las reglas generales:
User-agent: *
Disallow: /admin
Disallow: /carro
User-agent: OAI-SearchBot
Allow: /
Parece inofensivo, pero OAI-SearchBot ya no lee el bloque *. Google lo explica en su especificación: para cada bot vale un solo grupo, el del user-agent más específico, y los demás se ignoran (Google Search Central, actualizada el 31 de agosto de 2026). Resultado: OAI-SearchBot puede entrar a /admin y a /carro.
La regla práctica: si le das un bloque propio a un bot, copia ahí todas las exclusiones que quieres que respete. O mejor, no le des bloque si no lo necesitas.
¿Y los AI Overviews de Google?
Se controlan con lo mismo de siempre. Google dice que las directivas del robots.txt para Googlebot son el control para el rastreo de la Búsqueda, y que para limitar lo que se muestra de tus páginas sirven nosnippet, data-nosnippet, max-snippet o noindex (Google Search Central, consultado el 7 de octubre de 2026).
Ojo con el costo: nosnippet también quita el fragmento de tu resultado normal en Google. Y Google-Extended no sirve para esto: según su documentación, no afecta la inclusión de un sitio en la Búsqueda ni se usa como señal de ranking. En qué son los AI Overviews explicamos de dónde sacan sus fuentes.
Desde la práctica: los robots.txt de nuestros clientes
El 7 de octubre de 2026 revisamos el robots.txt público de justseo.cl y de los seis clientes que podemos nombrar. No hay una sola respuesta correcta, y se nota:
| Sitio | Bots de IA que nombra | Qué decidió |
|---|---|---|
| Aura Zapatera y Brie (tiendas en JustCommerce) | OAI-SearchBot, PerplexityBot, Claude-SearchBot | Abre los de búsqueda y repite en cada bloque las rutas que no deben rastrearse |
| Medicaltec | GPTBot, OAI-SearchBot, PerplexityBot, Google-Extended, ClaudeBot y otros | Abre también los de entrenamiento, con las mismas exclusiones de filtros y paso de pago |
| Dentistas por Chile | GPTBot, OAI-SearchBot, Google-Extended, ClaudeBot, PerplexityBot | Abre todo menos el panel de administración |
| Casmara Chile, Calculadoras.cl y justseo.cl | Ninguno | Todos los bots entran por el bloque * |
Dos cosas que muestra esa tabla. Primero, las tiendas que nombran bots repiten las exclusiones dentro de cada bloque, justo para evitar el error de la sección anterior. Segundo, abrir o cerrar el entrenamiento es una decisión de negocio, no técnica: una clínica con 284 artículos de blog puede preferir que su contenido esté en todas partes, y otra empresa puede preferir lo contrario.
Lo que no hemos visto nunca funcionar es bloquear "todo lo que suene a IA" con un plugin o una plantilla, y descubrir meses después que también se fue OAI-SearchBot.
¿Cómo revisar tu robots.txt hoy?
-
Ábrelo en
tusitio.cl/robots.txt. Si no existe, todos los bots pueden entrar. -
Busca un
Disallow: /bajoUser-agent: *. Si está, estás bloqueando a todos, incluido Google. -
Busca los nombres de la tabla. Revisa que ningún bot de búsqueda tenga
Disallow: /. -
Si un bot tiene bloque propio, confirma que ese bloque repite tus exclusiones.
-
Revisa tu CDN o firewall. Servicios como Cloudflare tienen un ajuste para bloquear bots de IA (documentación de Cloudflare, actualizada el 1 de julio de 2026) que actúa aunque tu robots.txt los permita.
-
Mira el informe de robots.txt de Search Console para ver si Google leyó la última versión. La rutina está en Google Search Console para pymes.
El resto de lo técnico (sitemap, canónicas, redirecciones) está en el checklist de SEO técnico. Y si te ofrecen un llms.txt como alternativa al robots.txt, lee antes qué es y qué dice Google del llms.txt.
¿Abrir el robots.txt basta para aparecer en ChatGPT?
No. Es la condición de entrada, no la razón por la que te citan. Un bot que puede entrar a una página que no responde nada concreto tampoco la va a usar. Lo que viene después (respuestas claras, datos con fuente, autor visible y menciones en otros sitios) está en la guía de cómo aparecer en ChatGPT, Perplexity y los AI Overviews, y cómo funciona cada motor, en la de buscadores con inteligencia artificial.
Preguntas frecuentes
¿Qué bot debo permitir en el robots.txt para aparecer en ChatGPT?
OAI-SearchBot. Es el bot de búsqueda de OpenAI y su documentación dice que los sitios que lo bloquean no aparecen en las respuestas de búsqueda de ChatGPT, salvo como enlace de navegación. GPTBot es otro bot, de entrenamiento: puedes bloquearlo y seguir apareciendo. Los cambios en el robots.txt tardan cerca de 24 horas en aplicarse según OpenAI.
¿Bloquear Google-Extended me saca de los AI Overviews?
No. Google dice que Google-Extended no afecta la inclusión de un sitio en la Búsqueda ni es una señal de ranking; controla el uso del contenido para entrenar y respaldar respuestas de Gemini fuera de la Búsqueda. Los AI Overviews y AI Mode se alimentan del índice normal: el control es el robots.txt de Googlebot y las etiquetas nosnippet, max-snippet o noindex.
¿El robots.txt impide que una IA lea mi sitio?
No del todo. El robots.txt es una instrucción que los bots serios respetan, no un candado. Además, OpenAI, Perplexity y Meta advierten que sus visitas iniciadas por un usuario, como cuando alguien pega tu enlace en el chat, pueden no seguir el robots.txt. Si una página no debe ser pública, protégela con contraseña, no con robots.txt.
¿Cuánto tarda en aplicarse un cambio en el robots.txt para los bots de IA?
Depende de cada empresa. OpenAI y Perplexity indican que sus sistemas tardan hasta unas 24 horas en ajustarse a un robots.txt nuevo. Google lee el archivo con frecuencia y lo guarda en caché por un tiempo. Por eso, después de un cambio, conviene esperar uno o dos días antes de concluir si funcionó.
Fuentes
- OpenAI: Overview of OpenAI Crawlers (OAI-SearchBot, GPTBot, ChatGPT-User) (se abre en otra pestaña)
- Perplexity: Perplexity Crawlers (PerplexityBot y Perplexity-User) (se abre en otra pestaña)
- Google Search Central: rastreadores comunes de Google, Google-Extended (actualizada el 14 de julio de 2026) (se abre en otra pestaña)
- Google Search Central: funciones de IA y tu sitio web (se abre en otra pestaña)
- Google Search Central: cómo interpreta Google la especificación de robots.txt (actualizada el 31 de agosto de 2026) (se abre en otra pestaña)
- Bing Webmaster Guidelines (Bing y Copilot) (se abre en otra pestaña)
- Anthropic: rastreadores ClaudeBot, Claude-SearchBot y Claude-User (se abre en otra pestaña)
- Apple: About Applebot (publicada el 4 de septiembre de 2026) (se abre en otra pestaña)
- Meta: rastreadores web de Meta (se abre en otra pestaña)
- Common Crawl: CCBot (se abre en otra pestaña)
Escrito por
Yamil Alfonzo
Fundador de JustSEO, hace sitios web y SEO para empresas chilenas desde 2019
Ver perfil en LinkedIn

