Comprueba qué rastreadores de IA pueden acceder a tu web
Escribe tu dominio y comprueba qué rastreadores de IA permite o bloquea tu robots.txt, entre ellos GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended. Los rastreadores de búsqueda deciden si tus páginas pueden usarse en las respuestas de IA; los de entrenamiento solo deciden si tu contenido puede usarse para entrenar modelos. Cada resultado muestra la línea del robots.txt que determina el veredicto y un fragmento que puedes copiar para cambiarlo.
¿Qué rastreadores de IA existen y qué ocurre al bloquear cada tipo?
Las empresas de IA usan rastreadores distintos para tareas distintas, y cada uno tiene su propio nombre en robots.txt. El error más habitual es bloquear el equivocado: puede dejar tus páginas fuera de las respuestas de IA o no tener ningún efecto.
Los rastreadores de búsqueda construyen el índice de las respuestas
OAI-SearchBot (búsqueda de ChatGPT), Claude-SearchBot, PerplexityBot, DuckAssistBot y Amzn-SearchBot encuentran páginas para mostrar y enlazar en la búsqueda con IA. Googlebot y Bingbot construyen los índices de Google y Bing en los que se apoyan AI Overviews y AI Mode de Google y las respuestas de IA de Microsoft. Bloquear un rastreador de búsqueda hace poco probable que tus páginas aparezcan en ese producto.
Los agentes a petición del usuario leen una página cuando se les pide
ChatGPT-User, Claude-User, Perplexity-User, meta-externalfetcher y Amzn-User cargan una página porque alguien se la ha pedido a un asistente. Anthropic documenta que Claude-User sigue robots.txt; OpenAI, Perplexity, Meta y Amazon indican que los suyos pueden no hacerlo.
Los rastreadores de entrenamiento alimentan modelos futuros
GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, meta-externalagent, Amazonbot, CCBot y Bytespider recopilan páginas públicas para entrenar modelos o controlan si pueden usarse para ello. Bloquearlos es una decisión de negocio, no un requisito de SEO, y no te saca de la búsqueda con IA. Google-Extended y Applebot-Extended son tokens de control que no rastrean.
Cómo solucionarlo: un robots.txt para copiar
Elige lo que quieres, copia el resultado y añádelo al robots.txt de la raíz de tu web. Conserva tus reglas actuales y, si ya existe un grupo para el mismo bot, edítalo en lugar de añadir un segundo.
# Rastreadores de búsqueda con IA: permitidos
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: DuckAssistBot
User-agent: Amzn-SearchBot
Allow: /
# Agentes a petición del usuario: permitidos
User-agent: ChatGPT-User
User-agent: Claude-User
User-agent: Perplexity-User
User-agent: meta-externalfetcher
User-agent: Amzn-User
Allow: /
- Si una regla «User-agent: *» lo bloquea todo, los grupos permitidos siguen dejando entrar a estos bots. Googlebot y Bingbot siguen sujetos a tus reglas habituales.
- Un bot con su propio grupo ignora por completo el grupo «User-agent: *», así que copia en ese grupo las reglas de rutas (por ejemplo, Disallow: /wp-admin/) si deben seguir aplicándose al bot.
- Los rastreadores solo vuelven a leer el robots.txt de vez en cuando, así que un cambio puede tardar un día o más en aplicarse. Bloquear el entrenamiento no te saca de la búsqueda con IA, pero bloquear los rastreadores de búsqueda reduce la probabilidad de que tus páginas se usen en respuestas de IA.
- Si un bot está permitido aquí pero nunca parece visitarte, revisa los ajustes de bots de tu CDN, del cortafuegos del hosting y de tus plugins de seguridad: algunos bloquean los rastreadores de IA por defecto.
Los rastreadores que comprobamos
El comprobador cubre 21 rastreadores de empresas de IA y de búsqueda. Las funciones y el comportamiento respecto a robots.txt siguen la documentación de cada proveedor, revisada por última vez el 2 de octubre de 2026.
| Rastreador (nombre en robots.txt) | Proveedor | Función | ¿Sigue robots.txt? | Documentación del proveedor |
|---|---|---|---|---|
Googlebot |
Índice de búsqueda | Sí, según el proveedor | Documentación | |
Bingbot |
Microsoft | Índice de búsqueda | Sí, según el proveedor | Documentación |
Applebot |
Apple | Índice de búsqueda | Sí, según el proveedor | Documentación |
OAI-SearchBot |
OpenAI | Índice de búsqueda | Sí, según el proveedor | Documentación |
Claude-SearchBot |
Anthropic | Índice de búsqueda | Sí, según el proveedor | Documentación |
PerplexityBot |
Perplexity | Índice de búsqueda | Sí, según el proveedor | Documentación |
DuckAssistBot |
DuckDuckGo | Índice de búsqueda | Sí, según el proveedor | Documentación |
Amzn-SearchBot |
Amazon | Índice de búsqueda | Sí, según el proveedor | Documentación |
ChatGPT-User |
OpenAI | Agente a petición del usuario | Puede ignorarlo (a petición del usuario) | Documentación |
Claude-User |
Anthropic | Agente a petición del usuario | Sí, según el proveedor | Documentación |
Perplexity-User |
Perplexity | Agente a petición del usuario | Puede ignorarlo (a petición del usuario) | Documentación |
meta-externalfetcher |
Meta | Agente a petición del usuario | Puede ignorarlo (a petición del usuario) | Documentación |
Amzn-User |
Amazon | Agente a petición del usuario | Puede ignorarlo (a petición del usuario) | Documentación |
GPTBot |
OpenAI | Entrenamiento de modelos | Sí, según el proveedor | Documentación |
ClaudeBot |
Anthropic | Entrenamiento de modelos | Sí, según el proveedor | Documentación |
Google-Extended |
Entrenamiento de modelos | Sí, según el proveedor | Documentación | |
Applebot-Extended |
Apple | Entrenamiento de modelos | Sí, según el proveedor | Documentación |
meta-externalagent |
Meta | Entrenamiento de modelos | Sí, según el proveedor | Documentación |
Amazonbot |
Amazon | Entrenamiento de modelos | Sí, según el proveedor | Documentación |
CCBot |
Common Crawl | Entrenamiento de modelos | Sí, según el proveedor | Documentación |
Bytespider |
ByteDance | Entrenamiento de modelos | Cuestionado | No publicada |
Qué puede decirte esta comprobación y qué no
- Lee las reglas del robots.txt tal como las recibió nuestro comprobador. Una web puede mostrar archivos distintos a visitantes distintos, y un cortafuegos o una CDN pueden bloquear a un rastreador antes de que lea el robots.txt.
- robots.txt es una petición, no una imposición. Los rastreadores fiables lo siguen; los agentes a petición del usuario pueden no hacerlo, y se informa de que algunos rastreadores lo ignoran.
- No medimos si algún producto de IA rastrea, cita o muestra realmente tu web. Permitido significa preparación, no visibilidad.
- Las funciones y las reglas siguen la documentación de cada proveedor, revisada por última vez el 2 de octubre de 2026. Los proveedores añaden rastreadores y les cambian el nombre, así que revisa tu archivo al menos dos veces al año.
Preguntas sobre rastreadores de IA y robots.txt
¿Debería bloquear GPTBot?
Depende de si quieres que OpenAI use tus páginas públicas para entrenar modelos. GPTBot es el rastreador de entrenamiento de OpenAI y bloquearlo excluye tus páginas del entrenamiento de futuros modelos. Es una decisión de negocio, no un requisito de SEO, y no afecta a tu posicionamiento en Google. Si te parece bien que tu contenido ayude a los modelos a conocer tu marca, puedes dejarlo permitido.
¿Bloquear GPTBot me saca de la búsqueda de ChatGPT?
No. La búsqueda de ChatGPT usa otro rastreador, OAI-SearchBot, y las páginas que un usuario le pide abrir a ChatGPT las descarga ChatGPT-User. Bloquear GPTBot solo afecta al entrenamiento. Bloquear OAI-SearchBot es lo que hace poco probable que tus páginas aparezcan en los resultados de la búsqueda de ChatGPT.
¿Qué diferencia hay entre GPTBot y OAI-SearchBot?
GPTBot recopila páginas públicas que pueden usarse para entrenar los modelos generativos de OpenAI. OAI-SearchBot encuentra páginas para mostrar y enlazar en las funciones de búsqueda de ChatGPT. Son nombres distintos en robots.txt, así que puedes permitir uno y bloquear el otro.
¿Qué rastreadores debo permitir para aparecer en las respuestas de IA?
Permite los rastreadores de búsqueda: OAI-SearchBot, Claude-SearchBot, PerplexityBot y DuckAssistBot, además de Googlebot y Bingbot, que construyen los índices en los que se apoyan las respuestas de IA de Google y Microsoft. Permitirlos deja tus páginas en condiciones de aparecer, pero no lo garantiza: robots.txt solo decide si un bot puede rastrear, no si alguien te cita.
¿Basta con robots.txt para mantener fuera a los rastreadores de IA?
No. Es una petición que siguen los rastreadores fiables, no una imposición. Los agentes a petición del usuario pueden ignorarla, y se informa de que algunos rastreadores también lo hacen. Para bloquear un bot con más fiabilidad, usa una regla en el cortafuegos o en la CDN. Recuerda que bloquear un rastreador de búsqueda también te deja fuera de ese producto.
¿Bloquear Google-Extended me saca de AI Overviews de Google?
No. Google-Extended es un token de control para el entrenamiento y el grounding de Gemini. AI Overviews y AI Mode usan el índice normal de Google Search que rastrea Googlebot, y Google indica que Google-Extended no afecta a la inclusión en Google Search ni al posicionamiento. Para limitar cómo aparece tu contenido ahí, usa controles de fragmento como nosnippet o max-snippet, que también afectan a los fragmentos normales.
¿Quieres ver el panorama completo?
El análisis gratuito revisa robots.txt junto con los datos estructurados, la velocidad de carga, el SEO y la citabilidad en buscadores generativos. Si quieres que alguien corrija lo que encuentre, GE-KO crea y optimiza webs.