Saltar al contenido
Sitequiry

Rastreadores de IA y robots.txt: GPTBot, OAI-SearchBot y más

Bloquear los «bots de IA» con una sola línea puede sacar tu web, sin que te des cuenta, de las respuestas de ChatGPT Search, Claude o Perplexity. Las grandes empresas de IA usan ya rastreadores distintos para entrenar modelos, para su índice de búsqueda y para descargar una página cuando un usuario pregunta por ella, de modo que puedes decidir con precisión en lugar de elegir entre todo o nada.

Actualizado 3 min de lectura Escrito por el equipo de GE-KO

Tres tipos de rastreadores de IA

Los rastreadores de entrenamiento recopilan páginas públicas para entrenar futuros modelos. Bloquearlos no te elimina de los resultados de búsqueda con IA.

Los rastreadores de búsqueda y recuperación construyen el índice que un asistente usa para encontrar y citar fuentes. Bloquearlos es lo que te hace invisible en las respuestas de IA.

Los agentes a petición del usuario cargan una sola página porque una persona ha pedido al asistente que la lea. Los proveedores los tratan de forma distinta al rastreo automático, y algunos indican que las reglas de robots.txt pueden no aplicarse a ellos.

Los nombres de user-agent que importan

  • OpenAI: GPTBot (entrenamiento), OAI-SearchBot (ChatGPT Search), ChatGPT-User (peticiones de usuarios).
  • Anthropic: ClaudeBot (entrenamiento), Claude-SearchBot (búsqueda), Claude-User (peticiones de usuarios).
  • Perplexity: PerplexityBot (índice de búsqueda), Perplexity-User (peticiones de usuarios).
  • Google: Google-Extended es un token de control, no un rastreador aparte. Decide si el contenido descargado por Googlebot puede usarse para los modelos de Gemini y para el grounding. No afecta a Google Search, a AI Overviews ni a AI Mode.
  • Apple: Applebot-Extended controla el uso para el entrenamiento de IA de Apple; Applebot en sí alimenta Siri y Spotlight.
  • Otros que verás en los registros: CCBot (Common Crawl, muy usado para entrenamiento), meta-externalagent (Meta), Amazonbot, Bytespider (ByteDance), DuckAssistBot (DuckDuckGo).

Un robots.txt razonable como punto de partida

Para la mayoría de las webs de empresa el objetivo es que las encuentren y las citen. Una opción habitual es permitir los bots de búsqueda y los de usuario, y decidir aparte qué hacer con el entrenamiento. Este ejemplo permite la búsqueda con IA y excluye el entrenamiento:

# Search engines and AI search: allowed
User-agent: *
Allow: /

# AI training: opted out
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
Disallow: /

Sitemap: https://www.example.com/sitemap.xml

Si no te importa que tu contenido se use para entrenar modelos, lo que puede ayudar a que conozcan tu marca, basta con dejar fuera el segundo bloque. En cualquier caso, no bloquees nunca OAI-SearchBot, Claude-SearchBot ni PerplexityBot si quieres aparecer en esos asistentes.

Revisa también tu CDN y tu cortafuegos

robots.txt es solo una petición. En la práctica, el problema más frecuente es el contrario: un cortafuegos o una CDN que bloquean a los rastreadores de IA antes de que lleguen a leer robots.txt. Cloudflare, por ejemplo, empezó a bloquear por defecto los rastreadores de IA conocidos en los dominios nuevos en julio de 2025, y muchos plugins de seguridad tienen opciones parecidas.

Si tu robots.txt permite un bot pero tu web sigue sin aparecer en las respuestas de IA, revisa la configuración de bots de tu CDN, del cortafuegos del hosting y de los plugins de seguridad, y busca en los registros del servidor respuestas 403 a esos user-agents.

Qué comprueba Sitequiry

El análisis lee tu robots.txt e indica qué rastreadores de IA están permitidos o bloqueados, separando los de entrenamiento de los de búsqueda, y avisa cuando una regla general lo bloquea todo. Comprueba las reglas de acceso, no si una CDN bloquea el bot a nivel de red, porque eso solo puede verse desde los rangos de IP del propio bot.

Puedes ver el resultado para tu web con un análisis gratis. Es una de las señales técnicas que se describen en la guía de SEO para IA, y de ninguna de ellas se puede deducir que un asistente vaya a citarte.

Preguntas frecuentes

¿Bloquear GPTBot me elimina de ChatGPT?

No. GPTBot es el rastreador de entrenamiento de OpenAI. ChatGPT Search usa OAI-SearchBot, y las páginas por las que pregunta un usuario las descarga ChatGPT-User. Bloquear GPTBot no saca automáticamente tu web de ChatGPT Search.

¿Afecta Google-Extended a AI Overviews?

No. AI Overviews y AI Mode usan el índice normal de Google Search, rastreado por Googlebot. Para limitar cómo aparece tu contenido ahí, usa controles de vista previa como nosnippet o max-snippet, que también afectan a los fragmentos habituales.

¿Es robots.txt jurídicamente vinculante?

No. Es una convención ampliamente respetada. Las grandes empresas de IA documentan que sus rastreadores la siguen, pero no impide técnicamente el acceso.

¿Cada cuánto debería revisarlo?

Al menos dos veces al año. Aparecen rastreadores nuevos con regularidad y los proveedores cambian el nombre de los existentes o los dividen.

Comprueba tu web en aproximadamente un minuto

El análisis gratuito mide en tu URL los puntos de esta guía y muestra qué corregir primero.