¿Quién bloquea los rastreadores de IA?
Comprobamos si robots.txt prohíbe a 15 rastreadores de IA el acceso a la página de inicio, agrupados por finalidad: 8 rastreadores de entrenamiento (recopilan páginas para entrenar modelos), 4 rastreadores de búsqueda con IA (construyen un índice del que un asistente puede citar) y 3 agentes a petición del usuario (cargan una página porque alguien se la ha pedido a un asistente). Dos de las entradas de entrenamiento, Google-Extended y Applebot-Extended, son tokens de control y no rastreadores. La guía sobre rastreadores de IA y robots.txt explica la diferencia.
Mostrar los datos en una tabla
| Comprobación | Sitios | De un total de | Porcentaje (%) |
|---|---|---|---|
| Bloquea al menos un rastreador de IA | 18 | 90 | 20 |
| Bloquea un rastreador de entrenamiento | 18 | 90 | 20 |
| Bloquea un rastreador de búsqueda con IA | 14 | 90 | 16 |
| Bloquea un agente a petición del usuario | 11 | 90 | 12 |
| Bloquea todos los rastreadores de IA | 1 | 90 | 1 |
Mostrar los datos en una tabla
| Comprobación | Sitios | De un total de | Porcentaje (%) |
|---|---|---|---|
| Bytespider | 17 | 90 | 19 |
| ClaudeBot | 16 | 90 | 18 |
| CCBot | 14 | 90 | 16 |
| GPTBot | 14 | 90 | 16 |
| Applebot-Extended | 12 | 90 | 13 |
| Google-Extended | 11 | 90 | 12 |
| Amazonbot | 10 | 90 | 11 |
| meta-externalagent | 9 | 90 | 10 |
| PerplexityBot | 12 | 90 | 13 |
| DuckAssistBot | 8 | 90 | 9 |
| Claude-SearchBot | 5 | 90 | 6 |
| OAI-SearchBot | 5 | 90 | 6 |
| ChatGPT-User | 8 | 90 | 9 |
| Perplexity-User | 6 | 90 | 7 |
| Claude-User | 5 | 90 | 6 |
El porcentaje de sitios que bloquean un rastreador concreto va del 6 % (por ejemplo, OAI-SearchBot) al 19 % (Bytespider). Googlebot está bloqueado en 0 de 90 sitios.
Bloquear un rastreador de entrenamiento es una decisión legítima y no saca a una web de la búsqueda con IA. Bloquear un rastreador de búsqueda con IA puede dejar una web fuera del índice del que cita un asistente, y el 16 % de los sitios bloquea al menos uno. No medimos si alguno de estos sitios aparece en respuestas de IA.
El 2 de octubre de 2026 volvimos a descargar el robots.txt de los 18 sitios en los que habíamos detectado algún bloqueo y lo leímos con un segundo analizador, más sencillo; los rastreadores bloqueados coincidieron en 18 de 18. Los sitios en los que no habíamos detectado bloqueos no se volvieron a comprobar.
Señales de preparación más allá del acceso de los rastreadores
También buscamos estas señales de preparación: un archivo llms.txt (una propuesta de resumen en Markdown de una web; ningún buscador importante se ha comprometido a usarlo, consulta la guía de llms.txt), un sitemap declarado en robots.txt, datos estructurados schema.org y anotaciones hreflang. Ninguna de ellas garantiza que una respuesta de IA cite una web.
Mostrar los datos en una tabla
| Comprobación | Sitios | De un total de | Porcentaje (%) |
|---|---|---|---|
| Tiene un archivo llms.txt | 12 | 90 | 13 |
| Declara un sitemap en robots.txt | 70 | 84 | 83 |
| La página de inicio tiene marcado schema.org | 50 | 85 | 59 |
| La página de inicio tiene marcado Organization | 30 | 85 | 35 |
| Marcado schema.org en la mayoría de las páginas | 55 | 83 | 66 |
| Marcado FAQPage en al menos una página | 8 | 83 | 10 |
| Anotaciones de idioma (hreflang) en al menos una página | 31 | 83 | 37 |
Contamos los datos estructurados por presencia y no los validamos (consulta la guía de datos estructurados). El marcado FAQ es opcional, así que la falta de FAQPage no es un error por sí misma. La anotación hreflang solo importa en webs multilingües.
El 2 de octubre de 2026 volvimos a descargar los 12 archivos llms.txt detectados. De ellos, 12 son archivos de texto reales, no páginas de error HTML.
Lo básico de cada página, que leen buscadores e IA
Tanto los buscadores como los sistemas de IA leen elementos básicos de la página, como el título, la descripción, los encabezados y el texto alternativo de las imágenes. Los gráficos muestran en cuántos sitios hay carencias en esos elementos, con las definiciones del Informe del sitio de Sitequiry (consulta la metodología).
Mostrar los datos en una tabla
| Comprobación | Sitios | De un total de | Porcentaje (%) |
|---|---|---|---|
| Falta la meta descripción en al menos una página | 47 | 81 | 58 |
| Falta la meta descripción en la mayoría de las páginas | 15 | 81 | 19 |
| Falta el encabezado H1 en más de una página | 35 | 81 | 43 |
| Etiquetas Open Graph incompletas en al menos una página | 41 | 81 | 51 |
| Imágenes sin texto alternativo en al menos una página | 40 | 83 | 48 |
| Más de una décima parte de las imágenes sin texto alternativo | 13 | 83 | 16 |
En 83 sitios comprobamos 71.406 imágenes. 8.991 de ellas (13 %) no tienen ningún atributo alt. Un alt="" vacío es correcto en imágenes decorativas, así que no lo contamos.
Por grupo de idioma
Solo mostramos la cifra de un grupo de idioma si se basa en al menos 15 sitios; en caso contrario, la celda indica «n demasiado pequeño». Como idioma se toma el idioma principal del sitio según nuestra clasificación. La muestra incluye 36 sitios en esloveno, 26 en alemán (sobre todo de Alemania y Austria), 19 en inglés y 25 en otros idiomas (croata, italiano, francés, español, checo, neerlandés). Estas cifras incluyen los sitios que no pudieron analizarse.
Las diferencias entre grupos pueden decir más sobre qué sitios elegimos que sobre un idioma o un país, y los grupos son pequeños. Lee la tabla como una descripción, no como un ranking.
Sitios en español en la muestra
Esta muestra no incluye un grupo en español lo bastante grande para dar cifras propias: los sitios en español están dentro de «otros idiomas» (19 informes completados en total, que incluyen también sitios en croata, italiano, francés, checo y neerlandés). Por eso las cifras de este estudio corresponden a la muestra completa.
Para «otros idiomas» solo mostramos las cifras basadas en al menos 15 sitios: el 26 % bloquea al menos un rastreador de IA (5 de 19; muestra completa: 20 %) y el 5 % publica llms.txt (1 de 19; muestra completa: 13 %). Lee estas cifras como una descripción de la muestra, no como un reflejo de la web en español.
| Comprobación | Todos los sitios | Esloveno | Alemán | Inglés | Otros idiomas |
|---|---|---|---|---|---|
| Bloquea al menos un rastreador de IA | 20 % · 18/90 | 15 % · 5/33 | 30 % · 7/23 | 7 % · 1/15 | 26 % · 5/19 |
| Bloquea un rastreador de búsqueda con IA | 16 % · 14/90 | 12 % · 4/33 | 17 % · 4/23 | 7 % · 1/15 | 26 % · 5/19 |
| Tiene un archivo llms.txt | 13 % · 12/90 | 12 % · 4/33 | 17 % · 4/23 | 20 % · 3/15 | 5 % · 1/19 |
| La página de inicio tiene marcado schema.org | 59 % · 50/85 | 61 % · 20/33 | 70 % · 16/23 | n demasiado pequeño (n = 13) | 63 % · 10/16 |
| La página de inicio tiene marcado Organization | 35 % · 30/85 | 42 % · 14/33 | 39 % · 9/23 | n demasiado pequeño (n = 13) | 25 % · 4/16 |
| Falta la meta descripción en al menos una página | 58 % · 47/81 | 74 % · 23/31 | 43 % · 10/23 | n demasiado pequeño (n = 13) | n demasiado pequeño (n = 14) |
| Falta el encabezado H1 en más de una página | 43 % · 35/81 | 48 % · 15/31 | 22 % · 5/23 | n demasiado pequeño (n = 13) | n demasiado pequeño (n = 14) |
| Etiquetas Open Graph incompletas en al menos una página | 51 % · 41/81 | 48 % · 15/31 | 57 % · 13/23 | n demasiado pequeño (n = 13) | n demasiado pequeño (n = 14) |
| Imágenes sin texto alternativo en al menos una página | 48 % · 40/83 | 56 % · 18/32 | 43 % · 10/23 | n demasiado pequeño (n = 14) | n demasiado pequeño (n = 14) |
Metodología
Es una muestra por conveniencia, no aleatoria. Elegimos nosotros 106 webs públicas conocidas para cubrir distintos tipos e idiomas: 31 tiendas y marketplaces, 22 sitios de noticias y revistas, 25 organismos públicos y sitios de salud y educación, 15 empresas, SaaS y agencias, 8 sitios de turismo y hostelería y 5 organizaciones sin ánimo de lucro. De estos sitios, se sabe que 10 usan protección contra bots.
- Rastreo. El 29 de septiembre de 2026, SitequiryBot, el rastreador del Informe del sitio de Sitequiry, leyó cada web: la página de inicio y otras páginas, hasta un máximo de 20 en total, elegidas a partir del sitemap y de la navegación principal. Esas páginas no son una muestra aleatoria de una web. El rastreador respeta robots.txt y hace pausas entre peticiones. Software: Informe del sitio, revisión 98996b7.
- Informes completados. Completamos 90 de 106 informes. Dejamos fuera 13 sitios que bloquearon la primera petición (por ejemplo, con HTTP 403 o 429) y 3 que redirigieron a otro dominio.
- Bloqueo de rastreadores de IA. Contamos un rastreador como bloqueado cuando robots.txt le prohíbe la página de inicio («/»), ya sea en un grupo que lo nombra o en el grupo «*» si el rastreador no tiene grupo propio. La coincidencia sigue el RFC 9309. Un robots.txt ausente o ilegible cuenta como «sin reglas», y las reglas para secciones de un sitio no se cuentan.
- Páginas. Las cifras a nivel de página describen un sitio solo cuando pudieron analizarse al menos 5 de sus páginas. De los informes completados, 7 tenían menos páginas analizables, debido a páginas que se generan en el navegador y no tienen contenido en el HTML, a la protección contra bots tras la primera petición o a que había muy poco contenido rastreable. Una URL que redirige a otra página no se cuenta dos veces. Evaluamos título, descripción, H1 y Open Graph solo en páginas indexables (sin noindex y con una URL canónica que apunta a la propia página). No evaluamos el marcado ni los encabezados de las páginas cuyo HTML no tiene contenido porque lo genera un script.
- Imágenes. Una imagen cuenta como sin texto alternativo solo si su elemento img no tiene ningún atributo alt. Ignoramos los píxeles de seguimiento y las imágenes ocultas.
- Porcentajes. Cada porcentaje es el número de sitios con la característica dividido entre el número de sitios de la población indicada en el conjunto de datos. El conjunto de datos recoge ambos números para cada cifra.
Límites de este estudio
- No es representativo. Elegimos los sitios nosotros, sobre todo organizaciones conocidas. El estudio dice poco sobre las webs de pequeñas empresas.
- Los sitios que bloquearon nuestra petición no están en las cifras, así que los resultados se inclinan hacia sitios que permiten comprobaciones automáticas.
- robots.txt es una petición, no una imposición. Un sitio también puede bloquear rastreadores con un cortafuegos o una CDN y servir reglas distintas a rastreadores distintos. Leímos robots.txt como SitequiryBot.
- Señales de preparación, no visibilidad. No medimos si un sitio es citado o mostrado en respuestas de IA, y la presencia de llms.txt o de marcado no prueba ningún efecto.
- Un solo rastreo desde una ubicación el 29 de septiembre de 2026. Los sitios cambian, y leímos hasta 20 páginas por sitio.
- Grupos pequeños. Los grupos de idioma son pequeños y un solo sitio mueve un porcentaje varios puntos.
- Sin afirmaciones causales. Los datos muestran lo que hacen los sitios, no por qué.
Lo que este estudio no mide
Cada punto siguiente queda fuera por el motivo indicado.
- Velocidad de carga. Google PageSpeed no se ejecutó para esta muestra, así que no hay Core Web Vitals, ni distribución de puntuaciones móviles, ni cifras de recursos que bloquean el renderizado o de peso de página.
- Tiempo de respuesta del servidor. Se registró solo para peticiones sueltas desde una ubicación; no es una medición de velocidad.
- Redirecciones a HTTPS y cabeceras de seguridad. El rastreo no las registró.
- Visibilidad en respuestas de IA. Solo se miden señales de preparación.
- Validez de los datos estructurados. Se cuentan por presencia.
- Calidad de los archivos llms.txt. Se cuentan por presencia.
- Puntuaciones de Sitequiry. Las puntuaciones de SEO, AEO, GEO y la global son nuestro propio sistema de puntuación ponderado, no una medición independiente.
- Resultados por sitio. Solo se publican datos agregados.
- Segmentos por tipo de sitio o por país. Cada uno tendría menos de 15 sitios.
Cita este estudio y descarga los datos
Puedes citar las cifras y reutilizar los gráficos con atribución. Los datos agregados se publican con la licencia Creative Commons Atribución (CC BY 4.0): puedes compartirlos y adaptarlos, también con fines comerciales, si citas a GE-KO / Sitequiry y enlazas esta página.
GE-KO / Sitequiry (2026). ¿Están las webs listas para la búsqueda con IA? Un análisis de las señales de preparación de 90 webs públicas. Publicado el 2 de octubre de 2026. https://sitequiry.com/es/estudios/preparacion-busqueda-ia-2026
Versión 1.0, con licencia CC BY 4.0. Los nombres de columna y las etiquetas de los archivos están en inglés.
Resumen para prensa y boletines
Sitequiry, la herramienta gratuita de análisis web de la agencia eslovena GE-KO, analizó 90 webs públicas conocidas mediante un rastreo realizado el 29 de septiembre de 2026. El 20 % bloquea al menos un rastreador de IA en robots.txt, el 13 % publica un archivo llms.txt y el 59 % de las páginas de inicio incluye marcado schema.org. Los autores eligieron los sitios, que no son representativos de la web en su conjunto, y el estudio mide señales de preparación, no la visibilidad en respuestas de IA.
Qué hacer a continuación
- Decide de forma deliberada qué rastreadores de IA permites y revisa también tu cortafuegos y tu CDN: rastreadores de IA y robots.txt.
- Añade un llms.txt solo si te cuesta poco mantenerlo actualizado: llms.txt: qué es y si realmente merece la pena.
- Describe quién eres y de qué trata cada página con un marcado preciso: guía de datos estructurados.
- Comprueba tu propia web con estas señales: análisis gratuito, una URL, resultado completo, sin cuenta.
- ¿Quieres que hagamos las correcciones? GE-KO las implementa.
Preguntas frecuentes
¿Cuántas webs bloquean GPTBot?
En nuestra muestra, 14 de 90 sitios (16 %) bloquean GPTBot, el rastreador de entrenamiento de OpenAI, en robots.txt. ClaudeBot lo bloquea el 18 % de los sitios, PerplexityBot el 13 % y Google-Extended el 12 %. La búsqueda de ChatGPT usa otro rastreador, OAI-SearchBot, que bloquea el 6 %.
¿Qué es llms.txt y cuántos sitios lo tienen?
llms.txt es una propuesta de archivo Markdown, ubicado en la raíz de una web, que resume el sitio para los modelos de lenguaje. 12 de 90 sitios (13 %) publican uno. No es un estándar web y ningún buscador importante se ha comprometido a usarlo; consulta la guía de llms.txt.
¿Cuántas webs usan datos estructurados?
En nuestra muestra, el 59 % de las páginas de inicio incluye marcado schema.org (JSON-LD, microdatos o RDFa) y el 78 % de los sitios lo tiene en al menos una página analizada. Contamos la presencia, no la validez. Consulta la guía de datos estructurados.
¿Bloquear los rastreadores de IA deja una web fuera de las respuestas de IA?
Depende del rastreador que se bloquee. Bloquear un rastreador de entrenamiento no saca a una web de la búsqueda con IA, mientras que bloquear un rastreador de búsqueda con IA puede dejarla fuera del índice del que cita un asistente. Este estudio no puede mostrar el efecto, porque lee reglas de robots.txt, no respuestas de IA. Consulta la guía sobre rastreadores de IA y robots.txt.
¿Hasta qué punto son fiables estas cifras?
Las cifras son exactas para los 90 sitios que analizamos el 29 de septiembre de 2026, pero no describen la web en su conjunto. Elegimos los sitios nosotros, 16 sitios no pudieron analizarse y los grupos de idioma son pequeños. La metodología y los límites están más arriba, y los datos agregados son abiertos con licencia CC BY 4.0.
Comprueba tu propia web en unos dos minutos
El análisis gratuito lee tu robots.txt, tu llms.txt y tus datos estructurados y muestra qué corregir primero.