Saltar al contenido
Sitequiry
Estudio de datos · 2026

¿Están las webs listas para la búsqueda con IA?

Un análisis de las señales de preparación de 90 webs públicas conocidas, rastreadas el 29 de septiembre de 2026

Publicado el Rastreado el 90 de 106 sitios analizados (1.578 páginas) Escrito por el equipo de GE-KO

De las 90 webs conocidas que analizamos, el 20 % bloquea al menos un rastreador de IA en robots.txt, el 13 % publica un archivo llms.txt y el 59 % de las páginas de inicio incluye marcado schema.org. Rastreamos cada web el 29 de septiembre de 2026 y medimos solo señales de preparación, no si una web aparece en las respuestas de IA. La muestra no es representativa de la web en su conjunto.

Resultados principales

  1. El 20 % de los sitios (18 de 90) bloquea al menos uno de los 15 rastreadores de IA que comprobamos. El 16 % bloquea un rastreador de búsqueda con IA, el 12 % bloquea un agente a petición del usuario y el 1 % los bloquea todos (1 de 90). Fuente: robots.txt de 90 sitios, leído el 29 de septiembre de 2026.
  2. El 13 % de los sitios (12 de 90) publica un archivo llms.txt. De los sitios con un robots.txt legible, el 83 % declara allí su sitemap XML. Fuente: /llms.txt de 90 sitios y robots.txt de 84 sitios.
  3. El 59 % de las páginas de inicio incluye marcado schema.org y el 35 % incluye marcado Organization, que describe la organización que hay detrás del sitio. El 10 % de los sitios tiene marcado FAQPage en al menos una página analizada. Fuente: páginas de inicio de 85 sitios; hasta 20 páginas por sitio en 83 sitios.
  4. El 58 % de los sitios tiene al menos una página indexable sin meta descripción y el 43 % tiene más de una página indexable sin encabezado H1. Fuente: 81 sitios con al menos 5 páginas indexables analizadas.
  5. 13 de 106 sitios bloquearon nuestra primera petición (por ejemplo, con HTTP 403 o 429) y 3 redirigieron a otro dominio, así que 16 no pudieron analizarse. La muestra incluye 10 sitios conocidos por usar protección contra bots, así que estas cifras no dicen nada sobre la web en su conjunto. Fuente: los 106 sitios de la muestra.

¿Quién bloquea los rastreadores de IA?

Comprobamos si robots.txt prohíbe a 15 rastreadores de IA el acceso a la página de inicio, agrupados por finalidad: 8 rastreadores de entrenamiento (recopilan páginas para entrenar modelos), 4 rastreadores de búsqueda con IA (construyen un índice del que un asistente puede citar) y 3 agentes a petición del usuario (cargan una página porque alguien se la ha pedido a un asistente). Dos de las entradas de entrenamiento, Google-Extended y Applebot-Extended, son tokens de control y no rastreadores. La guía sobre rastreadores de IA y robots.txt explica la diferencia.

Porcentaje de sitios cuyo robots.txt bloquea rastreadores de IA
Porcentaje de sitios cuyo robots.txt bloquea rastreadores de IAPorcentaje de sitios cuyo robots.txt bloquea rastreadores de IA: Bloquea al menos un rastreador de IA 20 % · 18/90; Bloquea un rastreador de entrenamiento 20 % · 18/90; Bloquea un rastreador de búsqueda con IA 16 % · 14/90; Bloquea un agente a petición del usuario 12 % · 11/90; Bloquea todos los rastreadores de IA 1 % · 1/90Bloquea al menos un rastreador de IA20 % · 18/90Bloquea un rastreador de entrenamiento20 % · 18/90Bloquea un rastreador de búsqueda con IA16 % · 14/90Bloquea un agente a petición del usuario12 % · 11/90Bloquea todos los rastreadores de IA1 % · 1/90
Mostrar los datos en una tabla
Porcentaje de sitios cuyo robots.txt bloquea rastreadores de IA
ComprobaciónSitiosDe un total dePorcentaje (%)
Bloquea al menos un rastreador de IA189020
Bloquea un rastreador de entrenamiento189020
Bloquea un rastreador de búsqueda con IA149016
Bloquea un agente a petición del usuario119012
Bloquea todos los rastreadores de IA1901
Porcentaje de sitios que bloquean cada rastreador de IA
Porcentaje de sitios que bloquean cada rastreador de IAPorcentaje de sitios que bloquean cada rastreador de IA: Bytespider 19 % · 17/90; ClaudeBot 18 % · 16/90; CCBot 16 % · 14/90; GPTBot 16 % · 14/90; Applebot-Extended 13 % · 12/90; Google-Extended 12 % · 11/90; Amazonbot 11 % · 10/90; meta-externalagent 10 % · 9/90; PerplexityBot 13 % · 12/90; DuckAssistBot 9 % · 8/90; Claude-SearchBot 6 % · 5/90; OAI-SearchBot 6 % · 5/90; ChatGPT-User 9 % · 8/90; Perplexity-User 7 % · 6/90; Claude-User 6 % · 5/90Bytespider19 % · 17/90ClaudeBot18 % · 16/90CCBot16 % · 14/90GPTBot16 % · 14/90Applebot-Extended13 % · 12/90Google-Extended12 % · 11/90Amazonbot11 % · 10/90meta-externalagent10 % · 9/90PerplexityBot13 % · 12/90DuckAssistBot9 % · 8/90Claude-SearchBot6 % · 5/90OAI-SearchBot6 % · 5/90ChatGPT-User9 % · 8/90Perplexity-User7 % · 6/90Claude-User6 % · 5/90
Mostrar los datos en una tabla
Porcentaje de sitios que bloquean cada rastreador de IA
ComprobaciónSitiosDe un total dePorcentaje (%)
Bytespider179019
ClaudeBot169018
CCBot149016
GPTBot149016
Applebot-Extended129013
Google-Extended119012
Amazonbot109011
meta-externalagent99010
PerplexityBot129013
DuckAssistBot8909
Claude-SearchBot5906
OAI-SearchBot5906
ChatGPT-User8909
Perplexity-User6907
Claude-User5906

El porcentaje de sitios que bloquean un rastreador concreto va del 6 % (por ejemplo, OAI-SearchBot) al 19 % (Bytespider). Googlebot está bloqueado en 0 de 90 sitios.

Bloquear un rastreador de entrenamiento es una decisión legítima y no saca a una web de la búsqueda con IA. Bloquear un rastreador de búsqueda con IA puede dejar una web fuera del índice del que cita un asistente, y el 16 % de los sitios bloquea al menos uno. No medimos si alguno de estos sitios aparece en respuestas de IA.

El 2 de octubre de 2026 volvimos a descargar el robots.txt de los 18 sitios en los que habíamos detectado algún bloqueo y lo leímos con un segundo analizador, más sencillo; los rastreadores bloqueados coincidieron en 18 de 18. Los sitios en los que no habíamos detectado bloqueos no se volvieron a comprobar.

Señales de preparación más allá del acceso de los rastreadores

También buscamos estas señales de preparación: un archivo llms.txt (una propuesta de resumen en Markdown de una web; ningún buscador importante se ha comprometido a usarlo, consulta la guía de llms.txt), un sitemap declarado en robots.txt, datos estructurados schema.org y anotaciones hreflang. Ninguna de ellas garantiza que una respuesta de IA cite una web.

Porcentaje de sitios con cada señal de preparación
Porcentaje de sitios con cada señal de preparaciónPorcentaje de sitios con cada señal de preparación: Tiene un archivo llms.txt 13 % · 12/90; Declara un sitemap en robots.txt 83 % · 70/84; La página de inicio tiene marcado schema.org 59 % · 50/85; La página de inicio tiene marcado Organization 35 % · 30/85; Marcado schema.org en la mayoría de las páginas 66 % · 55/83; Marcado FAQPage en al menos una página 10 % · 8/83; Anotaciones de idioma (hreflang) en al menos una página 37 % · 31/83Tiene un archivo llms.txt13 % · 12/90Declara un sitemap en robots.txt83 % · 70/84La página de inicio tiene marcado schema.org59 % · 50/85La página de inicio tiene marcado Organization35 % · 30/85Marcado schema.org en la mayoría de laspáginas66 % · 55/83Marcado FAQPage en al menos una página10 % · 8/83Anotaciones de idioma (hreflang) en al menosuna página37 % · 31/83
Mostrar los datos en una tabla
Porcentaje de sitios con cada señal de preparación
ComprobaciónSitiosDe un total dePorcentaje (%)
Tiene un archivo llms.txt129013
Declara un sitemap en robots.txt708483
La página de inicio tiene marcado schema.org508559
La página de inicio tiene marcado Organization308535
Marcado schema.org en la mayoría de las páginas558366
Marcado FAQPage en al menos una página88310
Anotaciones de idioma (hreflang) en al menos una página318337

Contamos los datos estructurados por presencia y no los validamos (consulta la guía de datos estructurados). El marcado FAQ es opcional, así que la falta de FAQPage no es un error por sí misma. La anotación hreflang solo importa en webs multilingües.

El 2 de octubre de 2026 volvimos a descargar los 12 archivos llms.txt detectados. De ellos, 12 son archivos de texto reales, no páginas de error HTML.

Lo básico de cada página, que leen buscadores e IA

Tanto los buscadores como los sistemas de IA leen elementos básicos de la página, como el título, la descripción, los encabezados y el texto alternativo de las imágenes. Los gráficos muestran en cuántos sitios hay carencias en esos elementos, con las definiciones del Informe del sitio de Sitequiry (consulta la metodología).

Porcentaje de sitios con carencias en elementos básicos de la página
Porcentaje de sitios con carencias en elementos básicos de la páginaPorcentaje de sitios con carencias en elementos básicos de la página: Falta la meta descripción en al menos una página 58 % · 47/81; Falta la meta descripción en la mayoría de las páginas 19 % · 15/81; Falta el encabezado H1 en más de una página 43 % · 35/81; Etiquetas Open Graph incompletas en al menos una página 51 % · 41/81; Imágenes sin texto alternativo en al menos una página 48 % · 40/83; Más de una décima parte de las imágenes sin texto alternativo 16 % · 13/83Falta la meta descripción en al menos unapágina58 % · 47/81Falta la meta descripción en la mayoría de laspáginas19 % · 15/81Falta el encabezado H1 en más de una página43 % · 35/81Etiquetas Open Graph incompletas en al menosuna página51 % · 41/81Imágenes sin texto alternativo en al menos unapágina48 % · 40/83Más de una décima parte de las imágenes sintexto alternativo16 % · 13/83
Mostrar los datos en una tabla
Porcentaje de sitios con carencias en elementos básicos de la página
ComprobaciónSitiosDe un total dePorcentaje (%)
Falta la meta descripción en al menos una página478158
Falta la meta descripción en la mayoría de las páginas158119
Falta el encabezado H1 en más de una página358143
Etiquetas Open Graph incompletas en al menos una página418151
Imágenes sin texto alternativo en al menos una página408348
Más de una décima parte de las imágenes sin texto alternativo138316

En 83 sitios comprobamos 71.406 imágenes. 8.991 de ellas (13 %) no tienen ningún atributo alt. Un alt="" vacío es correcto en imágenes decorativas, así que no lo contamos.

Por grupo de idioma

Solo mostramos la cifra de un grupo de idioma si se basa en al menos 15 sitios; en caso contrario, la celda indica «n demasiado pequeño». Como idioma se toma el idioma principal del sitio según nuestra clasificación. La muestra incluye 36 sitios en esloveno, 26 en alemán (sobre todo de Alemania y Austria), 19 en inglés y 25 en otros idiomas (croata, italiano, francés, español, checo, neerlandés). Estas cifras incluyen los sitios que no pudieron analizarse.

Las diferencias entre grupos pueden decir más sobre qué sitios elegimos que sobre un idioma o un país, y los grupos son pequeños. Lee la tabla como una descripción, no como un ranking.

Sitios en español en la muestra

Esta muestra no incluye un grupo en español lo bastante grande para dar cifras propias: los sitios en español están dentro de «otros idiomas» (19 informes completados en total, que incluyen también sitios en croata, italiano, francés, checo y neerlandés). Por eso las cifras de este estudio corresponden a la muestra completa.

Para «otros idiomas» solo mostramos las cifras basadas en al menos 15 sitios: el 26 % bloquea al menos un rastreador de IA (5 de 19; muestra completa: 20 %) y el 5 % publica llms.txt (1 de 19; muestra completa: 13 %). Lee estas cifras como una descripción de la muestra, no como un reflejo de la web en español.

Porcentaje de sitios por grupo de idioma (sitios con la característica / sitios del grupo)
ComprobaciónTodos los sitiosEslovenoAlemánInglésOtros idiomas
Bloquea al menos un rastreador de IA 20 % · 18/90 15 % · 5/33 30 % · 7/23 7 % · 1/15 26 % · 5/19
Bloquea un rastreador de búsqueda con IA 16 % · 14/90 12 % · 4/33 17 % · 4/23 7 % · 1/15 26 % · 5/19
Tiene un archivo llms.txt 13 % · 12/90 12 % · 4/33 17 % · 4/23 20 % · 3/15 5 % · 1/19
La página de inicio tiene marcado schema.org 59 % · 50/85 61 % · 20/33 70 % · 16/23 n demasiado pequeño (n = 13) 63 % · 10/16
La página de inicio tiene marcado Organization 35 % · 30/85 42 % · 14/33 39 % · 9/23 n demasiado pequeño (n = 13) 25 % · 4/16
Falta la meta descripción en al menos una página 58 % · 47/81 74 % · 23/31 43 % · 10/23 n demasiado pequeño (n = 13) n demasiado pequeño (n = 14)
Falta el encabezado H1 en más de una página 43 % · 35/81 48 % · 15/31 22 % · 5/23 n demasiado pequeño (n = 13) n demasiado pequeño (n = 14)
Etiquetas Open Graph incompletas en al menos una página 51 % · 41/81 48 % · 15/31 57 % · 13/23 n demasiado pequeño (n = 13) n demasiado pequeño (n = 14)
Imágenes sin texto alternativo en al menos una página 48 % · 40/83 56 % · 18/32 43 % · 10/23 n demasiado pequeño (n = 14) n demasiado pequeño (n = 14)

Metodología

Es una muestra por conveniencia, no aleatoria. Elegimos nosotros 106 webs públicas conocidas para cubrir distintos tipos e idiomas: 31 tiendas y marketplaces, 22 sitios de noticias y revistas, 25 organismos públicos y sitios de salud y educación, 15 empresas, SaaS y agencias, 8 sitios de turismo y hostelería y 5 organizaciones sin ánimo de lucro. De estos sitios, se sabe que 10 usan protección contra bots.

  • Rastreo. El 29 de septiembre de 2026, SitequiryBot, el rastreador del Informe del sitio de Sitequiry, leyó cada web: la página de inicio y otras páginas, hasta un máximo de 20 en total, elegidas a partir del sitemap y de la navegación principal. Esas páginas no son una muestra aleatoria de una web. El rastreador respeta robots.txt y hace pausas entre peticiones. Software: Informe del sitio, revisión 98996b7.
  • Informes completados. Completamos 90 de 106 informes. Dejamos fuera 13 sitios que bloquearon la primera petición (por ejemplo, con HTTP 403 o 429) y 3 que redirigieron a otro dominio.
  • Bloqueo de rastreadores de IA. Contamos un rastreador como bloqueado cuando robots.txt le prohíbe la página de inicio («/»), ya sea en un grupo que lo nombra o en el grupo «*» si el rastreador no tiene grupo propio. La coincidencia sigue el RFC 9309. Un robots.txt ausente o ilegible cuenta como «sin reglas», y las reglas para secciones de un sitio no se cuentan.
  • Páginas. Las cifras a nivel de página describen un sitio solo cuando pudieron analizarse al menos 5 de sus páginas. De los informes completados, 7 tenían menos páginas analizables, debido a páginas que se generan en el navegador y no tienen contenido en el HTML, a la protección contra bots tras la primera petición o a que había muy poco contenido rastreable. Una URL que redirige a otra página no se cuenta dos veces. Evaluamos título, descripción, H1 y Open Graph solo en páginas indexables (sin noindex y con una URL canónica que apunta a la propia página). No evaluamos el marcado ni los encabezados de las páginas cuyo HTML no tiene contenido porque lo genera un script.
  • Imágenes. Una imagen cuenta como sin texto alternativo solo si su elemento img no tiene ningún atributo alt. Ignoramos los píxeles de seguimiento y las imágenes ocultas.
  • Porcentajes. Cada porcentaje es el número de sitios con la característica dividido entre el número de sitios de la población indicada en el conjunto de datos. El conjunto de datos recoge ambos números para cada cifra.

Límites de este estudio

  • No es representativo. Elegimos los sitios nosotros, sobre todo organizaciones conocidas. El estudio dice poco sobre las webs de pequeñas empresas.
  • Los sitios que bloquearon nuestra petición no están en las cifras, así que los resultados se inclinan hacia sitios que permiten comprobaciones automáticas.
  • robots.txt es una petición, no una imposición. Un sitio también puede bloquear rastreadores con un cortafuegos o una CDN y servir reglas distintas a rastreadores distintos. Leímos robots.txt como SitequiryBot.
  • Señales de preparación, no visibilidad. No medimos si un sitio es citado o mostrado en respuestas de IA, y la presencia de llms.txt o de marcado no prueba ningún efecto.
  • Un solo rastreo desde una ubicación el 29 de septiembre de 2026. Los sitios cambian, y leímos hasta 20 páginas por sitio.
  • Grupos pequeños. Los grupos de idioma son pequeños y un solo sitio mueve un porcentaje varios puntos.
  • Sin afirmaciones causales. Los datos muestran lo que hacen los sitios, no por qué.

Lo que este estudio no mide

Cada punto siguiente queda fuera por el motivo indicado.

  • Velocidad de carga. Google PageSpeed no se ejecutó para esta muestra, así que no hay Core Web Vitals, ni distribución de puntuaciones móviles, ni cifras de recursos que bloquean el renderizado o de peso de página.
  • Tiempo de respuesta del servidor. Se registró solo para peticiones sueltas desde una ubicación; no es una medición de velocidad.
  • Redirecciones a HTTPS y cabeceras de seguridad. El rastreo no las registró.
  • Visibilidad en respuestas de IA. Solo se miden señales de preparación.
  • Validez de los datos estructurados. Se cuentan por presencia.
  • Calidad de los archivos llms.txt. Se cuentan por presencia.
  • Puntuaciones de Sitequiry. Las puntuaciones de SEO, AEO, GEO y la global son nuestro propio sistema de puntuación ponderado, no una medición independiente.
  • Resultados por sitio. Solo se publican datos agregados.
  • Segmentos por tipo de sitio o por país. Cada uno tendría menos de 15 sitios.

Cita este estudio y descarga los datos

Puedes citar las cifras y reutilizar los gráficos con atribución. Los datos agregados se publican con la licencia Creative Commons Atribución (CC BY 4.0): puedes compartirlos y adaptarlos, también con fines comerciales, si citas a GE-KO / Sitequiry y enlazas esta página.

Cita sugerida

GE-KO / Sitequiry (2026). ¿Están las webs listas para la búsqueda con IA? Un análisis de las señales de preparación de 90 webs públicas. Publicado el 2 de octubre de 2026. https://sitequiry.com/es/estudios/preparacion-busqueda-ia-2026

Conjunto de datos (solo cifras agregadas, sin nombres de sitios)

Versión 1.0, con licencia CC BY 4.0. Los nombres de columna y las etiquetas de los archivos están en inglés.

Resumen para prensa y boletines

Sitequiry, la herramienta gratuita de análisis web de la agencia eslovena GE-KO, analizó 90 webs públicas conocidas mediante un rastreo realizado el 29 de septiembre de 2026. El 20 % bloquea al menos un rastreador de IA en robots.txt, el 13 % publica un archivo llms.txt y el 59 % de las páginas de inicio incluye marcado schema.org. Los autores eligieron los sitios, que no son representativos de la web en su conjunto, y el estudio mide señales de preparación, no la visibilidad en respuestas de IA.

Qué hacer a continuación

Preguntas frecuentes

¿Cuántas webs bloquean GPTBot?

En nuestra muestra, 14 de 90 sitios (16 %) bloquean GPTBot, el rastreador de entrenamiento de OpenAI, en robots.txt. ClaudeBot lo bloquea el 18 % de los sitios, PerplexityBot el 13 % y Google-Extended el 12 %. La búsqueda de ChatGPT usa otro rastreador, OAI-SearchBot, que bloquea el 6 %.

¿Qué es llms.txt y cuántos sitios lo tienen?

llms.txt es una propuesta de archivo Markdown, ubicado en la raíz de una web, que resume el sitio para los modelos de lenguaje. 12 de 90 sitios (13 %) publican uno. No es un estándar web y ningún buscador importante se ha comprometido a usarlo; consulta la guía de llms.txt.

¿Cuántas webs usan datos estructurados?

En nuestra muestra, el 59 % de las páginas de inicio incluye marcado schema.org (JSON-LD, microdatos o RDFa) y el 78 % de los sitios lo tiene en al menos una página analizada. Contamos la presencia, no la validez. Consulta la guía de datos estructurados.

¿Bloquear los rastreadores de IA deja una web fuera de las respuestas de IA?

Depende del rastreador que se bloquee. Bloquear un rastreador de entrenamiento no saca a una web de la búsqueda con IA, mientras que bloquear un rastreador de búsqueda con IA puede dejarla fuera del índice del que cita un asistente. Este estudio no puede mostrar el efecto, porque lee reglas de robots.txt, no respuestas de IA. Consulta la guía sobre rastreadores de IA y robots.txt.

¿Hasta qué punto son fiables estas cifras?

Las cifras son exactas para los 90 sitios que analizamos el 29 de septiembre de 2026, pero no describen la web en su conjunto. Elegimos los sitios nosotros, 16 sitios no pudieron analizarse y los grupos de idioma son pequeños. La metodología y los límites están más arriba, y los datos agregados son abiertos con licencia CC BY 4.0.

Comprueba tu propia web en unos dos minutos

El análisis gratuito lee tu robots.txt, tu llms.txt y tus datos estructurados y muestra qué corregir primero.