Kdo blokira AI pajke?
Preverili smo, ali robots.txt prepoveduje dostop do domače strani 15 AI pajkom, razvrščenim po namenu: 8 pajkov za učenje (zbirajo strani za učenje modelov), 4 pajki za AI iskanje (gradijo indeks, iz katerega lahko asistent navaja vire) in 3 pajki na zahtevo uporabnika (naložijo stran, ker je oseba asistenta vprašala o njej). Dva izmed vnosov za učenje, Google-Extended in Applebot-Extended, sta nadzorna žetona in nista pajka. Razliko pojasnjuje vodič o AI pajkih in robots.txt.
Pokaži podatke v tabeli
| Preverjanje | Strani | Skupaj | Delež (%) |
|---|---|---|---|
| Blokira vsaj enega AI pajka | 18 | 90 | 20 |
| Blokira pajka za učenje | 18 | 90 | 20 |
| Blokira pajka za AI iskanje | 14 | 90 | 16 |
| Blokira pajka na zahtevo uporabnika | 11 | 90 | 12 |
| Blokira vse AI pajke | 1 | 90 | 1 |
Pokaži podatke v tabeli
| Preverjanje | Strani | Skupaj | Delež (%) |
|---|---|---|---|
| Bytespider | 17 | 90 | 19 |
| ClaudeBot | 16 | 90 | 18 |
| CCBot | 14 | 90 | 16 |
| GPTBot | 14 | 90 | 16 |
| Applebot-Extended | 12 | 90 | 13 |
| Google-Extended | 11 | 90 | 12 |
| Amazonbot | 10 | 90 | 11 |
| meta-externalagent | 9 | 90 | 10 |
| PerplexityBot | 12 | 90 | 13 |
| DuckAssistBot | 8 | 90 | 9 |
| Claude-SearchBot | 5 | 90 | 6 |
| OAI-SearchBot | 5 | 90 | 6 |
| ChatGPT-User | 8 | 90 | 9 |
| Perplexity-User | 6 | 90 | 7 |
| Claude-User | 5 | 90 | 6 |
Delež strani, ki blokirajo posameznega pajka, je od 6 % (na primer OAI-SearchBot) do 19 % (Bytespider). Googlebota blokira 0 od 90 strani.
Blokiranje pajka za učenje je legitimna odločitev in strani ne odstrani iz AI iskanja. Blokiranje pajka za AI iskanje lahko stran izloči iz indeksa, iz katerega asistent navaja vire, vsaj enega takega pajka pa blokira 16 % strani. Nismo merili, ali se katera od teh strani pojavlja v AI odgovorih.
Dne 2. 10. 2026 smo robots.txt ponovno prenesli pri 18 straneh, ki smo jih označili kot take, ki blokirajo pajke, in ga prebrali z drugim, preprostejšim razčlenjevalnikom. Seznam blokiranih pajkov se je ujemal pri 18 od 18 strani. Strani, ki niso bile označene, nismo ponovno preverjali.
Signali pripravljenosti poleg dostopa pajkov
Iskali smo tudi te signale pripravljenosti: datoteko llms.txt (predlagan povzetek strani v zapisu Markdown; noben večji iskalnik se ni zavezal, da jo bo uporabljal, glejte vodič o llms.txt), zemljevid strani, naveden v robots.txt, strukturirane podatke schema.org in oznake hreflang. Nič od tega ne zagotavlja, da bo AI odgovor navedel stran.
Pokaži podatke v tabeli
| Preverjanje | Strani | Skupaj | Delež (%) |
|---|---|---|---|
| Ima datoteko llms.txt | 12 | 90 | 13 |
| Zemljevid strani navaja v robots.txt | 70 | 84 | 83 |
| Domača stran ima oznake schema.org | 50 | 85 | 59 |
| Domača stran ima oznako Organization | 30 | 85 | 35 |
| Oznake schema.org na večini podstrani | 55 | 83 | 66 |
| Oznaka FAQPage vsaj na eni podstrani | 8 | 83 | 10 |
| Jezikovne oznake (hreflang) vsaj na eni podstrani | 31 | 83 | 37 |
Strukturirane podatke smo šteli po prisotnosti in njihove veljavnosti nismo preverjali (glejte vodič o strukturiranih podatkih). Oznake FAQ so neobvezne, zato manjkajoča oznaka FAQPage sama po sebi ni napaka. Oznaka hreflang je pomembna le za večjezične strani.
Dne 2. 10. 2026 smo ponovno prenesli 12 zaznanih datotek llms.txt. Med njimi je 12 pravih besedilnih datotek, ne HTML strani z napako.
Osnove na strani, ki jih berejo iskalniki in AI
Iskalniki in AI sistemi berejo osnovne elemente strani, kot so naslov, opis, naslovi razdelkov in alt besedilo slik. Grafi kažejo, pri koliko straneh so v njih vrzeli, po definicijah poročila Sitequiry Site Report (glejte metodologijo).
Pokaži podatke v tabeli
| Preverjanje | Strani | Skupaj | Delež (%) |
|---|---|---|---|
| Meta opis manjka vsaj na eni podstrani | 47 | 81 | 58 |
| Meta opis manjka na večini podstrani | 15 | 81 | 19 |
| Naslov H1 manjka na več kot eni podstrani | 35 | 81 | 43 |
| Oznake Open Graph nepopolne vsaj na eni podstrani | 41 | 81 | 51 |
| Slike brez alt besedila vsaj na eni podstrani | 40 | 83 | 48 |
| Več kot desetina slik brez alt besedila | 13 | 83 | 16 |
Pri 83 straneh smo preverili 71.406 slik. 8.991 med njimi (13 %) sploh nima atributa alt. Prazen alt="" je za okrasne slike pravilen, zato ga nismo šteli.
Po jezikovnih skupinah
Številko za jezikovno skupino pokažemo le, če temelji na vsaj 15 straneh, sicer v celici piše »premajhen n«. Jezik je glavni jezik strani, kot smo ga razvrstili. V vzorcu je 36 slovenskih, 26 nemških (predvsem Nemčija in Avstrija), 19 angleških in 25 strani v drugih jezikih (hrvaščina, italijanščina, francoščina, španščina, češčina, nizozemščina). V teh številkah so tudi strani, ki jih ni bilo mogoče analizirati.
Razlike med skupinami lahko povedo več o tem, katere strani smo izbrali, kot o jeziku ali državi, skupine pa so majhne. Tabelo berite kot opis, ne kot lestvico.
Slovenske strani v vzorcu
Slovenska skupina ima 33 zaključenih poročil. Od teh jih 15 % blokira vsaj enega AI pajka (5 od 33; ves vzorec: 20 %), 12 % objavlja llms.txt (4 od 33; ves vzorec: 13 %), 61 % domačih strani pa ima oznake schema.org (ves vzorec: 59 %).
Osnovne elemente podstrani smo lahko ocenili pri 31 slovenskih straneh: 74 % jih ima vsaj eno indeksirljivo podstran brez meta opisa (ves vzorec: 58 %), 48 % pa jih ima več kot eno indeksirljivo podstran brez naslova H1 (ves vzorec: 43 %). Skupina je majhna, zato jo berite kot opis vzorca in ne kot oceno slovenskega spleta.
| Preverjanje | Vse strani | Slovenščina | Nemščina | Angleščina | Drugi jeziki |
|---|---|---|---|---|---|
| Blokira vsaj enega AI pajka | 20 % · 18/90 | 15 % · 5/33 | 30 % · 7/23 | 7 % · 1/15 | 26 % · 5/19 |
| Blokira pajka za AI iskanje | 16 % · 14/90 | 12 % · 4/33 | 17 % · 4/23 | 7 % · 1/15 | 26 % · 5/19 |
| Ima datoteko llms.txt | 13 % · 12/90 | 12 % · 4/33 | 17 % · 4/23 | 20 % · 3/15 | 5 % · 1/19 |
| Domača stran ima oznake schema.org | 59 % · 50/85 | 61 % · 20/33 | 70 % · 16/23 | premajhen n (n = 13) | 63 % · 10/16 |
| Domača stran ima oznako Organization | 35 % · 30/85 | 42 % · 14/33 | 39 % · 9/23 | premajhen n (n = 13) | 25 % · 4/16 |
| Meta opis manjka vsaj na eni podstrani | 58 % · 47/81 | 74 % · 23/31 | 43 % · 10/23 | premajhen n (n = 13) | premajhen n (n = 14) |
| Naslov H1 manjka na več kot eni podstrani | 43 % · 35/81 | 48 % · 15/31 | 22 % · 5/23 | premajhen n (n = 13) | premajhen n (n = 14) |
| Oznake Open Graph nepopolne vsaj na eni podstrani | 51 % · 41/81 | 48 % · 15/31 | 57 % · 13/23 | premajhen n (n = 13) | premajhen n (n = 14) |
| Slike brez alt besedila vsaj na eni podstrani | 48 % · 40/83 | 56 % · 18/32 | 43 % · 10/23 | premajhen n (n = 14) | premajhen n (n = 14) |
Metodologija
To je priložnostni vzorec, ne naključni. Sami smo izbrali 106 znanih javnih spletnih strani, da bi zajeli različne vrste in jezike: 31 spletnih trgovin in tržnic, 22 novičarskih in revialnih strani, 25 strani javnih ustanov, zdravstva in izobraževanja, 15 podjetij, SaaS in agencij, 8 strani s področja turizma in gostinstva ter 5 nepridobitnih organizacij. Od teh strani je za 10 znano, da uporabljajo zaščito pred boti.
- Pregled. Dne 29. 9. 2026 je SitequiryBot, pajek poročila Sitequiry Site Report, prebral vsako stran: domačo stran in še druge podstrani iz zemljevida strani in glavne navigacije, skupaj do 20 strani. Izbrane podstrani niso naključni vzorec. Pajek upošteva robots.txt in med zahtevami počaka. Programska oprema: Site Report, različica 98996b7.
- Zaključena poročila. Zaključili smo 90 od 106 poročil. Izpustili smo 13 strani, ki so blokirale prvo zahtevo (na primer s kodo HTTP 403 ali 429), in 3 strani, ki so preusmerile na drugo domeno.
- Blokiranje AI pajkov. Pajka štejemo za blokiranega, kadar robots.txt zanj prepoveduje domačo stran (»/«), bodisi v skupini, ki pajka imenuje, bodisi v skupini »*«, če pajek nima svoje skupine. Ujemanje sledi RFC 9309. Manjkajoč ali neberljiv robots.txt štejemo kot »brez pravil«, pravil za posamezne dele strani pa ne štejemo.
- Podstrani. Številke na ravni podstrani opisujejo stran le, kadar je bilo mogoče analizirati vsaj 5 njenih podstrani. Med zaključenimi poročili jih je 7 imelo manj podstrani, ki bi jih bilo mogoče analizirati, ker so podstrani izrisane na strani odjemalca in v HTML nimajo vsebine, ker zaščita pred boti deluje po prvi zahtevi ali ker je bilo za pregled zelo malo vsebine. URL, ki preusmeri na drugo podstran, ne šteje dvakrat. Naslov, opis, H1 in Open Graph presojamo le na indeksirljivih podstraneh (brez noindex, kanonični URL kaže nanje same). Oznak in naslovov ne presojamo na podstraneh, katerih HTML nima vsebine, ker jo izriše skripta.
- Slike. Slika velja za sliko brez alt besedila le, če njen element img sploh nima atributa alt. Sledilne piksle in skrite slike prezremo.
- Deleži. Vsak delež je število strani z lastnostjo, deljeno s številom strani v populaciji, navedeni v podatkovnem naboru. Podatkovni nabor za vsako številko navaja obe vrednosti.
Omejitve raziskave
- Ni reprezentativna. Strani smo izbrali sami, večinoma znane organizacije. O spletnih straneh malih podjetij raziskava pove malo.
- Strani, ki so blokirale našo zahtevo, niso zajete v številkah, zato so rezultati nagnjeni k stranem, ki dovolijo samodejne preglede.
- Datoteka robots.txt je prošnja, ne prisila. Stran lahko pajke blokira tudi z požarnim zidom ali CDN in različnim pajkom lahko postreže z različnimi pravili. Datoteko robots.txt smo brali kot SitequiryBot.
- Signali pripravljenosti, ne vidnost. Nismo merili, ali je stran navedena ali prikazana v AI odgovorih, prisotnost datoteke llms.txt ali oznak pa ni dokaz za noben učinek.
- Enkraten pregled z ene lokacije dne 29. 9. 2026. Spletna mesta se spreminjajo, mi pa smo prebrali do 20 strani na posamezno spletno mesto.
- Majhne skupine. Jezikovne skupine so majhne, ena sama stran premakne delež za več odstotnih točk.
- Brez vzročnih trditev. Podatki kažejo, kaj strani počnejo, ne zakaj.
Česa ta raziskava ne meri
Vsaka od spodnjih točk je izpuščena z navedenim razlogom.
- Hitrost. Google PageSpeed za ta vzorec ni bil zagnan, zato ni podatkov o Core Web Vitals, o porazdelitvi mobilnih ocen, o virih, ki blokirajo izris, ali o teži strani.
- Odzivni čas strežnika. Beležili smo ga samo za posamezne zahteve z ene lokacije; ni meritev hitrosti.
- Preusmeritve na HTTPS in varnostne glave. Pregled jih ni beležil.
- Vidnost v AI odgovorih. Merimo samo signale pripravljenosti.
- Veljavnost strukturiranih podatkov. Štejemo jih po prisotnosti.
- Kakovost datotek llms.txt. Štejemo jih po prisotnosti.
- Ocene Sitequiry. Ocene SEO, AEO, GEO in skupna ocena so naša lastna utežena ocenjevalna shema, ne neodvisna meritev.
- Rezultati po straneh. Objavljamo samo agregirane podatke.
- Razčlenitev po vrsti strani ali državi. Vsaka skupina bi imela manj kot 15 strani.
Citirajte raziskavo in prenesite podatke
Številke lahko citirate, grafe pa ponovno uporabite z navedbo vira. Agregirani podatki so objavljeni pod licenco Creative Commons Priznanje avtorstva (CC BY 4.0): lahko jih delite in prilagajate, tudi komercialno, če navedete GE-KO / Sitequiry in povezavo do te strani.
GE-KO / Sitequiry (2026). Kako pripravljene so spletne strani na AI iskanje? Analiza signalov pripravljenosti pri 90 javnih spletnih straneh. Objavljeno 2. 10. 2026. https://sitequiry.com/sl/raziskave/pripravljenost-na-ai-iskanje-2026
Različica 1.0, licenca CC BY 4.0. Imena stolpcev in oznake v datotekah so v angleščini.
Povzetek za medije in novičnike
Sitequiry, brezplačno orodje za analizo spletnih strani slovenske agencije GE-KO, je 29. 9. 2026 analiziral 90 znanih javnih spletnih strani. 20 % jih v robots.txt blokira vsaj enega AI pajka, 13 % objavlja datoteko llms.txt, 59 % domačih strani pa vsebuje oznake schema.org. Strani so izbrali avtorji, niso reprezentativne za splet, raziskava pa meri signale pripravljenosti, ne vidnosti v AI odgovorih.
Naslednji koraki
- Premišljeno odločite, katere AI pajke dovolite, in preverite tudi požarni zid in CDN: AI pajki in robots.txt.
- Datoteko llms.txt dodajte samo, če jo je poceni vzdrževati: llms.txt: kaj je in ali ga potrebujete.
- Z natančnimi oznakami opišite, kdo ste in o čem je posamezna stran: vodič o strukturiranih podatkih.
- Svojo stran preverite z enakimi signali: brezplačna analiza, en URL, celoten rezultat, brez računa.
- Želite, da popravke uredimo mi? GE-KO jih izvede.
Pogosta vprašanja
Koliko spletnih strani blokira GPTBot?
V našem vzorcu pajka GPTBot (pajek OpenAI za učenje) v robots.txt blokira 14 od 90 strani (16 %). Pajka ClaudeBot blokira 18 % strani, pajka PerplexityBot 13 % in žeton Google-Extended 12 %. Iskanje v ChatGPT uporablja drugega pajka, OAI-SearchBot, ki ga blokira 6 % strani.
Kaj je llms.txt in koliko strani ga ima?
llms.txt je predlagana navadna besedilna datoteka v zapisu Markdown v korenu spletne strani, ki stran povzame jezikovnim modelom. Objavlja jo 12 od 90 strani (13 %). Ni spletni standard in noben večji iskalnik se ni zavezal, da jo bo uporabljal; glejte vodič o llms.txt.
Koliko spletnih strani uporablja strukturirane podatke?
V našem vzorcu 59 % domačih strani vsebuje oznake schema.org (JSON-LD, Microdata ali RDFa), 78 % strani pa jih ima vsaj na eni analizirani podstrani. Štejemo prisotnost, ne veljavnost. Glejte vodič o strukturiranih podatkih.
Ali blokiranje AI pajkov stran izloči iz AI odgovorov?
Odvisno od tega, kateri pajek je blokiran. Blokiranje pajka za učenje strani ne odstrani iz AI iskanja, blokiranje pajka za AI iskanje pa jo lahko izloči iz indeksa, iz katerega asistent navaja vire. Raziskava učinka ne more pokazati, ker bere pravila v robots.txt, ne pa AI odgovorov. Glejte vodič o AI pajkih in robots.txt.
Kako zanesljive so te številke?
Številke so natančne za 90 strani, ki smo jih analizirali 29. 9. 2026, ne opisujejo pa celotnega spleta. Strani smo izbrali sami, 16 strani ni bilo mogoče analizirati, jezikovne skupine pa so majhne. Metodologija in omejitve so zgoraj, agregirani podatki pa so odprti pod licenco CC BY 4.0.
Preverite svojo stran v približno dveh minutah
Brezplačna analiza prebere vaš robots.txt, llms.txt in strukturirane podatke ter pokaže, kaj popraviti najprej.