Tri vrste AI pajkov
Pajki za učenje zbirajo javne strani za učenje prihodnjih modelov. Če jih blokirate, zaradi tega ne izginete iz AI iskanja.
Pajki za iskanje gradijo indeks, v katerem asistent išče in navaja vire. Če blokirate te, postanete v AI odgovorih nevidni.
Pajki na zahtevo uporabnika naložijo eno stran, ker je nekdo asistenta prosil, naj jo prebere. Ponudniki jih obravnavajo drugače kot samodejno pajkanje in nekateri navajajo, da zanje pravila robots.txt morda ne veljajo.
Imena, ki štejejo
- OpenAI:
GPTBot(učenje),OAI-SearchBot(iskanje v ChatGPT),ChatGPT-User(zahteve uporabnikov). - Anthropic:
ClaudeBot(učenje),Claude-SearchBot(iskanje),Claude-User(zahteve uporabnikov). - Perplexity:
PerplexityBot(iskalni indeks),Perplexity-User(zahteve uporabnikov). - Google:
Google-Extendedje nadzorni žeton, ne ločen pajek. Določa, ali se vsebina, ki jo pobere Googlebot, sme uporabiti za modele Gemini. Na Google Iskanje, AI Overviews ali AI Mode ne vpliva. - Apple:
Applebot-Extendednadzira uporabo za Applovo učenje AI; samApplebotpoganja Siri in Spotlight. - Drugi, ki jih boste videli v dnevnikih:
CCBot(Common Crawl, pogosto uporabljen za učenje),meta-externalagent(Meta),Amazonbot,Bytespider(ByteDance),DuckAssistBot(DuckDuckGo).
Smiselna privzeta datoteka robots.txt
Za večino poslovnih strani je cilj, da jih AI najde in navaja. Pogosta izbira je, da dovolite bote za iskanje in bote na zahtevo uporabnika, o učenju pa se odločite posebej. Ta primer dovoli AI iskanje, učenje pa izključi:
# Iskalniki in AI iskanje: dovoljeno
User-agent: *
Allow: /
# Učenje AI: izključeno
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
Disallow: /
Sitemap: https://www.primer.si/sitemap.xml
Če vam ustreza, da se vaša vsebina uporablja za učenje, kar lahko modelom pomaga spoznati vašo blagovno znamko, drugi blok preprosto izpustite. V vsakem primeru ne blokirajte OAI-SearchBot, Claude-SearchBot ali PerplexityBot, če želite biti vidni v teh asistentih.
Preverite tudi CDN in požarni zid
Robots.txt je le prošnja. V praksi je pogostejša obratna težava: požarni zid ali CDN, ki AI pajke blokira, še preden preberejo robots.txt. Cloudflare je na primer julija 2025 začel znane AI pajke za nove domene privzeto blokirati, podobna stikala pa imajo tudi številni varnostni vtičniki.
Če robots.txt bota dovoljuje, stran pa se v AI odgovorih nikoli ne pojavi, preverite nastavitve botov v CDN-ju, požarnem zidu gostovanja in varnostnih vtičnikih ter v dnevnikih strežnika poiščite odgovore 403 za te bote.
Kaj preveri Sitequiry
Analiza prebere vaš robots.txt in pokaže, kateri AI pajki so dovoljeni ali blokirani, ločeno za učenje in za iskanje, ter opozori, kadar splošno pravilo blokira vse. Preverja pravila dostopa, ne pa tega, ali CDN bota blokira na ravni omrežja, ker je to vidno le z naslovov IP samih botov.
Pogosta vprašanja
Ali me blokiranje GPTBot odstrani iz ChatGPT?
Ne. GPTBot je pajek OpenAI za učenje. Iskanje v ChatGPT uporablja OAI-SearchBot, strani, o katerih vpraša uporabnik, pa prebere ChatGPT-User.
Ali Google-Extended vpliva na AI Overviews?
Ne. AI Overviews in AI Mode uporabljata običajni Googlov indeks, ki ga gradi Googlebot. Prikaz tam omejite z nadzorom predogleda, kot sta nosnippet ali max-snippet, ki vplivata tudi na običajne izrezke.
Ali je robots.txt pravno zavezujoč?
Ne. Je splošno spoštovan dogovor. Velika AI podjetja navajajo, da ga njihovi pajki upoštevajo, tehnično pa dostopa ne prepreči.
Kako pogosto naj to pregledam?
Vsaj dvakrat na leto. Novi pajki se pojavljajo redno, obstoječe pa ponudniki preimenujejo ali razdelijo.
Preverite svojo stran v približno minuti
Brezplačna analiza na vašem URL-ju preveri točke iz tega vodiča in pokaže, kaj popraviti najprej.