Drei Arten von KI-Crawlern
Trainings-Crawler sammeln öffentliche Seiten, um künftige Modelle zu trainieren. Wenn Sie sie blockieren, verschwinden Sie dadurch nicht aus KI-Suchergebnissen.
Such- und Retrieval-Crawler bauen den Index auf, mit dem ein Assistent Quellen findet und zitiert. Erst wenn Sie diese blockieren, werden Sie in KI-Antworten unsichtbar.
Von Nutzern ausgelöste Abrufe laden eine einzelne Seite, weil eine Person den Assistenten gebeten hat, sie zu lesen. Die Anbieter behandeln sie anders als automatisiertes Crawling, und einige geben an, dass robots.txt-Regeln für sie möglicherweise nicht gelten.
Die User-Agent-Namen, auf die es ankommt
- OpenAI:
GPTBot(Training),OAI-SearchBot(ChatGPT-Suche),ChatGPT-User(Nutzeranfragen). - Anthropic:
ClaudeBot(Training),Claude-SearchBot(Suche),Claude-User(Nutzeranfragen). - Perplexity:
PerplexityBot(Suchindex),Perplexity-User(Nutzeranfragen). - Google:
Google-Extendedist ein Steuerungs-Token, kein eigener Crawler. Es legt fest, ob von Googlebot abgerufene Inhalte für Gemini-Modelle und Grounding verwendet werden dürfen. Auf die Google-Suche, AI Overviews und AI Mode hat es keinen Einfluss. - Apple:
Applebot-Extendedsteuert die Nutzung für das KI-Training von Apple;Applebotselbst versorgt Siri und Spotlight. - Weitere Bots, die Sie in Ihren Serverlogs sehen werden:
CCBot(Common Crawl, häufig für Training genutzt),meta-externalagent(Meta),Amazonbot,Bytespider(ByteDance),DuckAssistBot(DuckDuckGo).
Eine sinnvolle Standard-robots.txt
Für die meisten Unternehmenswebsites ist das Ziel, gefunden und zitiert zu werden. Üblich ist es, Such-Bots und nutzerausgelöste Bots zuzulassen und über das Training getrennt zu entscheiden. Dieses Beispiel lässt die KI-Suche zu und schließt das Training aus:
# Suchmaschinen und KI-Suche: erlaubt
User-agent: *
Allow: /
# KI-Training: ausgeschlossen
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
Disallow: /
Sitemap: https://www.beispiel.de/sitemap.xml
Wenn Sie damit einverstanden sind, dass Ihre Inhalte für das Training genutzt werden – was Modellen helfen kann, Ihre Marke zu kennen –, lassen Sie den zweiten Block einfach weg. In jedem Fall gilt: Sperren Sie niemals OAI-SearchBot, Claude-SearchBot oder PerplexityBot, wenn Sie in diesen Assistenten erscheinen möchten.
Prüfen Sie auch CDN und Firewall
robots.txt ist nur eine Bitte. In der Praxis ist das häufigere Problem das umgekehrte: eine Firewall oder ein CDN, das KI-Crawler blockiert, bevor sie die robots.txt überhaupt lesen. Cloudflare zum Beispiel blockiert seit Juli 2025 bekannte KI-Crawler bei neuen Domains standardmäßig, und viele Sicherheits-Plugins haben ähnliche Schalter.
Wenn Ihre robots.txt einen Bot zulässt, die Website aber trotzdem nie in KI-Antworten erscheint, prüfen Sie die Bot-Einstellungen Ihres CDNs, der Firewall Ihres Hosters und Ihrer Sicherheits-Plugins, und suchen Sie in Ihren Serverlogs nach 403-Antworten an diese User-Agents.
Was Sitequiry prüft
Die Analyse liest Ihre robots.txt und zeigt, welche KI-Crawler zugelassen oder blockiert sind – getrennt nach Trainings- und Such-Bots – und weist darauf hin, wenn eine Pauschalregel alles blockiert. Geprüft werden die Zugriffsregeln, nicht aber, ob ein CDN den Bot auf Netzwerkebene blockiert, denn das lässt sich nur aus den eigenen IP-Bereichen des Bots erkennen.
Häufige Fragen
Verschwinde ich aus ChatGPT, wenn ich GPTBot blockiere?
Nein. GPTBot ist der Trainings-Crawler von OpenAI. Die ChatGPT-Suche nutzt OAI-SearchBot, und Seiten, nach denen ein Nutzer fragt, ruft ChatGPT-User ab.
Wirkt sich Google-Extended auf AI Overviews aus?
Nein. AI Overviews und AI Mode nutzen den normalen Google-Suchindex, den Googlebot crawlt. Um zu begrenzen, wie Ihre Inhalte dort erscheinen, verwenden Sie Vorschau-Steuerungen wie nosnippet oder max-snippet, die sich auch auf normale Snippets auswirken.
Ist robots.txt rechtlich verbindlich?
Nein. Es handelt sich um eine weithin respektierte Konvention. Die großen KI-Anbieter dokumentieren, dass ihre Crawler sich daran halten; technisch verhindert die Datei den Zugriff aber nicht.
Wie oft sollte ich das überprüfen?
Mindestens zweimal im Jahr. Regelmäßig kommen neue Crawler hinzu, und Anbieter benennen bestehende um oder teilen sie auf.
Prüfen Sie Ihre eigene Website in etwa einer Minute
Die kostenlose Analyse misst die Punkte aus diesem Ratgeber für Ihre URL und zeigt, was Sie zuerst beheben sollten.