Zum Inhalt springen
Sitequiry

KI-Crawler und robots.txt: Welche Bots Sie 2026 zulassen sollten

Wer „KI-Bots“ mit einer einzigen Zeile blockiert, verschwindet unter Umständen unbemerkt aus der ChatGPT-Suche und aus den Antworten von Claude oder Perplexity. Die großen KI-Anbieter nutzen inzwischen getrennte Crawler für das Modelltraining, für ihren Suchindex und für den Abruf einer Seite, wenn ein Nutzer danach fragt. Sie können also gezielt entscheiden, statt alles oder nichts zu sperren.

Aktualisiert 2 Min. Lesezeit Verfasst vom Team der Agentur Ge-ko

Drei Arten von KI-Crawlern

Trainings-Crawler sammeln öffentliche Seiten, um künftige Modelle zu trainieren. Wenn Sie sie blockieren, verschwinden Sie dadurch nicht aus KI-Suchergebnissen.

Such- und Retrieval-Crawler bauen den Index auf, mit dem ein Assistent Quellen findet und zitiert. Erst wenn Sie diese blockieren, werden Sie in KI-Antworten unsichtbar.

Von Nutzern ausgelöste Abrufe laden eine einzelne Seite, weil eine Person den Assistenten gebeten hat, sie zu lesen. Die Anbieter behandeln sie anders als automatisiertes Crawling, und einige geben an, dass robots.txt-Regeln für sie möglicherweise nicht gelten.

Die User-Agent-Namen, auf die es ankommt

  • OpenAI: GPTBot (Training), OAI-SearchBot (ChatGPT-Suche), ChatGPT-User (Nutzeranfragen).
  • Anthropic: ClaudeBot (Training), Claude-SearchBot (Suche), Claude-User (Nutzeranfragen).
  • Perplexity: PerplexityBot (Suchindex), Perplexity-User (Nutzeranfragen).
  • Google: Google-Extended ist ein Steuerungs-Token, kein eigener Crawler. Es legt fest, ob von Googlebot abgerufene Inhalte für Gemini-Modelle und Grounding verwendet werden dürfen. Auf die Google-Suche, AI Overviews und AI Mode hat es keinen Einfluss.
  • Apple: Applebot-Extended steuert die Nutzung für das KI-Training von Apple; Applebot selbst versorgt Siri und Spotlight.
  • Weitere Bots, die Sie in Ihren Serverlogs sehen werden: CCBot (Common Crawl, häufig für Training genutzt), meta-externalagent (Meta), Amazonbot, Bytespider (ByteDance), DuckAssistBot (DuckDuckGo).

Eine sinnvolle Standard-robots.txt

Für die meisten Unternehmenswebsites ist das Ziel, gefunden und zitiert zu werden. Üblich ist es, Such-Bots und nutzerausgelöste Bots zuzulassen und über das Training getrennt zu entscheiden. Dieses Beispiel lässt die KI-Suche zu und schließt das Training aus:

# Suchmaschinen und KI-Suche: erlaubt
User-agent: *
Allow: /

# KI-Training: ausgeschlossen
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
User-agent: meta-externalagent
Disallow: /

Sitemap: https://www.beispiel.de/sitemap.xml

Wenn Sie damit einverstanden sind, dass Ihre Inhalte für das Training genutzt werden – was Modellen helfen kann, Ihre Marke zu kennen –, lassen Sie den zweiten Block einfach weg. In jedem Fall gilt: Sperren Sie niemals OAI-SearchBot, Claude-SearchBot oder PerplexityBot, wenn Sie in diesen Assistenten erscheinen möchten.

Prüfen Sie auch CDN und Firewall

robots.txt ist nur eine Bitte. In der Praxis ist das häufigere Problem das umgekehrte: eine Firewall oder ein CDN, das KI-Crawler blockiert, bevor sie die robots.txt überhaupt lesen. Cloudflare zum Beispiel blockiert seit Juli 2025 bekannte KI-Crawler bei neuen Domains standardmäßig, und viele Sicherheits-Plugins haben ähnliche Schalter.

Wenn Ihre robots.txt einen Bot zulässt, die Website aber trotzdem nie in KI-Antworten erscheint, prüfen Sie die Bot-Einstellungen Ihres CDNs, der Firewall Ihres Hosters und Ihrer Sicherheits-Plugins, und suchen Sie in Ihren Serverlogs nach 403-Antworten an diese User-Agents.

Was Sitequiry prüft

Die Analyse liest Ihre robots.txt und zeigt, welche KI-Crawler zugelassen oder blockiert sind – getrennt nach Trainings- und Such-Bots – und weist darauf hin, wenn eine Pauschalregel alles blockiert. Geprüft werden die Zugriffsregeln, nicht aber, ob ein CDN den Bot auf Netzwerkebene blockiert, denn das lässt sich nur aus den eigenen IP-Bereichen des Bots erkennen.

Häufige Fragen

Verschwinde ich aus ChatGPT, wenn ich GPTBot blockiere?

Nein. GPTBot ist der Trainings-Crawler von OpenAI. Die ChatGPT-Suche nutzt OAI-SearchBot, und Seiten, nach denen ein Nutzer fragt, ruft ChatGPT-User ab.

Wirkt sich Google-Extended auf AI Overviews aus?

Nein. AI Overviews und AI Mode nutzen den normalen Google-Suchindex, den Googlebot crawlt. Um zu begrenzen, wie Ihre Inhalte dort erscheinen, verwenden Sie Vorschau-Steuerungen wie nosnippet oder max-snippet, die sich auch auf normale Snippets auswirken.

Ist robots.txt rechtlich verbindlich?

Nein. Es handelt sich um eine weithin respektierte Konvention. Die großen KI-Anbieter dokumentieren, dass ihre Crawler sich daran halten; technisch verhindert die Datei den Zugriff aber nicht.

Wie oft sollte ich das überprüfen?

Mindestens zweimal im Jahr. Regelmäßig kommen neue Crawler hinzu, und Anbieter benennen bestehende um oder teilen sie auf.

Prüfen Sie Ihre eigene Website in etwa einer Minute

Die kostenlose Analyse misst die Punkte aus diesem Ratgeber für Ihre URL und zeigt, was Sie zuerst beheben sollten.