GPTBot, ClaudeBot, PerplexityBot: Immer mehr KI-Crawler rufen deine Website ab. Ob du sie blockieren oder gezielt zulassen solltest, entscheidet über deine Sichtbarkeit in KI-Antworten – so triffst du die richtige Wahl.
Was sind KI-Crawler?
KI-Crawler sind automatisierte Programme, die Webseiten für KI-Systeme abrufen – entweder um Trainingsdaten für Sprachmodelle zu sammeln oder um Live-Antworten in KI-Suchen mit aktuellen Quellen zu belegen. Gesteuert werden sie wie klassische Suchmaschinen-Bots über die Datei robots.txt.
Der entscheidende Unterschied liegt im Zweck: Trainings-Crawler sammeln Inhalte für die Weiterentwicklung der Modelle. Such-Crawler bauen durchsuchbare Indizes für KI-Suchfunktionen auf. Und Live-Agenten rufen einzelne Seiten in dem Moment ab, in dem ein Nutzer eine Frage stellt. Wer pauschal alles blockiert, sperrt auch die Bots aus, die Kunden bringen könnten.
Welche KI-Crawler gibt es aktuell?
Die wichtigsten Bots und ihr Zweck im Überblick:
- GPTBot (OpenAI) – sammelt Trainingsdaten für die GPT-Modelle.
- OAI-SearchBot (OpenAI) – baut den Suchindex für die ChatGPT-Websuche auf. Wer hier blockiert, taucht in ChatGPT-Suchergebnissen nicht auf.
- ChatGPT-User (OpenAI) – ruft Seiten live ab, wenn ein ChatGPT-Nutzer eine Quelle öffnet oder eine Seite analysieren lässt.
- ClaudeBot (Anthropic) – Crawler für die Claude-Modelle.
- PerplexityBot (Perplexity) – Suchindex der KI-Suchmaschine Perplexity.
- Google-Extended (Google) – reines Opt-out-Signal für das Training der Gemini-Modelle. Beeinflusst weder Rankings noch AI Overviews.
- Applebot-Extended (Apple) – Opt-out für das Training von Apple-KI-Modellen.
- Meta-ExternalAgent (Meta) – Trainingsdaten für Metas KI-Modelle.
- CCBot (Common Crawl) – offenes Webarchiv, das viele KI-Anbieter als Trainingsquelle nutzen.
- Bytespider (ByteDance) – Trainings-Crawler des TikTok-Konzerns, ignoriert die robots.txt teilweise.
- Amazonbot (Amazon) – Crawler unter anderem für Alexa-Antworten.
Wie erkenne ich KI-Crawler in den Server-Logs?
Ob und wie oft KI-Bots deine Website besuchen, verraten die Zugriffs-Logs deines Hostings – zu finden im Hosting-Panel unter Begriffen wie Zugriffslogs, Access Logs oder Log-Dateien. Jede Zeile enthält den User-Agent; eine Suche nach GPTBot, ClaudeBot oder PerplexityBot zeigt dir sofort, welche Systeme sich für deine Inhalte interessieren.
Zwei Hinweise zur Einordnung: Erstens geben sich manche Scraper als bekannte Bots aus – die großen Anbieter veröffentlichen deshalb ihre offiziellen IP-Bereiche, gegen die sich Zugriffe verifizieren lassen. Zweitens lohnt ein Blick in die Einstellungen deines CDN- oder Sicherheitsanbieters: Einige Dienste wie Cloudflare bieten zentrale Schalter gegen KI-Crawler und blockieren sie teils standardmäßig. Wer sich wundert, dass trotz offener robots.txt kein KI-Bot vorbeikommt, findet die Ursache oft genau dort.
Was passiert beim Blockieren, was beim Zulassen?
Blockierst du Trainings-Crawler, fließen deine Inhalte nicht in künftige Modellversionen ein. Der Preis: Die Modelle kennen dein Unternehmen und deine Expertise nicht – und was ein Modell nicht kennt, kann es nicht empfehlen. Blockierst du Such- und Live-Bots wie OAI-SearchBot oder PerplexityBot, verschwindest du unmittelbar aus den KI-Suchergebnissen und verlierst Zitierungen samt der Besucher, die darüber kommen.
Lässt du die Crawler zu, werden deine Inhalte in KI-Antworten zitierbar. Für Dienstleister und Ratgeber-Websites überwiegt dieser Nutzen fast immer – die Inhalte sind ohnehin öffentlich und leben davon, gefunden zu werden. Anders kann es bei Verlagen oder Anbietern aussehen, deren Geschäftsmodell auf exklusiven Inhalten beruht.
Ein verbreiteter Irrtum: Wer Google-Extended blockiert, verschwindet aus den AI Overviews. Das stimmt nicht. Google-Extended steuert ausschließlich das Training der Gemini-Modelle. Ob deine Inhalte in AI Overviews und im AI Mode erscheinen, regelst du seit Juni 2026 getrennt davon über die Search generative AI control in der Search Console.
Welche robots.txt-Strategie passt zu KMU?
Für die meisten KMU lautet die Antwort: alle KI-Crawler zulassen. Sichtbarkeit in KI-Antworten ist ein Wettbewerbsvorteil, und Ratgeber-Inhalte sind genau das, was KI-Systeme zitieren. In diesem Fall musst du in der robots.txt nichts ändern – was nicht blockiert ist, ist erlaubt.
Wer differenzieren will, blockiert nur die reinen Trainings-Crawler und lässt Such- und Live-Bots zu:
User-agent: GPTBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: Bytespider Disallow: / User-agent: Meta-ExternalAgent Disallow: /
OAI-SearchBot, ChatGPT-User und PerplexityBot bleiben in diesem Beispiel bewusst unerwähnt und damit erlaubt – deine Website bleibt in ChatGPT-Suche und Perplexity sichtbar, ohne Trainingsdaten zu liefern.
Wie bearbeite ich die robots.txt in WordPress?
Mit Rank Math geht das ohne Serverzugriff: Unter Rank Math, Allgemeine Einstellungen, robots.txt bearbeiten fügst du die gewünschten Regeln ein. Prüfe das Ergebnis anschließend unter deiner-domain.de/robots.txt. Ergänzend lohnt sich eine llms.txt – sie ist das aktive Gegenstück zur robots.txt und weist KI-Systemen den Weg zu deinen wichtigsten Inhalten.
Wie spielen robots.txt und llms.txt zusammen?
Die beiden Dateien ergänzen sich: Die robots.txt regelt, welche Bots deine Website abrufen dürfen – sie ist das Türschild. Die llms.txt richtet sich an die Systeme, die hereindürfen, und weist ihnen den Weg zu deinen wichtigsten, zitierwürdigsten Inhalten – sie ist der Wegweiser im Haus. Eine sinnvolle Standard-Kombination für KMU: KI-Crawler in der robots.txt zulassen und gleichzeitig eine llms.txt pflegen, die auf die zentralen Ratgeber- und Leistungsseiten verweist. So maximierst du die Chance, dass KI-Systeme genau die Inhalte zitieren, die Anfragen bringen.
Und was ist mit AI Overviews und AI Mode?
Diese beiden steuerst du nicht über die robots.txt, sondern über einen eigenen Schalter: die Search generative AI control in der Google Search Console, die Google im Juni 2026 eingeführt hat. Sie kennt drei Zustände – Include (Standard), Exclude und die Vererbung von der übergeordneten Property – und wirkt auf Domain-, Subdomain- und URL-Präfix-Properties.
Der entscheidende Punkt: Google stellt ausdrücklich klar, dass diese Einstellung kein Ranking- oder Indexierungssignal ist. Deine klassischen Suchergebnisse und Snippets bleiben unberührt, auch wenn du dich aus den KI-Features abmeldest. Nach der Umstellung dauert es meist ein bis zwei Tage, bis die Inhalte verschwinden. Der Schalter wird noch schrittweise ausgerollt und ist längst nicht in jeder Property verfügbar – für die meisten KMU ist Exclude ohnehin die falsche Wahl, weil damit auch die Verweise aus KI-Antworten wegfallen.
Wirf vor der Entscheidung einen Blick in deine Server-Logs: Welche KI-Bots rufen deine Seiten heute schon ab und wie oft? Das zeigt dir, welche Systeme sich für deine Inhalte interessieren – und ob eine Regelung überhaupt akut ist.
Beachte außerdem: Die robots.txt ist eine freiwillige Konvention, kein technischer Schutz. Seriöse Anbieter halten sich daran, einzelne Bots wie Bytespider ignorieren sie nachweislich. Wer Inhalte wirklich schützen muss, braucht serverseitige Maßnahmen. Für die Sichtbarkeitsstrategie dahinter lohnt sich der Blick auf GEO und die Prüfung im Rahmen eines SEO-Audits. Wie gut deine Inhalte technisch erfasst werden können, klärt die Leistungsseite Technisches SEO.
- KI-Crawler haben drei Zwecke: Modell-Training, KI-Suchindizes und Live-Abrufe – pauschales Blockieren trifft alle drei.
- Wer Such-Bots wie OAI-SearchBot oder PerplexityBot aussperrt, verschwindet aus ChatGPT-Suche und Perplexity.
- Google-Extended betrifft nur das Gemini-Training; für AI Overviews und AI Mode gibt es seit Juni 2026 einen eigenen Schalter in der Search Console.
- Für die meisten KMU gilt: zulassen und von Zitierungen profitieren; differenzieren lässt sich über gezielte Trainings-Blocks.
- Die robots.txt ist freiwillig – echten Schutz bieten nur serverseitige Maßnahmen.
Häufige Fragen zu KI-Crawlern
Blockiert die robots.txt KI-Crawler zuverlässig?
Nein, sie ist eine freiwillige Konvention. Etablierte Anbieter wie OpenAI, Anthropic und Google halten sich daran, einzelne Crawler wie Bytespider ignorieren die Regeln jedoch. Wirklichen Schutz bieten nur serverseitige Sperren, etwa über die Firewall oder ein CDN.
Verliere ich Google-Rankings, wenn ich GPTBot blockiere?
Nein. GPTBot gehört zu OpenAI und hat mit der Google-Suche nichts zu tun. Deine Rankings bleiben unberührt – du verzichtest aber darauf, dass künftige GPT-Modelle deine Inhalte kennen und dein Unternehmen empfehlen können.
Wie halte ich meine Inhalte aus den AI Overviews heraus?
Über die Search generative AI control in der Search Console: Unter Einstellungen stellst du die Property von Include auf Exclude, womit deine Inhalte aus AI Overviews, AI Mode und den KI-Funktionen in Discover verschwinden. Laut Google ist das kein Ranking-Signal, klassische Ergebnisse und Snippets bleiben also erhalten. Die Umstellung greift meist binnen ein bis zwei Tagen.
Sollte ich als lokaler Dienstleister KI-Crawler blockieren?
In den allermeisten Fällen nicht. Lokale Dienstleister profitieren davon, wenn KI-Systeme sie bei Empfehlungsfragen nennen. Blockieren würde diese kostenlose Empfehlungsquelle abschneiden, ohne einen relevanten Vorteil zu bringen.