Was sind KI-Crawler?
KI-Crawler wie GPTBot, ClaudeBot oder PerplexityBot lesen Websites für KI-Dienste. Wer wofür kommt und was eine Sperre in der robots.txt bewirkt.
Oleksandr Grygoriev · Aktualisiert:
- KI-CrawlerKI-Crawler
- Auswertung
- KI-Antwort
- Quelle genannt
Inhaltsverzeichnis
KI-Crawler sind automatische Programme von KI-Anbietern, die Websites abrufen, um Sprachmodelle zu trainieren oder Fragen von Nutzern mit aktuellen Inhalten zu beantworten. Bekannte Beispiele sind GPTBot von OpenAI, ClaudeBot von Anthropic und PerplexityBot.
Ob diese Bots Ihre Website lesen dürfen, entscheiden Sie in der robots.txt. Diese Entscheidung hat Folgen: Wer alle KI-Crawler aussperrt, schützt seine Inhalte vor dem Training, verschwindet aber oft auch aus den Antworten, die ChatGPT, Perplexity oder Claude ihren Nutzern geben.
Zwei Arten von KI-Crawlern
Wichtig ist die Unterscheidung nach Zweck. Die meisten Anbieter betreiben inzwischen getrennte Bots:
- Trainings-Crawler sammeln Texte, mit denen künftige Modelle trainiert werden. Was hier gelesen wird, fließt in das allgemeine Wissen eines Modells ein, ohne dass später ein Link auf Ihre Seite entsteht.
- Such- und Abruf-Crawler holen Inhalte in dem Moment, in dem ein Nutzer eine Frage stellt, oder bauen einen Suchindex für den KI-Dienst auf. Aus diesen Abrufen entstehen die Quellenangaben und Links in den Antworten.
Wer also nur das Training ausschließen, aber in KI-Antworten genannt werden möchte, sperrt gezielt die Trainings-Crawler und lässt die Abruf-Crawler zu.
Die wichtigsten KI-Crawler im Überblick
| User-Agent | Anbieter | Zweck |
|---|---|---|
| GPTBot | OpenAI | Training der Modelle |
| OAI-SearchBot | OpenAI | Suchfunktion von ChatGPT, Quellen in Antworten |
| ChatGPT-User | OpenAI | Abruf, wenn ein Nutzer eine Seite anfragt |
| ClaudeBot | Anthropic | Training der Modelle |
| Claude-SearchBot / Claude-User | Anthropic | Suche und Abruf für Antworten |
| PerplexityBot | Perplexity | Index für die Antwortmaschine |
| Google-Extended | Kein eigener Crawler, sondern ein Eintrag für die robots.txt: steuert die Nutzung für Gemini-Modelle | |
| Applebot-Extended | Apple | Eintrag für die robots.txt: steuert die Nutzung für Apples KI-Modelle |
| CCBot | Common Crawl | Offenes Webarchiv, das viele Modelle zum Training nutzen |
Google-Extended verdient eine Anmerkung: Es beeinflusst nicht, ob Ihre Seiten in der Google-Suche oder in den KI-Übersichten erscheinen. Dafür ist weiterhin der normale Googlebot zuständig. Ähnlich bei Microsoft: Copilot stützt sich auf den Suchindex von Bing, sodass hier der normale Bingbot entscheidend ist. Die Namen und Aufgaben der Bots ändern sich gelegentlich, maßgeblich sind die Dokumentationen der Anbieter.
KI-Crawler in der robots.txt erlauben oder sperren
Die Steuerung läuft über dieselben Regeln wie bei Suchmaschinen. Ein Beispiel, das das Training bei OpenAI und Common Crawl ausschließt, Such- und Abruf-Bots aber zulässt:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: *
Allow: /
Sitemap: https://www.example.de/sitemap.xmlZwei Punkte werden oft übersehen:
- Sperren wirken nur für Bots, die sich daran halten. Die großen Anbieter erklären, die robots.txt zu beachten. Ein technischer Schutz ist die Datei nicht.
- Nicht nur die robots.txt entscheidet. Firewalls, Bot-Schutz beim Hoster oder CDN-Einstellungen können KI-Crawler aussperren, ohne dass es in der robots.txt steht. So entsteht ein unbemerkter Blocker.
Was eine Sperre für die Sichtbarkeit bedeutet
Sperren Sie die Such- und Abruf-Crawler eines Dienstes, kann er Ihre Seiten bei Nutzerfragen nicht lesen und nicht verlinken. In den Antworten erscheinen dann andere Quellen, häufig Vergleichsportale oder Wettbewerber. Sperren Sie nur Trainings-Crawler, bleibt dieser Weg offen.
Umgekehrt gilt: Offen sein allein reicht nicht. Ein Bot, der Ihre Seite lesen darf, zitiert sie nur, wenn sie eine Frage klar beantwortet und die Angaben stimmen. Ergänzend kann eine llms.txt Sprachmodellen eine kurze Übersicht Ihrer Inhalte geben.
Serverlast und Kontrolle
Ein häufiger Grund für Sperren ist die Last auf dem Server. Einzelne Crawler rufen in kurzer Zeit sehr viele Seiten ab, was bei kleinen Hosting-Paketen spürbar werden kann. Statt pauschal alle KI-Bots auszuschließen, lohnt ein Blick in die Server-Logs: Welcher Bot verursacht wie viele Abrufe? Oft genügt es, einen einzelnen auffälligen Crawler zu begrenzen oder das Caching zu verbessern, während die übrigen weiter lesen dürfen. So bleibt die Website erreichbar, ohne dass Sie Sichtbarkeit verschenken.
Beispiele aus dem Mittelstand
- Die vergessene Zeile. Ein Unternehmen hat vor längerer Zeit alle unbekannten Bots gesperrt, um Serverlast zu senken. Seitdem sind auch alle KI-Crawler ausgeschlossen, und in KI-Antworten taucht das Unternehmen nie auf.
- Der Hoster entscheidet mit. Ein Bot-Schutz im Hosting-Paket blockiert KI-Crawler standardmäßig. Die robots.txt sieht einwandfrei aus, trotzdem kommt kein Abruf an.
- Bewusste Wahl. Ein Fachverlag sperrt Trainings-Crawler, weil seine Artikel sein Produkt sind, lässt Such-Crawler aber zu, damit Nutzer über die Quellenangabe auf seine Seite kommen.
In der Praxis: offen für die richtigen Bots
Im Technik-Check unserer Leistung KI-Sichtbarkeit prüfen wir, ob die Bots von OpenAI, Anthropic, Perplexity, Google und Microsoft Ihre Seiten lesen dürfen, in der robots.txt und auf Serverebene. Mit Ihnen legen wir fest, welche Nutzung Sie erlauben wollen, und setzen das sauber um. Danach messen wir, ob KI-Dienste Ihr Unternehmen bei den Fragen Ihrer Kunden nennen und verlinken.
Häufige Fragen
Sollte ich KI-Bots blockieren?
Das hängt vom Geschäftsmodell ab. Für die meisten Unternehmen, die Anfragen gewinnen wollen, lohnt es sich, zumindest die Such- und Abruf-Crawler zuzulassen. Wer mit Inhalten Geld verdient, sperrt häufig die Trainings-Crawler.
Wie sehe ich, ob KI-Crawler meine Website besuchen?
In den Server-Logs, anhand der User-Agents wie GPTBot oder PerplexityBot. Manche Hoster und CDN-Dienste zeigen Bot-Zugriffe auch in ihrer Oberfläche an.
Schadet das Blockieren von GPTBot meinem Google-Ranking?
Nein. GPTBot hat mit der Google-Suche nichts zu tun. Auch eine Sperre von Google-Extended wirkt sich nicht auf die Suchergebnisse aus.
Brauchen Sie Unterstützung?
Unsere Experten helfen Ihnen, die richtigen SEO- und Digitalstrategien für Ihr Unternehmen umzusetzen.
Erstgespräch vereinbarenWeitere Artikel im Wiki-Lexikon
Was ist llms.txt?
llms.txt ist eine Textdatei, die Sprachmodellen die wichtigsten Inhalte einer Website zeigt. Aufbau, Beispiel, Unterschied zu robots.txt und Grenzen.
Begriff öffnenWas ist der Google AI Mode?
Der Google AI Mode beantwortet Suchanfragen im Dialog mit KI. Was ihn von AI Overviews unterscheidet und was er für Klicks und Sichtbarkeit bedeutet.
Begriff öffnenWas ist Robots.txt?
Die robots.txt steuert, was Crawler lesen dürfen. Syntax, fertige Beispiele für gängige Systeme, typische Fehler, Unterschied zu noindex und KI-Crawler.
Begriff öffnenWas ist das Crawl-Budget?
Das Crawl-Budget ist die Zahl der Seiten, die Google in einem Zeitraum abruft. Wann es zählt, was es verschwendet und wie Sie es optimieren.
Begriff öffnen