Blog · GEO · 25.09.2026
Blog
GEO

KI-Crawler steuern:Training sperren,Sichtbarkeit behalten

GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended: Hinter jedem Namen steckt ein anderer Zweck. Hier lesen Sie, welcher Crawler was tut, wie Sie ihn in der robots.txt einzeln regeln und warum eine Firewall Ihre Entscheidung oft still überstimmt.

Direkt zur Anfrage
Anfrage
Nikolai Schöbel und Jeremias Burger, Co-Founder Scalableloops

Sprechen wir über Ihr Projekt.

Erst prüfen wir, ob das Vorhaben zu Ihrem Geschäftsmodell passt. Dann folgt ein Vorschlag mit Phasen und Aufwand.

KI-Crawler-Einstellungen prüfen lassen oder anrufen: +49 151 1576 5566
Blog · GEO

KI-Crawler steuern Sie in der robots.txt einzeln nach ihrem Zweck: Trainings-Crawler wie GPTBot oder ClaudeBot können Sie sperren, ohne die Such-Crawler wie OAI-SearchBot, Claude-SearchBot oder PerplexityBot auszuschließen, die über Ihre Sichtbarkeit in der KI-Suche entscheiden. Die großen Anbieter trennen heute zwischen Crawlern, die Inhalte für das Training von Modellen sammeln, Crawlern, die einen Suchindex aufbauen, und Abrufen, die ein Nutzer im Chat auslöst. Wer pauschal alles sperrt, was nach KI klingt, verschwindet aus den Antworten, in denen seine Kunden nach Anbietern fragen. Wer gar nichts regelt, gibt seine Inhalte ungefragt für das Training frei. Dazwischen liegt eine bewusste Entscheidung, die in wenigen Zeilen umgesetzt ist.

In Kürze
  • Training, Suche und Nutzerabruf laufen bei OpenAI, Anthropic und Perplexity über getrennte Crawler mit eigenem Namen.
  • Eigene Erhebung: Keine von 22 Mittelstands-Websites sperrt die Such-Crawler von ChatGPT, Claude oder Perplexity in der robots.txt.
  • Wer GPTBot sperrt, bleibt in der ChatGPT-Suche sichtbar, solange OAI-SearchBot zugelassen ist.
  • Google-Extended regelt nur die Nutzung für Gemini, nicht die Google-Suche und nicht die KI-Übersichten.
  • Firewalls und Bot-Schutz blockieren KI-Crawler oft, ohne dass die robots.txt davon etwas zeigt.
Veröffentlicht 25.09.2026Nikolai Schöbel und Jeremias BurgerLesezeit 9 min
Nikolai SchöbelJeremias Burger

Nikolai Schöbel und Jeremias Burger

Co-Founder der Scalableloops GmbH. Nikolai Schöbel verantwortet Online-Marketing und KI-Strategie, Jeremias Burger die KI-Architektur. Beide bauen und schulen KI-Systeme im eigenen Agenturalltag.

Auf dieser Seite
  1. Was sind KI-Crawler?
  2. Welche KI-Crawler gibt es und wofür werden sie eingesetzt?
  3. Was regelt Google-Extended und was nicht?
  4. Sollten Sie KI-Crawler blockieren oder zulassen?
  5. Wie sieht eine robots.txt für KI-Crawler aus?
  6. Sperren mittelständische Websites KI-Crawler überhaupt?
  7. Warum erreichen KI-Crawler Ihre Seite trotz freier robots.txt nicht?
  8. Wo stößt die robots.txt bei KI-Crawlern an Grenzen?
  9. Häufige Fragen
  10. So bringen Sie Ihre KI-Crawler-Regeln in Ordnung
  11. Woher die Angaben auf dieser Seite stammen
Begriff

Was sind KI-Crawler?

KI-Crawler sind automatische Programme, mit denen KI-Anbieter öffentlich erreichbare Webseiten abrufen. Sie funktionieren technisch wie der Googlebot: Sie fragen Seiten an, lesen den Inhalt und melden sich dabei mit einem eigenen Namen, dem sogenannten User-Agent. Über diesen Namen können Sie jedem Crawler in Ihrer robots.txt eigene Regeln geben.

Der entscheidende Unterschied liegt im Zweck. Ein Teil der Crawler sammelt Inhalte, die in das Training künftiger Sprachmodelle einfließen können. Ein anderer Teil baut einen Suchindex auf, aus dem ChatGPT, Claude oder Perplexity bei einer Frage aktuelle Quellen ziehen und verlinken. Ein dritter Teil ruft eine Seite nur dann ab, wenn ein Nutzer im Chat konkret danach fragt. Für Ihre Sichtbarkeit in KI-Antworten zählt vor allem der zweite Teil. Wie diese Sichtbarkeit insgesamt entsteht, beschreiben wir im Beitrag KI-SEO.

Überblick

Welche KI-Crawler gibt es und wofür werden sie eingesetzt?

Die folgende Übersicht fasst zusammen, was OpenAI, Anthropic, Perplexity und Google in ihrer eigenen Dokumentation über ihre Crawler schreiben (Stand 25.09.2026). Die Anbieter ändern diese Angaben gelegentlich, ein Blick in die jeweilige Originalseite vor jeder Änderung an Ihrer robots.txt lohnt sich.

Bei OpenAI gilt: Seiten, die OAI-SearchBot ausschließen, erscheinen laut OpenAI nicht in den Antworten der ChatGPT-Suche. Ein Ausschluss von GPTBot bedeutet dagegen, dass Inhalte nicht für das Training der Grundmodelle verwendet werden sollen. Anthropic beschreibt dieselbe Trennung: Wer ClaudeBot sperrt, schließt künftige Inhalte vom Training aus; wer Claude-SearchBot sperrt, verhindert die Indexierung für die Suche, was laut Anthropic die Sichtbarkeit in Suchergebnissen verringern kann. Perplexity betreibt nach eigener Aussage keinen Trainings-Crawler; PerplexityBot dient dazu, Websites in den Suchergebnissen von Perplexity anzuzeigen und zu verlinken.

CrawlerAnbieterZweckToken in der robots.txt
GPTBotOpenAITraining der GrundmodelleGPTBot
OAI-SearchBotOpenAISuchindex für die ChatGPT-SucheOAI-SearchBot
ChatGPT-UserOpenAIAbruf, wenn ein Nutzer in ChatGPT eine Seite anfordertChatGPT-User
ClaudeBotAnthropicTraining der Claude-ModelleClaudeBot
Claude-SearchBotAnthropicIndexierung für die Suche in ClaudeClaude-SearchBot
Claude-UserAnthropicAbruf auf Anfrage eines Claude-NutzersClaude-User
PerplexityBotPerplexitySuchindex, laut Anbieter kein TrainingPerplexityBot
Perplexity-UserPerplexityAbruf auf Anfrage eines NutzersPerplexity-User
Google-ExtendedGoogleNutzung für Training und Grounding von Gemini, kein eigener CrawlerGoogle-Extended
Google

Was regelt Google-Extended und was nicht?

Google-Extended ist ein Steuerzeichen in der robots.txt, kein eigener Crawler. Laut Google gibt es dafür keinen eigenen User-Agent, abgerufen wird mit den bekannten Google-Crawlern. Über Google-Extended legen Sie fest, ob Inhalte, die Google ohnehin abruft, für das Training künftiger Gemini-Modelle und für das Grounding in den Gemini-Apps verwendet werden dürfen.

Google schreibt ausdrücklich, dass Google-Extended weder die Aufnahme einer Website in die Google-Suche beeinflusst noch als Rankingsignal dient. Das gilt auch für die KI-Übersichten und den AI Mode, denn sie sind Teil der Google-Suche. Wer dort weniger von seinen Inhalten zeigen möchte, arbeitet laut Google mit den üblichen Steuerungen der Suche: nosnippet, data-nosnippet, max-snippet oder noindex. Eine eigene Schaltstelle nur für die KI-Funktionen gibt es nicht.

Die Folge in der Praxis: Eine Sperre von Google-Extended nimmt Ihnen keine Sichtbarkeit in der Google-Suche. Eine Sperre des Googlebot dagegen nimmt Ihnen die Suche insgesamt. Wie Google seine KI-Übersichten zusammenstellt, lesen Sie im Beitrag zu Google AI Overviews.

Entscheidung

Sollten Sie KI-Crawler blockieren oder zulassen?

Die Frage lässt sich nicht pauschal beantworten, sie lässt sich aber in zwei getrennte Entscheidungen zerlegen. Die erste betrifft das Training: Dürfen Ihre Inhalte in künftige Modelle einfließen? Die zweite betrifft die Sichtbarkeit: Wollen Sie in den Antworten der KI-Suche als Quelle auftauchen? Weil die Anbieter dafür getrennte Crawler betreiben, können Sie beides unabhängig voneinander beantworten.

Für Unternehmen, die über KI-Antworten gefunden werden wollen, ist die Suche die wichtigere der beiden Entscheidungen. Die Übersicht zeigt, welche Haltung zu welchem Ziel passt.

  1. 01

    01

    Sichtbar sein, Training erlauben

    Alle Crawler zulassen. Diese Haltung passt, wenn Ihre Inhalte ohnehin öffentlich werben sollen und Sie keinen Grund sehen, sie vom Training auszunehmen.

  2. 02

    02

    Sichtbar sein, Training ausschließen

    GPTBot, ClaudeBot und Google-Extended sperren, OAI-SearchBot, Claude-SearchBot und PerplexityBot zulassen. Diese Haltung passt, wenn Sie Ihre Texte schützen, aber in der KI-Suche genannt werden wollen.

  3. 03

    03

    Bestimmte Bereiche schützen

    Einzelne Verzeichnisse für alle KI-Crawler sperren, etwa Kundenbereiche, Preislisten für Händler oder interne Dokumente, den Rest freigeben. Für wirklich vertrauliche Inhalte reicht die robots.txt allerdings nicht, dazu unten mehr.

  4. 04

    04

    Ganz ausschließen

    Alle KI-Crawler sperren. Das ist eine bewusste Entscheidung mit Preis: Ihr Unternehmen fehlt dann als Quelle in den Antworten der KI-Suche, wenn Kunden dort nach Anbietern fragen.

Umsetzung

Wie sieht eine robots.txt für KI-Crawler aus?

Die Regeln stehen in Gruppen: Eine Zeile User-agent nennt den Crawler, darunter folgen Disallow und Allow. Für die Haltung „sichtbar sein, Training ausschließen“ sieht das so aus:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Ein Detail wird dabei oft übersehen. Nach dem Standard RFC 9309 und nach der Dokumentation von Google gilt für einen Crawler nur die Gruppe, die seinen Namen am genauesten trifft; alle anderen Gruppen, auch die mit User-agent: *, ignoriert er dann. Wenn Sie für alle Crawler bestimmte Verzeichnisse sperren und zusätzlich eine eigene Gruppe für OAI-SearchBot anlegen, müssen diese Sperren in der OAI-SearchBot-Gruppe erneut stehen. Sonst darf der Crawler genau dort hinein, wo Sie ihn ausschließen wollten.

Nach einer Änderung braucht es etwas Geduld: OpenAI nennt rund 24 Stunden, bis seine Systeme eine geänderte robots.txt berücksichtigen. Eine robots.txt ist übrigens nicht dasselbe wie eine llms.txt. Was diese zweite Datei leisten kann, lesen Sie im Beitrag llms.txt.

Eigene Erhebung

Sperren mittelständische Websites KI-Crawler überhaupt?

Keine der von uns untersuchten Websites sperrt die Crawler, mit denen ChatGPT, Claude oder Perplexity für ihre Suche Webseiten lesen. Crawler sind Programme, die Webseiten automatisch abrufen. Wir haben am 26.09.2026 die robots.txt von 22 Websites mittelständischer Betriebe geprüft. Die robots.txt ist eine kleine Datei auf der Website, die Crawlern sagt, welche Seiten sie abrufen dürfen. Ausgewertet haben wir sie nach dem Standard RFC 9309. Einfach gesagt: Nennt die Datei einen Crawler beim Namen, gelten für ihn diese Anweisungen, sonst die allgemeinen. Und die genaueste Regel hat Vorrang.

17 der 22 Websites haben eine robots.txt. Nur zwei davon nennen überhaupt einen KI-Crawler beim Namen, also ein Programm, mit dem KI-Dienste Webseiten lesen. Nur eine Website sperrt einen dieser Crawler: CCBot, den Crawler des Archivs Common Crawl. GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot und Google-Extended sind auf allen 22 Websites zugelassen. Meistens liegt das daran, dass die robots.txt sie gar nicht erwähnt.

Wenn ein KI-Dienst Ihre Seiten nicht abruft, liegt es nach dieser Untersuchung also eher nicht an der robots.txt. Deshalb lohnt der Blick auf Firewall und Bot-Schutz. Dazu mehr im nächsten Abschnitt.

Ein weiterer Befund: Sechs der 22 Websites bieten eine llms.txt an. Das ist eine Datei, die KI-Systemen eine kurze Übersicht über die wichtigsten Inhalte einer Website gibt. Eine dieser Dateien erstellt ein SEO-Plugin für WordPress automatisch. Was diese Datei leistet und was nicht, erklären wir im Beitrag llms.txt. Die Stichprobe ist nicht repräsentativ. Sie stammt aus unserem Kundenkreis und von Betrieben, deren Website wir für ein Angebot geprüft haben. Einen Teil davon betreuen wir selbst.

CrawlerZweckIn der robots.txt gesperrt
GPTBotTraining (OpenAI)auf keiner von 22
OAI-SearchBotSuche in ChatGPTauf keiner von 22
ChatGPT-UserAbruf auf Nutzerwunschauf keiner von 22
ClaudeBotTraining (Anthropic)auf keiner von 22
Claude-SearchBotSuche in Claudeauf keiner von 22
PerplexityBotSuche in Perplexityauf keiner von 22
Google-ExtendedNutzung für Geminiauf keiner von 22
CCBotWebarchiv Common Crawlauf einer von 22
Firewall

Warum erreichen KI-Crawler Ihre Seite trotz freier robots.txt nicht?

Die robots.txt ist nur eine Bitte an den Crawler. Ob er die Seite überhaupt erreicht, entscheiden vorher Firewall, Bot-Schutz und Hosting. Und dort stehen die Voreinstellungen immer öfter auf Sperren. Der Netzwerkdienstleister Cloudflare, über den nach eigener Angabe rund 20 Prozent des Webverkehrs laufen, blockiert KI-Crawler seit Juli 2025 für neu angelegte Domains standardmäßig; der Zugriff braucht dann eine ausdrückliche Erlaubnis.

Das Problem entsteht, wenn die Person, die über die Sichtbarkeit entscheidet, von dieser Einstellung nichts weiß. Die robots.txt sieht dann einwandfrei aus, der Such-Crawler von ChatGPT oder Claude wird aber schon an der Firewall abgewiesen. In der robots.txt ist davon nichts zu sehen. Klären Sie deshalb mit Ihrer Agentur oder Ihrem Hoster, welche Bot-Regeln aktiv sind und ob sie zwischen Trainings- und Such-Crawlern unterscheiden. Aufschlussreich sind außerdem die Zugriffsprotokolle des Servers: Tauchen OAI-SearchBot, Claude-SearchBot oder PerplexityBot dort mit Fehlercodes auf, ist die Ursache meist technisch und nicht inhaltlich.

Ob sich eine Freigabe auswirkt, zeigt nur die Messung über wiederholte Abfragen in den KI-Systemen. Wie Sie dabei vorgehen, beschreiben wir im Beitrag KI-Sichtbarkeit messen.

Aus unserer Praxis: Ein reiner Kennungstest reicht für diese Diagnose nicht. Bei einem Industriebetrieb haben wir acht Crawler-Kennungen an die Website geschickt, und alle acht wurden abgewiesen, auch Googlebot. Die Sperre zielte also nicht auf KI, sondern traf Crawler-Kennungen allgemein. Eine Anfrage, die sich nur als Crawler ausgibt, darf ein guter Bot-Schutz ohnehin abweisen. Ob die echten Crawler durchkommen, zeigen erst die Server-Logs oder die Einstellungen im Bot-Schutz selbst.

20 %

des Webverkehrs laufen nach eigener Angabe über Cloudflare, das KI-Crawler für neue Domains seit Juli 2025 standardmäßig blockiert.

Cloudflare, Pressemitteilung Juli 2025
Grenzen

Wo stößt die robots.txt bei KI-Crawlern an Grenzen?

Die robots.txt ist kein Zugangsschutz. Der Standard RFC 9309 sagt ausdrücklich, dass ihre Regeln keine Form der Zugangsberechtigung sind, und Google schreibt, dass die Datei das Verhalten eines Crawlers nicht erzwingen kann. Was wirklich vertraulich ist, gehört hinter ein Passwort, nicht hinter eine Zeile in der robots.txt.

Hinzu kommen die Abrufe, die ein Nutzer auslöst. OpenAI schreibt in seiner Dokumentation, dass für ChatGPT-User die Regeln der robots.txt möglicherweise nicht gelten, weil die Aktion von einem Menschen ausgeht; über die Aufnahme in die ChatGPT-Suche entscheidet ChatGPT-User nach OpenAI nicht. Perplexity gibt an, dass Perplexity-User die robots.txt in der Regel nicht beachtet. Anthropic dagegen erklärt, dass es die robots.txt respektiert, und nennt für Claude-User eine eigene Sperrmöglichkeit.

Auch bei den erklärten Crawlern gibt es Streit. Cloudflare warf Perplexity im August 2025 vor, bei Sperren auf nicht gekennzeichnete Crawler mit wechselnden Adressen auszuweichen; Perplexity wies die Vorwürfe zurück. Für Sie folgt daraus: Die robots.txt ist das richtige Werkzeug, um Ihren Willen gegenüber seriösen Anbietern zu erklären. Wer zusätzlich sicherstellen muss, dass Inhalte nicht abgerufen werden, braucht technische Sperren. Eine Einordnung Ihrer Einstellungen im Gesamtbild der KI-Sichtbarkeit erhalten Sie über unsere GEO-Agentur.

Häufige Fragen

Häufige Fragen

Sperren viele Unternehmen KI-Crawler?

In unserer Erhebung vom 26.09.2026 unter 22 Websites mittelständischer Betriebe sperrte keine einzige die Such-Crawler von ChatGPT, Claude oder Perplexity in der robots.txt, nur eine sperrte den Archiv-Crawler CCBot. Die Stichprobe stammt aus unserem Kundenkreis und ist nicht repräsentativ.

Was passiert, wenn ich GPTBot blockiere?

Laut OpenAI signalisiert eine Sperre von GPTBot, dass Ihre Inhalte nicht für das Training der Grundmodelle verwendet werden sollen. Ihre Sichtbarkeit in der ChatGPT-Suche hängt davon nicht ab, dafür ist OAI-SearchBot zuständig.

Verschwinde ich aus Google, wenn ich Google-Extended sperre?

Nein. Google schreibt, dass Google-Extended weder die Aufnahme in die Google-Suche beeinflusst noch als Rankingsignal dient. Die KI-Übersichten sind Teil der Google-Suche und werden über die üblichen Steuerungen wie nosnippet oder noindex geregelt.

Welche KI-Crawler sollte ich zulassen, um in KI-Antworten genannt zu werden?

Die Such-Crawler: OAI-SearchBot für die ChatGPT-Suche, Claude-SearchBot für Claude und PerplexityBot für Perplexity. OpenAI schreibt ausdrücklich, dass Seiten, die OAI-SearchBot ausschließen, nicht in den Antworten der ChatGPT-Suche erscheinen.

Reicht es, ClaudeBot zu sperren, um alle Anthropic-Crawler auszuschließen?

Nein. Anthropic betreibt ClaudeBot, Claude-SearchBot und Claude-User als getrennte Crawler mit eigenem Namen. Jeder braucht eine eigene Regel in der robots.txt.

Halten sich alle KI-Crawler an die robots.txt?

Nicht alle Abrufe. OpenAI schreibt, dass die Regeln für ChatGPT-User möglicherweise nicht gelten, und Perplexity gibt an, dass Perplexity-User die robots.txt in der Regel nicht beachtet, weil beide Abrufe von Nutzern ausgelöst werden. Die robots.txt ist außerdem grundsätzlich kein Zugangsschutz.

Wie schnell wirkt eine Änderung an der robots.txt?

OpenAI nennt rund 24 Stunden, bis seine Systeme eine geänderte robots.txt berücksichtigen. Wirkt eine Freigabe trotzdem nicht, lohnt ein Blick auf Firewall und Bot-Schutz.

Was jetzt

So bringen Sie Ihre KI-Crawler-Regeln in Ordnung

  1. 01

    Ziel festlegen

    Entscheiden Sie getrennt, ob Ihre Inhalte in das Training einfließen dürfen und ob Sie in der KI-Suche sichtbar sein wollen.

  2. 02

    robots.txt prüfen

    Rufen Sie Ihre robots.txt auf, prüfen Sie die Gruppen für GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot und Google-Extended und achten Sie darauf, dass allgemeine Sperren in jeder eigenen Gruppe wiederholt werden.

  3. 03

    Firewall klären

    Fragen Sie Hoster oder Agentur, welche Bot-Regeln in Firewall und CDN aktiv sind und ob sie Such-Crawler von KI-Diensten abweisen.

  4. 04

    Wirkung messen

    Prüfen Sie in den Zugriffsprotokollen, ob die Such-Crawler ankommen, und stellen Sie in den KI-Systemen wiederholt die Fragen Ihrer Kunden.

Die robots.txt ist schnell geändert. Schwieriger ist die Entscheidung davor: was Ihre Inhalte für das Training wert sind und was Sie die Sichtbarkeit in KI-Antworten kosten darf.

oder anrufen: +49 151 1576 5566

Weiterlesen
Quellen

Woher die Angaben auf dieser Seite stammen

Projekt-Detail

    Eigenes Projekt im Kopf?

    Wir antworten persönlich. Erst Use-Case-Prüfung, dann Architektur-Vorschlag.

    Eigene Anfrage starten