Wissen · Eigene Messung
GPTBot und ClaudeBot am Server gesperrt: 32 von 364 Websites weisen KI-Crawler ab, obwohl die robots.txt sie erlaubt
Von Linus Neumann, Newman Strategy · veröffentlicht am · Lesezeit 7 Minuten
32 von 364 geprüften Agentur-Websites weisen GPTBot oder ClaudeBot am Server ab, obwohl ihre robots.txt beiden den Zugang erlaubt. In der robots.txt selbst sperren nur 5 Websites GPTBot und 2 ClaudeBot. Wer nur diese Datei liest, sieht keine einzige der 32 Sperren.
Die wichtigsten Zahlen
- 364 Websites von Marketingagenturen geprüft, 161 mit GEO-Angebot und 203 mit Google-Ads-Angebot.
- 32 davon weisen GPTBot oder ClaudeBot am Server ab, das sind 8,8 Prozent.
- Bei 32 von 32 erlaubt die robots.txt den abgewiesenen Crawler.
- In der robots.txt sperren nur 5 von 362 Websites GPTBot vollständig, am Server weisen ihn 25 ab.
- ClaudeBot wird am Server 30-mal abgewiesen und in der robots.txt 2-mal gesperrt.
- 30 der 32 lassen die Crawler durch, die für Suche und Antworten abrufen.
- 16 der 32 bieten zugleich eine llms.txt an, eine Datei eigens für Sprachmodelle.
- Websites mit Apache-Server weisen ab in 17 von 80 Fällen, mit nginx in 3 von 96.
Zwei Stellen, an denen ein Crawler scheitern kann
Ein Crawler meldet sich bei jeder Anfrage mit einer Kennung, etwa GPTBot oder ClaudeBot. Bevor er Seiten abruft, liest er die robots.txt der Website. Dort steht, welche Bereiche er abrufen darf. Die Datei ist eine Bitte, keine Schranke.
Die Schranke sitzt eine Stufe tiefer, beim Server. Er sieht die Kennung und entscheidet, ob er die Seite ausliefert oder mit einem Fehlercode wie 403 Forbidden antwortet. Solche Regeln setzen Hoster, Firewalls, Sicherheitszusätze für Content-Management-Systeme und Dienste wie Cloudflare.
Beide Stellen können sich widersprechen. Die robots.txt lädt einen Crawler ein, der Server weist ihn ab. Wer nur die robots.txt prüft, hält die Website dann für offen.
Was die Server geantwortet haben
Die Startseiten der 364 Websites wurden am 18. September 2026 mit einer gewöhnlichen Browserkennung, mit einer neutralen Bot-Kennung und mit den Kennungen von acht KI-Crawlern abgerufen. Als abgewiesen zählt eine Website, wenn sie dem Browser mit 200 antwortet, die neutrale Bot-Kennung durchlässt und dem KI-Crawler einen Fehlercode schickt.
Eigene Messung, 364 Agentur-Websites, 18.09.2026
| Crawler | Zweck laut Anbieter | in der robots.txt gesperrt, von 362 | am Server abgewiesen | auswertbare Abrufe |
|---|---|---|---|---|
| ClaudeBot | Training | 2 | 30 | 335 |
| GPTBot | Training | 5 | 25 | 339 |
| OAI-SearchBot | Suche | 0 | 2 | 344 |
| PerplexityBot | Suche | 1 | 1 | 344 |
| Claude-SearchBot | Suche | 0 | 0 | 347 |
| ChatGPT-User | Abruf durch Nutzer | 0 | 1 | 347 |
| Claude-User | Abruf durch Nutzer | 0 | 0 | 347 |
| Perplexity-User | Abruf durch Nutzer | 1 | 0 | 346 |
Auswertbar ist ein Abruf, wenn Browser und neutrale Bot-Kennung eine Antwort mit 200 bekommen und der Crawlerabruf nicht an einer Ratenbegrenzung oder Zeitüberschreitung scheitert.
Am Server wird weit häufiger abgewiesen als in der robots.txt gesperrt. Bei GPTBot fünfmal so oft, 25 gegen 5, bei ClaudeBot fünfzehnmal so oft, 30 gegen 2.
Die beiden Gruppen überschneiden sich nicht. Keine Website sperrt einen Crawler in der robots.txt und weist ihn zusätzlich am Server ab. Wer die Sperre über den Server setzt, schreibt sie nicht in die robots.txt.
ClaudeBot trifft es häufiger als GPTBot. 23 Websites weisen beide ab, 7 nur ClaudeBot, 2 nur GPTBot.
Gesperrt wird das Training, nicht die Antwort
GPTBot und ClaudeBot sammeln laut OpenAI und Anthropic Inhalte, mit denen künftige Modelle trainiert werden. Für die Quellen in Suchantworten sind andere Crawler zuständig: bei OpenAI OAI-SearchBot, bei Anthropic Claude-SearchBot. Dazu kommen Abrufe, die ein Nutzer in ChatGPT, Claude oder Perplexity auslöst. OpenAI schreibt ausdrücklich, dass die Einstellungen für die einzelnen Crawler voneinander unabhängig sind.
30 der 32 Websites lassen alle Crawler für Suche und Nutzerabrufe durch. Sie weisen das Training ab und bleiben als Quelle erreichbar. Das deckt sich mit der robots.txt-Messung vom 31. August 2026, in der 35 Websites das Training sperrten und die Antworten offen ließen, keine einzige umgekehrt.
2 Websites weisen auch Suchcrawler ab. Beide schicken OAI-SearchBot einen Fehlercode, eine davon zusätzlich PerplexityBot und ChatGPT-User. Für OAI-SearchBot sind diese beiden Websites damit nicht abrufbar, während ihre robots.txt ihn zulässt. Eine Gegenprobe mit den Kennungen von Googlebot und Bingbot ergab bei beiden 200. Die Abweisung richtet sich also gezielt gegen den KI-Crawler.
Wo robots.txt und Server sich offen widersprechen
Die meisten der 32 Websites nennen KI-Crawler in der robots.txt gar nicht und erlauben sie damit über die allgemeine Regel. Bei einigen steht das Gegenteil der Serverregel ausdrücklich in der Datei.
| Befund | Websites |
|---|---|
| nennen GPTBot oder ClaudeBot namentlich, erlauben ihn und weisen ihn am Server ab | 5 |
| bieten eine llms.txt für Sprachmodelle an | 16 |
| nennen überhaupt einen KI-Crawler in der robots.txt | 7 |
| erklären einen Nutzungsvorbehalt über Content-Signal | 0 |
Die Hälfte der abweisenden Websites stellt Sprachmodellen eine eigene Datei bereit. 16 der 32 haben eine gültige llms.txt, also eine Übersicht in Markdown, die Sprachmodellen die Website erklären soll. Den Crawler von OpenAI oder Anthropic lassen sie trotzdem nicht auf die Startseite.
Wo die Sperre sitzt
Jeder Server nennt im Antwortkopf eine Kennung. Die Kennung zeigt nicht, wer die Regel gesetzt hat, aber wo sie greift.
| Serverkennung | Websites gesamt | davon weisen ab | Anteil |
|---|---|---|---|
| Apache | 80 | 17 | 21,3 % |
| Cloudflare | 82 | 8 | 9,8 % |
| nginx | 96 | 3 | 3,1 % |
| LiteSpeed | 14 | 1 | 7,1 % |
| andere oder keine Angabe | 92 | 3 | 3,3 % |
Gut jede fünfte Website mit Apache-Server weist KI-Crawler ab. Bei Apache lassen sich solche Regeln über die Datei .htaccess oder über serverweite Regelwerke des Hosters setzen. Ob die Betreiber die Sperre selbst eingerichtet haben, lässt sich von außen nicht feststellen.
Cloudflare bietet die Sperre mit einem Schalter an. Laut Cloudflare lässt sich das seit September 2024 mit einem Klick einrichten, und seit dem 1. Juli 2025 wird jede neu eingerichtete Domain gefragt, ob sie KI-Crawler zulassen will.
Nach Land und Angebot
| Gruppe | geprüft | weisen ab | Anteil |
|---|---|---|---|
| Schweiz | 48 | 8 | 16,7 % |
| Österreich | 95 | 10 | 10,5 % |
| Deutschland | 185 | 14 | 7,6 % |
| Frankreich, Belgien, Niederlande, Luxemburg | 36 | 0 | 0 % |
| Agenturen mit Google-Ads-Angebot | 203 | 22 | 10,8 % |
| Agenturen mit GEO-Angebot | 161 | 10 | 6,2 % |
Auch Agenturen, die Sichtbarkeit in KI-Antworten verkaufen, weisen KI-Crawler ab. 10 von 161 Websites mit GEO-Angebot schicken GPTBot oder ClaudeBot einen Fehlercode. Alle zehn lassen dabei die Crawler für Suche und Antworten durch.
So lässt sich die eigene Website prüfen
Die Prüfung dauert eine Minute und braucht nur ein Terminal. Die Startseite wird zweimal abgerufen, einmal als Browser und einmal mit der Kennung des Crawlers. Ausgegeben wird nur der Statuscode.
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 Chrome/128.0" https://www.example.com/
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; GPTBot/1.1; +https://openai.com/gptbot)" https://www.example.com/
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; ClaudeBot/1.0; +claudebot@anthropic.com)" https://www.example.com/
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.0; +https://openai.com/searchbot)" https://www.example.com/
Viermal 200 heißt: offen. Kommt beim Browser 200 und bei einem Crawler 403, 503 oder 510, weist der Server diesen Crawler ab. Die Ursache steht dann nicht in der robots.txt, sondern in der Konfiguration von Server, Hoster, Firewall oder Sicherheitszusatz.
Was das praktisch bedeutet
Erstens: Die robots.txt ist nur die halbe Auskunft. 32 Websites wirken nach ihrer robots.txt vollständig offen und sind es nicht. Wer die eigene Website prüft, prüft beide Stellen.
Zweitens: Eine Serversperre ist nicht falsch, aber sie sollte gewollt sein. Wer das Training ausschließen will, erreicht das auch über die robots.txt, sichtbar und nachvollziehbar. Eine Sperre, die ein Hoster oder ein Zusatz ungefragt setzt, bleibt dagegen oft unbemerkt.
Drittens: Auf die Suchcrawler achten. Wer OAI-SearchBot abweist, nimmt sich aus den Quellen der ChatGPT-Suche heraus. Bei 2 von 344 auswertbaren Websites war das der Fall, bei beiden gegen die eigene robots.txt.
Viertens: Nicht mit einer llms.txt ausgleichen. Eine Datei für Sprachmodelle hilft nicht, wenn der Server den Abruf verweigert. Laut Google braucht es für KI-Überblicke und den KI-Modus ohnehin keine eigenen Dateien für KI-Systeme.
Fünftens: Nach jedem Wechsel von Hoster, Firewall oder Sicherheitszusatz neu prüfen. Die Regeln kommen oft mit dem Paket und nicht mit einer Entscheidung.
Wie die übrigen Schritte zu mehr KI-Sichtbarkeit aussehen, steht im Ratgeber GEO-Optimierung. Wie wir Websites für Google und KI-Suche sichtbar machen, steht unter Leistungen: Sichtbarkeit.
Was diese Messung nicht zeigt
- Abgerufen wurde mit der Kennung der Crawler, nicht von ihren Adressen. Ein Server kann echte Crawler an ihren IP-Adressen erkennen und anders behandeln als eine Anfrage, die nur die Kennung trägt. Gemessen wurde, wie der Server auf die Kennung reagiert. Eine Regel, die nach der Kennung sperrt, trifft den echten Crawler genauso.
- 364 Agentur-Websites sind keine Zufallsstichprobe des Netzes. Die Websites stammen aus zwei Preiserhebungen zu GEO- und Google-Ads-Leistungen im September 2026.
- Geprüft wurde die Startseite. Regeln, die nur Unterseiten betreffen, fehlen.
- 17 Websites waren für die gezielte Prüfung nicht auswertbar. 10 wiesen im zweiten Abruf auch die neutrale Bot-Kennung ab, 7 antworteten nicht. Sechs dieser Websites wiesen im selben Abruf neben der neutralen Kennung auch die KI-Kennungen ab. Sie zählen nicht zu den 32, weil ihr Schutz sich nicht gezielt gegen KI-Crawler richtet.
- Ein Zeitpunkt. Abgerufen am 18. September 2026. Serverregeln können sich mit jedem Update ändern.
So wurde gemessen
Grundlage sind 364 Websites von Marketingagenturen: 161 mit GEO-Angebot aus Deutschland, Österreich, der Schweiz, Frankreich, Belgien, den Niederlanden und Luxemburg sowie 203 mit Google-Ads-Angebot aus Deutschland, Österreich und der Schweiz. Beide Listen stammen aus Preiserhebungen vom September 2026. Wo eine Agentur in beiden Listen stand, zählt sie einmal, in der GEO-Gruppe.
Je Website wurden die robots.txt und die Startseite über HTTPS abgerufen, mit höchstens fünf Weiterleitungen und 20 Sekunden Zeitlimit. Die Startseite wurde mit Browserkennung, neutraler Bot-Kennung und den Kennungen von GPTBot, ClaudeBot, OAI-SearchBot, PerplexityBot, Claude-SearchBot, ChatGPT-User, Claude-User und Perplexity-User abgerufen. Jede Website, die im ersten Abruf eine KI-Kennung abwies, wurde mit drei Sekunden Abstand ein zweites Mal geprüft, zusammen mit der neutralen Kennung. Alle 32 ergaben dasselbe Ergebnis.
Die robots.txt wurde nach RFC 9309 ausgewertet: Ein Crawler folgt der Gruppe mit seinem Namen, sonst der Gruppe für alle. Als gesperrt gilt ein Crawler, wenn die längste passende Regel die Startseite und beliebige Unterseiten verbietet. Bei gleich langen Regeln gewinnt die Erlaubnis.
Erhebung und Auswertung: Linus Neumann, Newman Strategy, September 2026. Alle Zahlen am 1. Oktober 2026 erneut aus den Rohdaten nachgerechnet.
Quellen
- OpenAI: Overview of OpenAI Crawlers, abgerufen am 18.09.2026, erneut geprüft 01.10.2026
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler?, abgerufen am 18.09.2026, erneut geprüft 01.10.2026
- Perplexity: Perplexity Crawlers, abgerufen am 18.09.2026
- Cloudflare: Cloudflare Just Changed How AI Crawlers Scrape the Internet-at-Large, 01.07.2025
- Google Search Central: AI features and your website, Stand 10.12.2025
- IETF: RFC 9309, Robots Exclusion Protocol, September 2022
Weiterlesen
- GEO-Optimierung: So wird deine Website in ChatGPT, KI-Überblicken und Perplexity gefunden
- 35 zu 0: Was 159 Websites den KI-Crawlern in der robots.txt erlauben
- llms.txt: Aufbau, Beispiel, Erstellen und was 206 Agentur-Dateien falsch machen
- KI-Sichtbarkeit in Zahlen: 51 geprüfte Statistiken
Häufige Fragen
Kann ein Server einen KI-Crawler sperren, obwohl die robots.txt ihn erlaubt?
Ja. Die robots.txt ist eine Bitte an den Crawler, der Server entscheidet selbst, wem er antwortet. In unserer Messung vom 18. September 2026 wiesen 32 von 364 Agentur-Websites GPTBot oder ClaudeBot mit einem Fehlercode wie 403 ab, obwohl ihre robots.txt beiden den Zugang erlaubte.
Wie lässt sich prüfen, ob der eigene Server GPTBot oder ClaudeBot abweist?
Die Startseite zweimal abrufen, einmal mit gewöhnlicher Browserkennung und einmal mit der Kennung des Crawlers, zum Beispiel mit curl und der Option -A. Antwortet der Server im ersten Fall mit 200 und im zweiten mit 403, 503 oder 510, weist er den Crawler ab. Die robots.txt zeigt eine solche Sperre nicht.
Wird eine Website in ChatGPT nicht mehr genannt, wenn ihr Server GPTBot sperrt?
Nicht unbedingt. Laut OpenAI dient GPTBot dem Training der Modelle, für die Quellen in der ChatGPT-Suche ist OAI-SearchBot zuständig, und beide Einstellungen sind voneinander unabhängig. In unserer Messung ließen 30 der 32 sperrenden Websites die Crawler für Suche und Nutzerabrufe durch.
Welcher KI-Crawler wird am Server am häufigsten abgewiesen?
ClaudeBot. Er wurde bei 30 von 335 auswertbaren Websites abgewiesen, das sind 9,0 Prozent. GPTBot bei 25 von 339, das sind 7,4 Prozent. 23 Websites wiesen beide ab, 7 nur ClaudeBot und 2 nur GPTBot.