KI-Crawler sind automatisierte Programme von KI-Anbietern, die Webseiten abrufen und deren Inhalte für Sprachmodelle nutzbar machen. Sie funktionieren technisch ähnlich wie klassische Suchmaschinen-Crawler, verfolgen jedoch teils andere Zwecke: Neben dem Aufbau eines durchsuchbaren Index dienen sie dem Sammeln von Trainingsdaten und dem Abruf aktueller Inhalte während laufender Nutzeranfragen. Für die generative Sichtbarkeit einer Website sind KI-Crawler die technische Grundvoraussetzung – was sie nicht abrufen können, kann in KI-Antworten nicht erscheinen.
Arten von KI-Crawlern
Die Unterscheidung nach Zweck ist entscheidend, weil sie über die Folgen einer Blockade bestimmt:
- Trainings-Crawler – sammeln Inhalte für das Training künftiger Modellgenerationen. Eine Blockade verhindert die Aufnahme ins Modellwissen, nicht aber die Sichtbarkeit in der KI-Suche.
- Such- und Index-Crawler – bauen den Index auf, aus dem KI-Suchsysteme ihre Antworten speisen. Eine Blockade entfernt die Website aus den KI-Antworten.
- Abruf-Crawler (On-Demand) – rufen eine einzelne Seite in dem Moment ab, in dem ein Nutzer danach fragt oder eine URL nennt.
Diese Trennung wird in der Praxis häufig übersehen. Wer pauschal alle KI-Bots aussperrt, um sich dem Modelltraining zu entziehen, schließt sich zugleich aus den KI-Suchergebnissen aus.
Bekannte Crawler
Die gängigen User-Agents (Stand 2026):
- GPTBot (OpenAI) – Training
- OAI-SearchBot (OpenAI) – Index für ChatGPT Search
- ChatGPT-User (OpenAI) – Abruf auf Anfrage
- ClaudeBot, Claude-SearchBot, Claude-User (Anthropic) – Training, Index und Abruf
- Google-Extended (Google) – Steuerungstoken für Gemini- und Vertex-Training; wirkt sich nicht auf das Ranking in der Google-Suche aus
- Googlebot (Google) – klassischer Such-Crawler; speist auch AI Overviews
- PerplexityBot, Perplexity-User (Perplexity) – Index und Abruf
- Applebot-Extended (Apple) – Training für Apple Intelligence
- meta-externalagent (Meta), Amazonbot (Amazon), Bytespider (ByteDance)
- CCBot (Common Crawl) – offenes Webarchiv, das als Datenquelle für zahlreiche Modelle dient
Die Liste verändert sich laufend; Anbieter führen neue Tokens ein und benennen bestehende um. Eine regelmäßige Prüfung der eigenen Konfiguration gegen die offizielle Dokumentation der Anbieter ist daher sinnvoll.
Steuerung
robots.txt
Die robots.txt ist das übliche Mittel, um den Zugriff einzelner Crawler zu erlauben oder zu untersagen. Dabei sind mehrere Punkte zu beachten:
- Exakte User-Agents ansprechen – viele KI-Crawler befolgen ausschließlich Regeln, die ihren genauen Token nennen, und ignorieren die Wildcard-Gruppe
User-agent: * - Google-Extended nicht mit Googlebot verwechseln – das Blockieren des falschen Tokens führt entweder dazu, dass das KI-Training weiterläuft, oder zur ungewollten Deindexierung aus der Suche
- Bingbot beachten – eine Blockade betrifft sowohl die Bing-Suche als auch Microsoft Copilot
- robots.txt ist kein Schutzmechanismus – sie ist eine Verhaltensempfehlung. Crawler, die sie ignorieren, werden dadurch nicht aufgehalten
Weitere Maßnahmen
- Firewall- und WAF-Regeln – blockieren auf Netzwerkebene; einige Anbieter veröffentlichen ihre IP-Bereiche zur Verifizierung
- Meta-Tags und HTTP-Header – seitenweise Steuerung, etwa über
noindex - llms.txt – ein vorgeschlagenes, bislang nicht standardisiertes Format, das KI-Systemen strukturierte Hinweise auf die wichtigsten Inhalte einer Website geben soll
- Anbieterseitige Opt-outs – teils über Konten oder Formulare der jeweiligen Anbieter
Serverlast
KI-Crawler verursachen inzwischen einen erheblichen Anteil des gesamten Bot-Traffics, wobei das Crawling zu Trainingszwecken den größten Teil ausmacht. Für Websitebetreiber kann dies zu spürbarer Serverlast führen, insbesondere bei großen Seitenbeständen oder ressourcenintensiven Anwendungen.
Gängige Gegenmaßnahmen sind Rate Limiting, Caching sowie der gezielte Ausschluss einzelner Crawler mit geringem strategischen Nutzen. Einige Hosting- und CDN-Anbieter stellen hierfür eigene Steuerungsfunktionen bereit.
Praktische Empfehlungen
- Bestandsaufnahme – prüfen, welche KI-Crawler die eigene
robots.txtderzeit zulässt oder blockiert; oft bestehen historisch gewachsene Regeln, deren Wirkung niemandem bewusst ist - Bewusste Entscheidung treffen – Such-Crawler zulassen, wenn Sichtbarkeit in KI-Antworten gewünscht ist; Trainings-Crawler gesondert bewerten
- Zugänglichkeit sicherstellen – Inhalte hinter Logins, Paywalls oder ausschließlich clientseitigem Rendering werden häufig nicht erfasst
- Logfiles auswerten – Serverprotokolle zeigen, welche Crawler tatsächlich zugreifen und in welchem Umfang
- Konfiguration dokumentieren – Änderungen an der
robots.txtnachvollziehbar festhalten, um ungewollte Sichtbarkeitsverluste zu vermeiden
Rechtliche und wirtschaftliche Debatte
Die Nutzung von Webinhalten für das Training kommerzieller Modelle ist umstritten. Verlage und Rechteinhaber kritisieren, dass Inhalte verwertet werden, ohne dass Besuche oder Vergütungen entstehen; mehrere Verfahren sind anhängig. Parallel entstehen Modelle, bei denen der Zugriff durch KI-Crawler lizenziert oder kostenpflichtig gestaltet wird.
Der rechtliche Rahmen ist in Bewegung. Für Websitebetreiber im deutschsprachigen Raum sind insbesondere die Regelungen zum Text- und Data-Mining sowie ein maschinenlesbar erklärter Nutzungsvorbehalt relevant.
