KI-Crawler sperren: Website vor KI-Training schützen
KI-Crawler sperren können Sie mit wenigen Zeilen in der robots.txt Ihrer Website. Viele Anbieter durchsuchen das Netz, um Trainingsdaten zu sammeln oder Antworten mit aktuellen Quellen zu belegen. Ob Sie das zulassen, ist eine Abwägung zwischen Schutz Ihrer Inhalte und Sichtbarkeit in KI-Antworten.
Die wichtigsten KI-Crawler
| Name (User-Agent) | Anbieter | Zweck |
|---|---|---|
| GPTBot | OpenAI | Training |
| OAI-SearchBot | OpenAI | Suche in ChatGPT |
| ClaudeBot | Anthropic | Training |
| Claude-SearchBot | Anthropic | Suche in Claude |
| Google-Extended | Steuert die Nutzung für Gemini-Training, kein eigener Crawler | |
| Applebot-Extended | Apple | Steuert die Nutzung für Apples KI-Training |
| PerplexityBot | Perplexity | Suche und Antworten |
| CCBot | Common Crawl | Offenes Webarchiv, oft für Training genutzt |
| meta-externalagent | Meta | Training |
Die Liste ändert sich laufend; die Anbieter dokumentieren ihre Crawler auf ihren Websites.
So sieht die robots.txt aus
User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: /
Damit verbieten Sie das Training, lassen aber normale Suchmaschinen wie den Googlebot weiter zu. Die Suchcrawler der KI-Anbieter (OAI-SearchBot, Claude-SearchBot) können Sie getrennt erlauben, wenn Sie in KI-Antworten als Quelle auftauchen wollen.
Was die Sperre rechtlich bewirkt
In Deutschland erlaubt § 44b des Urheberrechtsgesetzes das automatisierte Auswerten von Inhalten (Text und Data Mining), solange der Rechteinhaber nicht in maschinenlesbarer Form widersprochen hat. Ein Eintrag in der robots.txt gilt als ein solcher Vorbehalt; zusätzlich empfiehlt sich ein Hinweis im Impressum oder in den Nutzungsbedingungen. Mehr dazu in KI und Urheberrecht.
Grenzen
- Die robots.txt ist eine Bitte, keine technische Sperre. Seriöse Anbieter halten sich daran, nicht alle tun es.
- Bereits gesammelte Inhalte werden nicht nachträglich entfernt.
- Wer zuverlässig sperren will, blockiert bekannte Crawler zusätzlich auf Server- oder CDN-Ebene. Anbieter wie Cloudflare bieten das als Einstellung an.
Sperren oder nicht?
Für Verlage und Anbieter exklusiver Inhalte ist das Sperren der Trainings-Crawler meist sinnvoll. Wer gefunden werden will, etwa Shops, Dienstleister oder Ratgeber-Seiten, profitiert dagegen davon, in KI-Antworten genannt zu werden. Ein häufiger Kompromiss: Training sperren, Such-Crawler erlauben.
Erstellt mit Unterstützung von KI, geprüft und redaktionell verantwortet von Leon Blatz. Allgemeine Information, keine Rechts-, Steuer- oder Finanzberatung.