Der vollständige Leitfaden zurobots.txt und llms.txt für KI-Crawler
Lernen Sie, den Zugriff von KI-Crawlern auf Ihre Website zu steuern. Dieser umfassende Leitfaden reicht von der grundlegenden robots.txt-Konfiguration bis zur fortgeschrittenen Optimierung mit llms.txt für KI-Systeme.
Inhaltsverzeichnis
Was sind KI-Crawler?
KI-Crawler sind automatisierte Bots , die Webinhalte systematisch durchsuchen und indexieren, um große Sprachmodelle (LLM) und KI-Systeme mit Daten zu versorgen. Anders als klassische Suchmaschinen-Crawler, die vor allem Suchergebnisse indexieren, sammeln KI-Crawler Daten für Modelltraining, aktuellen Informationsabruf und KI-gestützte Antworten.
Diese Crawler erfüllen unterschiedliche Aufgaben: Manche sammeln Daten für das ursprüngliche Modelltraining, andere rufen aktuelle Informationen für KI-Antworten ab, wieder andere erstellen spezialisierte Datensätze. Jeder Crawler weist sich durch eine eigene User-Agent-Kennung aus. Über robots.txt können Websitebetreiber damit den Zugriff steuern. Wer diese Crawler versteht, kann die Präsenz seiner Inhalte im KI-Ökosystem besser verwalten.
Arten von KI-Crawlern
- Trainings-Crawler: Sammeln Daten für das Modelltraining, etwa GPTBot und ClaudeBot
- Such-Crawler: Indexieren Inhalte für KI-gestützte Suchmaschinen, etwa OAI-SearchBot, Claude-SearchBot und PerplexityBot
- Nutzerinitiierte Crawler: Rufen bestimmte Seiten auf Nutzeranfrage ab, etwa ChatGPT-User und Claude-User
- Datensatz-Crawler: Erstellen offene Datensätze für mehrere KI-Projekte, etwa Common Crawl
Die wichtigsten KI-Crawler im Überblick
Die Landschaft der KI-Crawler hat sich schnell entwickelt. Heute sind über 25 wichtige Crawler im Web aktiv. Auf Basis einer aktuellen Untersuchung von Ahrefs (rund 140 Millionen untersuchte Websites, Mai 2024) sehen Sie hier die wichtigsten KI-Crawler, ihre Sperrquoten und Aufgaben:
| Anbieter | Crawler-Name | Aufgabe | Sperrquote | Kategorie |
|---|---|---|---|---|
| OpenAI | GPTBot | Modelltraining für ChatGPT und GPT-Modelle | 5.89% | Training |
| OpenAI | ChatGPT-User | Seitenabruf auf Anfrage von ChatGPT-Nutzern | 5.64% | Nutzerinitiiert |
| Anthropic | ClaudeBot | Sammelt öffentliche Webinhalte zum Trainieren und Verbessern von Claude-Modellen | 5.74% | Training |
| Google-Extended | Indexierung für Gemini und weitere KI-Anwendungen über die Suche hinaus | 5.71% | Training | |
| Perplexity | PerplexityBot | Aufbau des Index für die KI-Suchmaschine Perplexity | 5.61% | Suche |
| Common Crawl | CCBot | Offener Datensatz für viele KI-Projekte | 5.85% | Datensatz |
Wichtige Erkenntnis: Seit Ende 2023 sind die Sperrquoten deutlich gestiegen. GPTBot wird mit 5,89 % am häufigsten gesperrt. Die Daten zeigen einen mäßigen Zusammenhang zwischen Crawler-Aktivität und Sperrquote: Aktivere Crawler werden tendenziell häufiger blockiert.
Branchenspezifische Sperrmuster
Das Sperrverhalten unterscheidet sich stark nach Branche:
Branchen mit den meisten Sperren
- Kunst und Unterhaltung: 45 % sperren den Zugriff
- Recht und Behörden: 42 % sperren den Zugriff
- Nachrichten und Medien: Häufige Sperren zum Schutz der Einnahmen
- Bücher und Literatur: Bedenken wegen des Urheberrechts
Gründe für Sperren
- Ethische Bedenken: Vorbehalte gegen die Nutzung als Trainingsdaten
- Schutz der Einnahmen: Konkurrenz durch KI verhindern
- Rechtliche Vorgaben: Fragen zu Urheberrecht und Lizenzen
- Ressourcenverbrauch: Hohe Crawling-Frequenz
Zahlen zur Entwicklung von Crawlern
Historischer Kontext: Die folgenden Zahlen stammen aus Studien von 2024 bis 2025 und beschreiben das damalige Crawler-Ökosystem, nicht den heutigen Stand.
Robots.txt optimieren
Mit Ihrer robots.txt-Datei steuern Sie als Erstes den Zugriff von KI-Crawlern. So richten Sie sie für verschiedene Szenarien ein:
1. Alle KI-Crawler zulassen (für die meisten Websites empfohlen)
Wer maximale KI-Sichtbarkeit anstrebt, kann allen KI-Crawlern den Zugriff erlauben. Wichtig: KI-Crawler sind beim Besuch Ihrer Website nicht standardmäßig gesperrt. Sie crawlen die Website, sofern Sie den Zugriff nicht ausdrücklich verbieten. Diese Konfiguration macht Ihre Freigabe eindeutig.
# robots.txt - Allow all AI crawlers (Factorized approach)
User-agent: *
Allow: /
# Major AI crawlers - explicit allowance for clarity
User-agent: GPTBot
User-agent: ChatGPT-User
User-agent: ClaudeBot
User-agent: Claude-Web
User-agent: PerplexityBot
User-agent: Google-Extended
Allow: /
# Sitemaps
Sitemap: https://yoursite.com/sitemap.xml
Sitemap: https://yoursite.com/ai-sitemap.xml2. Nur Trainings-Crawler sperren
# Block model training crawlers
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
Disallow: /
# Allow search and user-triggered crawlers
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
Allow: /
# Sitemaps
Sitemap: https://yoursite.com/sitemap.xml3. Zugriff gezielt steuern
# Selective access control for AI crawlers
User-agent: GPTBot
User-agent: ChatGPT-User
Allow: /blog/
Allow: /guides/
Disallow: /private/
Disallow: /admin/
User-agent: ClaudeBot
User-agent: Claude-Web
User-agent: PerplexityBot
Allow: /
Disallow: /api/
Disallow: /internal/
User-agent: Google-Extended
Allow: /blog/
Disallow: /
# Sitemaps
Sitemap: https://yoursite.com/sitemap.xml4. Sitemaps für KI optimieren
Ergänzend zu normalen Sitemaps können Sie eigene Sitemaps für KI-Crawler erstellen und sie zu Ihren wichtigsten Inhalten führen. So erkennen KI-Systeme die Struktur Ihrer Website und können relevante Seiten priorisieren.
<?xml version="1.0" encoding="UTF-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">
<!-- Priority content for AI crawlers -->
<url>
<loc>https://yoursite.com/about</loc>
<lastmod>2024-12-20</lastmod>
<priority>1.0</priority>
</url>
<url>
<loc>https://yoursite.com/products</loc>
<lastmod>2024-12-20</lastmod>
<priority>0.9</priority>
</url>
<url>
<loc>https://yoursite.com/blog/ai-guide</loc>
<lastmod>2024-12-20</lastmod>
<priority>0.8</priority>
</url>
</urlset>Bewährte Verfahren für robots.txt und Sitemaps
- Nach jedem User-agent eine Anweisung (Allow oder Disallow) angeben
- Crawler-Blöcke durch Leerzeilen trennen, damit die Datei übersichtlich bleibt
- Eigene KI-Sitemaps für besonders wichtige Inhalte erstellen
- Ihre robots.txt-Datei regelmäßig mit Validierungstools prüfen
- In Ihren Serverlogs nachsehen, welche Crawler Ihre Website tatsächlich besuchen
- Ihre robots.txt-Datei aktualisieren, wenn neue KI-Crawler hinzukommen
Eine llms.txt-Datei erstellen
Der llms.txt-Standard wurde im Herbst 2024 von Jeremy Howard (Mitgründer von Answer.AI) vorgeschlagen. Er sollte ein grundlegendes Problem lösen: Das Kontextfenster von KI-Systemen reicht oft nicht für ganze Websites aus. Zudem fällt es Sprachmodellen schwer, relevante Informationen aus HTML-Seiten mit Menüs, Skripten und Layout-Elementen zu extrahieren.
Ursprung und schnelle Verbreitung
Große Sprachmodelle stoßen bei umfangreichen Websites an Kontextgrenzen. Dazu kommt, dass sie relevante Inhalte aus komplexem HTML nur schwer herausfiltern können.
Die wichtigsten Hürden
- Begrenzte Kontextfenster von KI-Systemen
- Aufwendige Verarbeitung komplexer HTML-Strukturen
- Ablenkung durch Navigation und Layout
- Schwierigkeiten, zentrale Inhalte zu erkennen
Rasante Verbreitung
- November 2024: Einführung bei Mintlify
- Auf Tausenden Entwickler-Websites eingesetzt
- Bekannte Implementierungen: Anthropic, Cursor, Expo
- Tools und Verzeichnisse aus der Community entstanden
llms.txt und llms-full.txt im Vergleich
Der Standard sieht zwei Dateien vor, die sich für verschiedene Verarbeitungsaufgaben und Kontextgrenzen ergänzen:
llms.txt
Einfache Markdown-Datei als kommentierte Übersicht der Website, auf das Verständnis durch KI ausgelegt.
- Titel und Kurzbeschreibung des Projekts
- Thematisch geordnete Abschnitte mit ausgewählten Links
- Nur die wichtigsten Seiten
- Unter /llms.txt abrufbar
llms-full.txt
Umfassende Inhalte: die gesamte Dokumentation in einem klar strukturierten Markdown-Dokument.
- Vollständige Dokumentation
- Alle Seiten ohne störendes HTML
- Automatisch mit Tools generiert
- Unter /llms-full.txt abrufbar
Der Grundgedanke: llms.txt ist die Landkarte oder das Inhaltsverzeichnis, llms-full.txt das vollständige Buch. KI-Systeme mit kleinem Kontextfenster nutzen die Übersicht zur Orientierung; leistungsfähigere Systeme können den gesamten Inhalt verarbeiten. So bleibt innerhalb der verfügbaren Tokens möglichst viel nützliche Information zugänglich und die Inhalte können aktuell gehalten werden.
Zweck und Vorteile für KI-Systeme
Anders als klassische Suchmaschinen müssen KI-Systeme Inhalte einordnen, um Antworten zu formulieren. Diese Dateien machen Ihr Wissen strukturiert und für KI-Systeme leichter zugänglich.
Unmittelbare Vorteile
- Kontext effizient nutzen: Mit ausgewählten Inhalten innerhalb der Token-Grenzen bleiben
- Schneller erfassen: Eine klare Struktur erleichtert KI-Systemen das Verständnis
- Aktuelle Informationen: Die Dateien liegen auf Ihrer Website und lassen sich aktuell halten
- Bessere Zitierungen: KI-Systeme dazu anregen, Ihre Quellen zu verlinken
Praktische Anwendungen
- Entwicklertools: Integration mit ChatGPT und Claude per Datei-Upload
- IDE-Integration: Autovervollständigung in Cursor mit llms-full.txt
- Dokumentationsseiten: KI-freundlich aufbereitete technische Ressourcen
- SEO der Zukunft: Generative Engine Optimization (GEO)
Wichtig: Jeremy Howard betont, dass llms.txt für die Inferenz und die Unterstützung von Nutzern gedacht ist, nicht als Trainingsmaterial oder Benchmark für Modelle. Es soll KI-Systemen helfen, Nutzern in Echtzeit bessere Antworten zu geben.
llms.txt-Vorlage (Inhaltsverzeichnis)
# [Your Company Name]
> Brief description of your company and what you do.
## Core Pages
- [Home](https://yoursite.com/): Company overview and latest updates
- [About](https://yoursite.com/about): Company information and team
- [Products](https://yoursite.com/products): Main products and services
- [Pricing](https://yoursite.com/pricing): Pricing plans and options
## Resources
- [Documentation](https://yoursite.com/docs): Complete product documentation
- [Blog](https://yoursite.com/blog): Latest insights and updates
- [Case Studies](https://yoursite.com/case-studies): Customer success stories
- [FAQ](https://yoursite.com/faq): Frequently asked questions
## Support
- [Contact](https://yoursite.com/contact): Get in touch with our team
- [Support](https://yoursite.com/support): Help center and support resources
## Optional
- [Changelog](https://yoursite.com/changelog): Product updates and releases
- [Careers](https://yoursite.com/careers): Join our teamllms-full.txt-Vorlage (ausführliche Inhalte)
Die Datei llms-full.txt stellt KI-Systemen umfassende Informationen bereit, wenn sie mehr Kontext benötigen:
# [Your Company Name] - Complete Information
## Company Overview
**Company:** [Your Company Name]
**Website:** [Your Website URL]
**Industry:** [Your Industry]
**Founded:** [Year Founded]
**Location:** [Your Location]
**Mission:** [Your company mission statement]
## Products and Services
### Primary Products
- **[Product 1]:** [Detailed description, key features, target audience]
- **[Product 2]:** [Detailed description, key features, target audience]
- **[Product 3]:** [Detailed description, key features, target audience]
### Key Services
- **[Service 1]:** [Comprehensive description and benefits]
- **[Service 2]:** [Comprehensive description and benefits]
## Target Audience & Use Cases
**Primary Audience:** [Detailed description of your main customers]
**Secondary Audience:** [Additional customer segments]
**Common Use Cases:**
- [Use case 1]: [Detailed explanation]
- [Use case 2]: [Detailed explanation]
- [Use case 3]: [Detailed explanation]
## Key Features and Benefits
- **[Feature 1]:** [Detailed benefit description and impact]
- **[Feature 2]:** [Detailed benefit description and impact]
- **[Feature 3]:** [Detailed benefit description and impact]
## Competitive Advantages
- [Advantage 1]: [Explanation of how you're different/better]
- [Advantage 2]: [Explanation of how you're different/better]
## Contact Information
**General:** [Contact email]
**Sales:** [Sales email]
**Support:** [Support email]
**Phone:** [Phone number]
## Resources and Documentation
**Documentation:** [Link to comprehensive docs]
**API Reference:** [Link to API docs]
**Blog:** [Link to blog with detailed articles]
**Case Studies:** [Link to detailed customer stories]
**Whitepapers:** [Link to research and insights]
## Keywords and Topics
**Primary Keywords:** [keyword1, keyword2, keyword3]
**Secondary Keywords:** [keyword4, keyword5, keyword6]
**Topics We Cover:** [topic1, topic2, topic3, topic4]
**Industry Terms:** [term1, term2, term3]
## Recent Updates
**Last Updated:** [Current date]
**Recent Changes:** [Brief description of recent updates]Beispiel: llms.txt als Markdown-Inhaltsverzeichnis
Diese Markdown-Datei dient als „Inhaltsverzeichnis“, damit LLMs erkennen, welche Seiten sie zuerst lesen sollten:
Praxistipp: Erstellen Sie beide Dateien: llms.txt als kompaktes Inhaltsverzeichnis und llms-full.txt mit ausführlichen Inhalten. Legen Sie sie im Stammverzeichnis Ihrer Website ab und verweisen Sie in Ihrer Sitemap darauf. Die llms.txt-Datei zeigt LLMs, welche Seiten sie zuerst lesen sollten, und hilft ihnen, Werbung und Nebensächliches zu überspringen.
Schritt für Schritt zur Umsetzung
Schritt 1: Aktuelle Crawler-Aktivität prüfen
- Prüfen Sie Ihre Serverlogs auf Zugriffe von KI-Crawlern
- Testen Sie den aktuellen Zugriff mit Tools wie Knowatoa AI Search Console
- Ermitteln Sie, welche Crawler Ihre Website bereits besuchen
Schritt 2: robots.txt erstellen oder aktualisieren
- Wählen Sie eine Zugriffsstrategie: alle zulassen, gezielt auswählen oder einschränken
- Ergänzen Sie für jeden KI-Crawler eigene Anweisungen
- Testen Sie Ihre robots.txt-Datei mit Validierungstools
- Laden Sie die Datei ins Stammverzeichnis Ihrer Website hoch (yoursite.com/robots.txt)
Schritt 3: llms.txt-Dateien erstellen
- Nutzen Sie die Vorlagen aus Kapitel 4
- Erstellen Sie eine llms.txt-Datei mit einem kompakten Inhaltsverzeichnis
- Erstellen Sie bei Bedarf eine llms-full.txt-Datei mit ausführlichen Inhalten
- Laden Sie die Dateien ins Stammverzeichnis Ihrer Website hoch (yoursite.com/llms.txt und yoursite.com/llms-full.txt)
Schritt 4: Beobachten und überprüfen
- Verfolgen Sie die Crawler-Aktivität mit Monitoring-Tools
- Prüfen Sie regelmäßig anhand der Serverlogs, ob die Regeln eingehalten werden
- Testen Sie Ihre Konfiguration mit KI-Suchtools
- Passen Sie die Einstellungen an, wenn neue Crawler hinzukommen
Kurze Prüfliste
- ✅ robots.txt ist unter yoursite.com/robots.txt erreichbar
- ✅ llms.txt ist unter yoursite.com/llms.txt erreichbar
- ✅ Für alle wichtigen KI-Crawler gibt es ausdrückliche Anweisungen
- ✅ Die Serverlogs zeigen das erwartete Crawler-Verhalten
- ✅ KI-Suchtools können wie vorgesehen auf Ihre Inhalte zugreifen
Tools für Monitoring und Überprüfung
Überwachen Sie Ihre Einstellungen für KI-Crawler und verfolgen Sie Ihre Sichtbarkeit auf KI-Plattformen, um Ihre Strategie laufend zu verbessern.
KI-Sichtbarkeit verfolgen
Monitoring von Markenerwähnungen
- Erwähnungen in ChatGPT, Claude, Gemini und Perplexity verfolgen
- Häufigkeit und Platzierung von Zitierungen beobachten
- Sichtbarkeit der Wettbewerber analysieren
- Wöchentliche Leistungsberichte erstellen
Quellenzuordnung analysieren
- Erkennen, welche Seiten KI-Systeme zitieren
- Verweis-Traffic von KI-Plattformen verfolgen
- Leistung der Inhalte nach KI-Modell beobachten
- Suchanfragen den verwendeten Quellen zuordnen
Technische Überprüfung
Serverlogs auswerten
Zugriffe von KI-Crawlern in Ihren Serverlogs beobachten
- Besuche von GPTBot, ClaudeBot und PerplexityBot
- Muster bei der Crawling-Frequenz
- Gesperrte und erlaubte Anfragen
Erreichbarkeit der Dateien testen
Prüfen, ob Ihre KI-spezifischen Dateien erreichbar sind
- robots.txt validieren
- Erreichbarkeit von llms.txt prüfen
- Verfügbarkeit von Sitemap.xml prüfen
Auswirkungen auf die Leistung
Auswirkungen von KI-Crawlern auf Ihre Website verfolgen
- Bandbreitennutzung beobachten
- Serverlast analysieren
- Antwortzeiten verfolgen
Kurze Prüfliste
Erforderliche Dateien
- robots.txt - Unter /robots.txt erreichbar
- llms.txt - Inhaltsverzeichnis unter /llms.txt
- llms-full.txt - Vollständiger Inhalt unter /llms-full.txt
- sitemap.xml - Seitenstruktur unter /sitemap.xml
Konfiguration prüfen
- KI-Crawler in robots.txt richtig konfiguriert
- Sitemaps in robots.txt verlinkt
- Inhalte aktuell und korrekt
- Crawler-Aktivität in den Serverlogs sichtbar
Monitoring-Tools und Plattformen
Analyse und Tracking
- Google Analytics 4 für Verweis-Traffic von KI-Plattformen
- Google Search Console zur Überprüfung von Crawlern
- Bing Webmaster Tools für Erkenntnisse zu SearchGPT
- Eigene UTM-Parameter für das Tracking von KI-Traffic
Spezialisierte KI-Monitoring-Tools
- Plattformen zur Messung der KI-Sichtbarkeit
- Tools für das Monitoring von Markenerwähnungen
- Dashboards für die KI-Wettbewerbsanalyse
- KI-Antworten in Echtzeit beobachten
Wichtige Leistungskennzahlen
Bewährte Verfahren und Empfehlungen
Empfehlenswert ✅
- Für jeden Crawler ausdrückliche Anweisungen festlegen
- Ihre robots.txt-Datei übersichtlich und gut strukturiert halten
- Serverlogs regelmäßig auf Crawler-Aktivität prüfen
- Ihre Konfiguration aktualisieren, wenn neue Crawler hinzukommen
- Mit LLM.txt strukturierte Informationen über Ihre Marke bereitstellen
- Ihre Konfiguration mit mehreren Validierungstools testen
- Den geschäftlichen Nutzen jedes Crawlers berücksichtigen
Vermeiden ❌
- Sich bei KI-Crawlern allein auf „User-agent: *“ verlassen
- Alle Crawler sperren, ohne die Folgen zu bedenken
- Bei neuen Website-Bereichen die robots.txt-Datei unverändert lassen
- Serverlogs ignorieren, obwohl sie das tatsächliche Crawler-Verhalten zeigen
- Annehmen, dass alle Crawler robots.txt beachten; manche tun es nicht
- Übermäßig komplexe Regeln verwenden, die sich schwer pflegen lassen
Strategische Überlegungen
- Training oder Suche: Such-Crawler zulassen und Trainings-Crawler gegebenenfalls sperren
- Markensichtbarkeit: Erwähnungen durch KI können die Bekanntheit Ihrer Marke steigern
- Wettbewerbsvorteil: Wer früh optimiert, kann sich einen Vorsprung sichern
- Ressourcenverbrauch: Serverlast durch Crawler-Aktivität beobachten
- Rechtliche Vorgaben: Ihre Vorgehensweise mit Ihren Inhaltslizenzen abgleichen
Häufige Fehler vermeiden
- Alle KI-Crawler sperren, ohne die geschäftlichen Folgen abzuwägen
- Veraltete Crawler-Listen in robots.txt verwenden
- Das tatsächliche Crawler-Verhalten in den Serverlogs nicht verfolgen
- LLM.txt bei Änderungen an Unternehmensinformationen nicht aktualisieren
- robots.txt für die einzige Möglichkeit zur Steuerung des Crawler-Zugriffs halten
Künftige Trends und neue Entwicklungen
Das Umfeld für KI-Crawler verändert sich rasch. Mit diesen Entwicklungen ist in den nächsten Monaten und Jahren zu rechnen:
Neue agentenbasierte Crawler
- OpenAI Operator: Browserbasierter Agent (derzeit keine User-Agent-Kennung bekannt)
- Google Project Mariner: Agent für fortgeschrittene Webnavigation
- Anthropic Computer Use: Browser-Automatisierung mit Claude
- xAI Grok Crawler: Ziehen Sie die von xAI veröffentlichten Crawler-Anweisungen heran, um dokumentierte User-Agent-Kennungen und Zugriffsregeln zu prüfen. Gehen Sie weder von einem Startdatum noch von einer nicht dokumentierten Crawler-Identität aus.
Trends in der Branche
- Mehr Sperren auf Nachrichten- und Medien-Websites
- Ausgereiftere Verfahren zur Erkennung von Crawlern
- Wachsende Bedeutung von LLM.txt und strukturierten Daten
- Mögliche gesetzliche Regeln für den Zugriff von KI-Crawlern
- Mehr kostenpflichtige Lizenzvereinbarungen für Inhalte
Auf die Zukunft vorbereiten
- Flexible Systeme zur Steuerung von Crawlern einführen
- Entwicklungen in der Branche und Ankündigungen neuer Crawler verfolgen
- Den langfristigen Wert von KI-Sichtbarkeit gegen den Wunsch nach Kontrolle abwägen
- Klare Regeln für die Nutzung Ihrer Inhalte durch KI festlegen
- Rechtliche Entwicklungen zu KI und Urheberrecht verfolgen
Ausblick: Das Verhältnis zwischen Websites und KI-Crawlern wird sich weiter verändern. Entscheidend ist, Ihre Inhalte zu schützen und zugleich die Sichtbarkeit im KI-geprägten Web der Zukunft zu nutzen.
Warum die Steuerung von KI-Crawlern wichtig ist
Mehr Kontrolle
Genau steuern, welche KI-Systeme auf Ihre Inhalte zugreifen dürfen
KI-Sichtbarkeit
Ihre Inhalte für KI-Systeme und LLM optimieren
Bereit für morgen
Ihre Website auf das KI-geprägte Web von morgen vorbereiten
Quellen und weiterführende Literatur
- Ahrefs (2024): „Die KI-Bots, die rund 140 Millionen Websites am häufigsten sperren“ - Umfassende Analyse der Sperrmuster für KI-Crawler auf Millionen von Websites.
- ai-robots-txt GitHub (2024): „AI Robots.txt Repository“ - Von der Community gepflegte Liste mit KI-Crawlern und Sperrkonfigurationen.
- llmstxt.org: Offizielle llms.txt-Spezifikation - Vollständige Dokumentation und Hinweise zur Umsetzung des llms.txt-Standards.
- directory.llmstxt.cloud: llms.txt-Verzeichnis - Kuratiertes Verzeichnis von Unternehmen, die den llms.txt-Standard einsetzen.
Die ursprünglichen Zahlen wurden im Juni 2025 aus Studien von 2024 bis 2025 zusammengestellt und sind historische Werte. Die Rollen der Crawler und die Unterschiede bei der Zugriffskontrolle wurden im September 2026 überprüft. Diese Prüfung aktualisiert weder die Zahlen noch belegt sie aktuelle Sperrquoten.
Häufig gestellte Fragen
Praktische Antworten zu Crawler-Zugriff, robots.txt und der Pflege von llms.txt.