KI-Crawler
Automatisierter Webclient eines KI-Unternehmens für Modelltraining, KI-Suche oder von Nutzern angeforderte Abrufe.
Was ist KI-Crawler?
KI-Crawler sind automatisierte Clients, die Webseiten für unterschiedliche Zwecke abrufen: Modelltraining, Indexierung für die KI-Suche oder einen vom Nutzer ausgelösten Abruf. Dokumentierte Beispiele sind GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User und PerplexityBot. Eine Kontrollkennung in robots.txt ist nicht zwingend ein beobachtbarer HTTP-User-Agent. Google-Extended etwa steuert die KI-Nutzung von Inhalten, die andere Google-Crawler abgerufen haben, und darf nicht als eigener Besuch gezählt werden. Einem Crawler Zugriff zu erlauben, ermöglicht nur den Abruf; Indexierung, Training, Retrieval oder Zitate sind dadurch nicht garantiert.
So macht Qwairy das umsetzbar
Qwairy klassifiziert dokumentierte, beobachtbare KI-User-Agents in verbundenen Server-Logs. Crawler Analytics zeigt beobachtete Aufrufzahlen, erfasste Häufigkeit, Gruppen angeforderter Seiten, HTTP-Antworten und Grenzen der Datenabdeckung, ohne Kontrollkennungen aus robots.txt als Besuche zu zählen.
Häufig gestellte Fragen
Verwandte Begriffe
GPTBot
Webcrawler von OpenAI für Inhalte, die möglicherweise zum Training generativer KI-Modelle genutzt werden; unabhängig vom Such-Crawler OAI-SearchBot.
ClaudeBot
Webcrawler von Anthropic, der öffentliche Webinhalte zum Training und zur Verbesserung von Claude-Modellen sammelt; Websitebetreiber steuern den Zugriff über robots.txt.
ChatGPT-User
User-Agent, den OpenAI nutzt, wenn ChatGPT während eines Gesprächs Webseiten in Echtzeit abruft; anders als der Trainings-Crawler GPTBot.
OAI-SearchBot
Such-Crawler von OpenAI, der das Web für ChatGPT Search indexiert; getrennt von GPTBot für Training und ChatGPT-User für Live-Abrufe.
Google-Extended
Kontrollkennung in robots.txt, mit der Publisher festlegen, ob Google gecrawlte Inhalte zum Training und zur Fundierung seiner Gemini-KI-Modelle verwenden darf.
PerplexityBot
Webcrawler von Perplexity AI zum Indexieren und Abrufen von Inhalten für KI-Suchantworten in Echtzeit.
CCBot
Webcrawler von Common Crawl, der Daten für ein offenes Archiv von Web-Crawl-Daten sammelt.
robots.txt
Textdatei im Stammverzeichnis einer Website, die Crawlern anzeigt, welche Seiten sie erkunden oder meiden sollen.
llms.txt
Vorgeschlagenes Dateiformat für eine strukturierte Übersicht der Websiteinhalte, die LLMs das Verständnis erleichtern soll.
Retrieval Augmented Generation(RAG)
KI-Architektur, die vor dem Erzeugen einer Antwort relevante Informationen in Echtzeit aus externen Quellen abruft.
Unternehmen, das ein Sprachmodell oder eine KI-Plattform entwickelt und betreibt, etwa OpenAI, Anthropic oder Google.
Wenn ein KI-Modell sachlich falsche, erfundene oder irreführende Angaben als Wahrheit ausgibt.