CCBot
Webcrawler von Common Crawl, der Daten für ein offenes Archiv von Web-Crawl-Daten sammelt.
Was ist CCBot?
CCBot (Common Crawl Bot) ist der Webcrawler von Common Crawl, einer gemeinnützigen Organisation mit einem offenen Archiv von Web-Crawl-Daten. Viele KI-Unternehmen und Forschende verwenden den Datensatz von Common Crawl zum Modelltraining, darunter mehrere große Sprachmodelle. CCBot gehört selbst keinem KI-Unternehmen. Wird er zugelassen, können Ihre Inhalte jedoch in Datensätze gelangen, die mehrere Organisationen für KI-Training nutzen. Der Common-Crawl-Datensatz zählt zu den größten öffentlich verfügbaren Webarchiven.
So macht Qwairy das umsetzbar
Qwairy kann beobachtete CCBot-Anfragen in verbundenen Server-Logs klassifizieren. Die Beobachtung bestätigt eine Anfrage, nicht die Aufnahme in ein bestimmtes Archiv, einen Datensatz oder ein nachgelagertes Modell.
Häufig gestellte Fragen
Verwandte Begriffe
KI-Crawler
Automatisierter Webclient eines KI-Unternehmens für Modelltraining, KI-Suche oder von Nutzern angeforderte Abrufe.
robots.txt
Textdatei im Stammverzeichnis einer Website, die Crawlern anzeigt, welche Seiten sie erkunden oder meiden sollen.
GPTBot
Webcrawler von OpenAI für Inhalte, die möglicherweise zum Training generativer KI-Modelle genutzt werden; unabhängig vom Such-Crawler OAI-SearchBot.
Automatischer Mechanismus, der bei erheblichen Veränderungen von Kennzahlen zur KI-Sichtbarkeit eine Benachrichtigung auslöst.
Von OpenAI entwickelter dialogbasierter Assistent auf Grundlage von GPT-Modellen.