CCBot
Robot web de Common Crawl qui collecte des données pour constituer un dépôt ouvert de données d’exploration du web.
Qu'est-ce que CCBot ?
CCBot (Common Crawl Bot) est le robot web exploité par Common Crawl, une organisation à but non lucratif qui maintient un dépôt ouvert de données d’exploration du web. De nombreuses entreprises IA et équipes de recherche utilisent ce jeu de données pour entraîner leurs modèles, notamment plusieurs grands modèles de langage. Même si CCBot n’appartient pas lui-même à une entreprise IA, l’autoriser signifie que votre contenu peut être inclus dans des jeux de données utilisés pour l’entraînement IA par plusieurs organisations. Le jeu de données Common Crawl est l’une des plus grandes archives web publiques.
Comment Qwairy permet de passer à l'action
Qwairy peut classer les requêtes CCBot observées dans les journaux serveur connectés. L’observation confirme une requête, pas l’inclusion dans une archive, un jeu de données ou un modèle particulier en aval.
Questions fréquentes
Termes associés
Robot d’exploration IA
Client web automatisé exploité par une entreprise IA pour l’entraînement de modèles, la recherche IA ou la récupération de contenu à la demande d’un utilisateur.
robots.txt
Fichier texte placé à la racine d’un site pour indiquer aux robots d’indexation quelles pages explorer ou éviter.
GPTBot
Robot web d’OpenAI qui collecte des contenus susceptibles de servir à l’entraînement de modèles d’IA générative, distinct du robot de recherche OAI-SearchBot.
Degré auquel les modèles d’IA reconnaissent une marque comme une entité distincte faisant autorité dans son domaine et lui accordent leur confiance.
Assistant conversationnel développé par OpenAI, fondé sur les modèles GPT.