CCBot
Rastreador web de Common Crawl que recopila datos para crear un repositorio abierto de datos de rastreo web.
¿Qué es CCBot?
CCBot (Common Crawl Bot) es el rastreador web que opera Common Crawl, una organización sin ánimo de lucro que mantiene un repositorio abierto de datos de rastreo web. Muchas empresas de IA e investigadores utilizan el conjunto de datos de Common Crawl para entrenar sus modelos, incluidos varios grandes modelos de lenguaje. Aunque CCBot no pertenece a ninguna empresa de IA, permitirlo implica que su contenido puede acabar en conjuntos de datos que varias organizaciones emplean para entrenar IA. El conjunto de datos de Common Crawl es uno de los mayores archivos web de acceso público.
Cómo lo hace accionable Qwairy
Qwairy puede clasificar las peticiones observadas de CCBot en los registros de servidor conectados. La observación confirma una petición, no la inclusión en un archivo, un conjunto de datos o un modelo concretos.
Preguntas frecuentes
Términos relacionados
Rastreador de IA
Cliente web automatizado que opera una empresa de IA para el entrenamiento de modelos, la búsqueda con IA o la recuperación solicitada por un usuario.
robots.txt
Archivo de texto situado en la raíz de un sitio web para indicar a los robots de indexación qué páginas pueden explorar y cuáles deben evitar.
GPTBot
Rastreador web de OpenAI para contenido que puede utilizarse en el entrenamiento de modelos de IA generativa, distinto del rastreador de búsqueda OAI-SearchBot.