CCBot
Crawler Web da Common Crawl que recolhe dados para criar um repositório aberto de dados de rastreio da Web.
O que é CCBot?
O CCBot (Common Crawl Bot) é o crawler Web operado pela Common Crawl, uma organização sem fins lucrativos que mantém um repositório aberto de dados da Web. Muitas empresas de IA e investigadores usam o conjunto de dados da Common Crawl para treinar modelos, incluindo vários modelos de linguagem de grande dimensão. Embora o CCBot não pertença a uma empresa de IA, permitir o seu acesso significa que os seus conteúdos podem integrar conjuntos de dados usados por várias organizações para treino de IA. O conjunto de dados da Common Crawl é um dos maiores acervos Web públicos.
Como o Qwairy transforma isto em ação
A Qwairy pode classificar pedidos observados do CCBot nos registos de servidor ligados. A observação confirma um pedido, não a inclusão num repositório, conjunto de dados ou modelo posterior específico.
Perguntas frequentes
Termos relacionados
Crawler de IA
Cliente Web automatizado operado por uma empresa de IA para treino de modelos, pesquisa com IA ou recuperação de informação a pedido do utilizador.
robots.txt
Ficheiro de texto na raiz de um site que indica aos robôs de indexação que páginas devem explorar ou evitar.
GPTBot
Crawler Web da OpenAI para conteúdos que podem ser usados no treino de modelos de IA generativa, distinto do crawler de pesquisa OAI-SearchBot.