Qwairy
Técnico

CCBot

Crawler Web da Common Crawl que recolhe dados para criar um repositório aberto de dados de rastreio da Web.

O que é CCBot?

O CCBot (Common Crawl Bot) é o crawler Web operado pela Common Crawl, uma organização sem fins lucrativos que mantém um repositório aberto de dados da Web. Muitas empresas de IA e investigadores usam o conjunto de dados da Common Crawl para treinar modelos, incluindo vários modelos de linguagem de grande dimensão. Embora o CCBot não pertença a uma empresa de IA, permitir o seu acesso significa que os seus conteúdos podem integrar conjuntos de dados usados por várias organizações para treino de IA. O conjunto de dados da Common Crawl é um dos maiores acervos Web públicos.

Como o Qwairy transforma isto em ação

A Qwairy pode classificar pedidos observados do CCBot nos registos de servidor ligados. A observação confirma um pedido, não a inclusão num repositório, conjunto de dados ou modelo posterior específico.

Perguntas frequentes

Sim, porque muitas organizações de IA para além da OpenAI e da Anthropic usam os dados da Common Crawl. Laboratórios, startups e instituições académicas treinam modelos com esses dados. Permitir o CCBot amplia a possível visibilidade em IA para além das maiores plataformas. Se a inclusão em conjuntos de dados abertos for uma preocupação, bloquear o CCBot impede que os conteúdos entrem neste repositório público amplamente utilizado.

A Common Crawl cria um repositório aberto e acessível a todos com dados da Web. Crawlers específicos de empresas, como GPTBot e ClaudeBot, recolhem dados exclusivamente para os respetivos modelos proprietários. Centenas de projetos de IA em todo o mundo usam dados da Common Crawl. O acesso do CCBot pode, por isso, ter um impacto mais amplo mas menos previsível: os seus conteúdos podem influenciar modelos de que nunca ouviu falar.

Não diretamente no ChatGPT, Claude ou Google AI, que usam os seus próprios crawlers. Contudo, muitas plataformas emergentes de IA, modelos de investigação e LLM de código aberto dependem dos dados da Common Crawl. Bloquear o CCBot pode significar perder oportunidades de visibilidade nessas plataformas em crescimento. Permita-o para maximizar a visibilidade de longo prazo no ecossistema de IA.
Partilhar: