Crawler de IA
Cliente Web automatizado operado por uma empresa de IA para treino de modelos, pesquisa com IA ou recuperação de informação a pedido do utilizador.
O que é Crawler de IA?
Os crawlers de IA são clientes automatizados que solicitam páginas Web para fins distintos: treino de modelos, indexação para pesquisa com IA ou recuperação de informação iniciada por um utilizador. Exemplos documentados incluem GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User e PerplexityBot. Um identificador de controlo em robots.txt não é necessariamente um agente de utilizador HTTP observável: Google-Extended, por exemplo, controla a utilização pela IA da Google de conteúdos recolhidos por outros crawlers e não deve ser comunicado como visita separada. Autorizar um crawler apenas permite o acesso; não garante indexação, utilização no treino, recuperação nem citação.
Como o Qwairy transforma isto em ação
A Qwairy classifica agentes de utilizador de IA documentados e observáveis nos registos de servidor ligados. Crawler Analytics mostra totais de ocorrências observadas, frequência registada, grupos de páginas pedidos, respostas HTTP e limites de cobertura sem tratar identificadores de controlo em robots.txt como visitas.
Perguntas frequentes
Termos relacionados
GPTBot
Crawler Web da OpenAI para conteúdos que podem ser usados no treino de modelos de IA generativa, distinto do crawler de pesquisa OAI-SearchBot.
ClaudeBot
Crawler Web da Anthropic que recolhe conteúdos públicos para treinar e melhorar os modelos Claude; os proprietários dos sites controlam o seu acesso por robots.txt.
ChatGPT-User
Agente de utilizador que a OpenAI usa quando o ChatGPT obtém páginas Web em tempo real durante uma conversa, distinto do crawler de treino GPTBot.
OAI-SearchBot
Crawler de pesquisa da OpenAI que indexa a Web para o ChatGPT Search, separado do GPTBot para treino e do ChatGPT-User para navegação em direto.
Google-Extended
Identificador de controlo em robots.txt que permite aos editores decidir se a Google pode usar conteúdos rastreados para treinar e fundamentar os seus modelos de IA Gemini.
PerplexityBot
Crawler Web da Perplexity AI usado para indexar e recuperar conteúdos para respostas de pesquisa com IA em tempo real.
CCBot
Crawler Web da Common Crawl que recolhe dados para criar um repositório aberto de dados de rastreio da Web.
robots.txt
Ficheiro de texto na raiz de um site que indica aos robôs de indexação que páginas devem explorar ou evitar.
llms.txt
Formato de ficheiro proposto com um resumo estruturado dos conteúdos de um site para facilitar a compreensão pelos LLM.
Retrieval Augmented Generation(RAG)
Arquitetura de IA que recupera informação relevante de fontes externas em tempo real antes de gerar respostas.
Assistente de IA da Microsoft integrado no Windows, Edge, Bing e Microsoft 365, que combina pesquisa na web com IA conversacional.
Unidade de consumo usada para executar operações numa plataforma GEO, como gerar respostas ou realizar análises.