robots.txt
Ficheiro de texto na raiz de um site que indica aos robôs de indexação que páginas devem explorar ou evitar.
O que é robots.txt?
robots.txt é um padrão Web que permite aos proprietários dos sites comunicar regras aos crawlers. Indica que partes do site podem ou não ser exploradas. Em GEO, é fundamental configurá-lo para permitir que crawlers de IA, como GPTBot e ClaudeBot, acedam aos conteúdos, salvo se houver motivos legais ou estratégicos para os bloquear.
Como o Qwairy transforma isto em ação
A Qwairy analisa robots.txt para verificar a acessibilidade dos crawlers de IA. A análise confirma se GPTBot, ClaudeBot, Google-Extended e outros conseguem aceder aos conteúdos e identifica regras de bloqueio que possam impedir a visibilidade em IA.
Perguntas frequentes
Termos relacionados
Crawler de IA
Cliente Web automatizado operado por uma empresa de IA para treino de modelos, pesquisa com IA ou recuperação de informação a pedido do utilizador.
llms.txt
Formato de ficheiro proposto com um resumo estruturado dos conteúdos de um site para facilitar a compreensão pelos LLM.
GPTBot
Crawler Web da OpenAI para conteúdos que podem ser usados no treino de modelos de IA generativa, distinto do crawler de pesquisa OAI-SearchBot.
ClaudeBot
Crawler Web da Anthropic que recolhe conteúdos públicos para treinar e melhorar os modelos Claude; os proprietários dos sites controlam o seu acesso por robots.txt.
Acessibilidade para crawlers
Facilidade com que crawlers de motores de pesquisa e de IA, como GPTBot ou ClaudeBot, acedem, percorrem e indexam os conteúdos de um site.
Arquitetura de IA que recupera informação relevante de fontes externas em tempo real antes de gerar respostas.
Tom emocional ou atitude expressa numa resposta de IA acerca de uma marca, seja positivo, negativo ou neutro.