Qwairy
Técnico

robots.txt

Ficheiro de texto na raiz de um site que indica aos robôs de indexação que páginas devem explorar ou evitar.

O que é robots.txt?

robots.txt é um padrão Web que permite aos proprietários dos sites comunicar regras aos crawlers. Indica que partes do site podem ou não ser exploradas. Em GEO, é fundamental configurá-lo para permitir que crawlers de IA, como GPTBot e ClaudeBot, acedam aos conteúdos, salvo se houver motivos legais ou estratégicos para os bloquear.

Como o Qwairy transforma isto em ação

A Qwairy analisa robots.txt para verificar a acessibilidade dos crawlers de IA. A análise confirma se GPTBot, ClaudeBot, Google-Extended e outros conseguem aceder aos conteúdos e identifica regras de bloqueio que possam impedir a visibilidade em IA.

Perguntas frequentes

Para a maioria das empresas, é preferível permiti-los. Bloqueá-los impede que os conteúdos apareçam em respostas de IA e dados de treino, tornando a marca praticamente invisível no ecossistema de pesquisa com IA. Bloqueie apenas por razões legais, como direitos de autor, competitivas, como dados proprietários, ou se pretender negociar acordos comerciais de licenciamento de IA. A opção inicial deve ser permitir, salvo motivo concreto em contrário.

Os principais incluem GPTBot (OpenAI/ChatGPT), Google-Extended (treino do Google Gemini), ClaudeBot (Anthropic), CCBot (Common Crawl, usado por muitas empresas de IA), PerplexityBot, OAI-SearchBot e Applebot-Extended. As plataformas GEO oferecem listas abrangentes e verificam a configuração de cada identificador no ficheiro robots.txt.

Não, as regras para crawlers de IA são separadas das dos crawlers de SEO tradicionais, como Googlebot e Bingbot. Pode bloquear o GPTBot sem afetar o Googlebot. Os AI Overviews dependem do rastreio normal do Google Search pelo Googlebot; bloquear Google-Extended não os remove desses resultados, apenas controla o treino e a fundamentação do Gemini. As plataformas GEO ajudam a equilibrar estas opções conforme a sua estratégia.
Partilhar: