Qwairy
Técnico

robots.txt

Archivo de texto situado en la raíz de un sitio web para indicar a los robots de indexación qué páginas pueden explorar y cuáles deben evitar.

¿Qué es robots.txt?

El archivo robots.txt es un estándar web que permite a los propietarios de sitios comunicarse con los robots de indexación (rastreadores). Indica qué partes del sitio pueden explorarse y cuáles no. En el contexto del GEO, resulta determinante configurar robots.txt para permitir que los rastreadores de IA (GPTBot, ClaudeBot, etc.) accedan a su contenido, salvo que tenga motivos legales o estratégicos para bloquearlos.

Cómo lo hace accionable Qwairy

Qwairy analiza su archivo robots.txt para verificar la accesibilidad de los rastreadores de IA. Nuestro análisis de rastreabilidad comprueba si GPTBot, ClaudeBot, Google-Extended y otros rastreadores pueden acceder a su contenido, e identifica las reglas de bloqueo que podrían impedir su visibilidad en la IA.

Preguntas frecuentes

En la mayoría de los casos, conviene permitirlos. Bloquearlos impide que su contenido aparezca en las respuestas de IA y en los datos de entrenamiento, lo que le vuelve prácticamente invisible en el ecosistema de la búsqueda con IA. Bloquéelos solo si tiene preocupaciones legales (contenido con derechos de autor), competitivas (datos propios) o si quiere negociar acuerdos comerciales de licencia de IA. Por defecto, permita el acceso salvo que tenga motivos concretos para no hacerlo.

Los principales agentes de usuario son GPTBot (OpenAI/ChatGPT), Google-Extended (entrenamiento de Google Gemini), ClaudeBot (Anthropic), CCBot (Common Crawl, utilizado por muchas empresas de IA), PerplexityBot, OAI-SearchBot y Applebot-Extended. Las plataformas GEO ofrecen listas completas y comprueban si cada uno está bien configurado en su archivo robots.txt.

No, las reglas de los rastreadores de IA son independientes de las de los rastreadores SEO tradicionales (Googlebot, Bingbot). Puede bloquear GPTBot sin afectar a Googlebot. Tenga en cuenta que las AI Overviews se alimentan del rastreo estándar de la Búsqueda de Google (Googlebot), de modo que bloquear Google-Extended no le excluye de ellas; solo controla el entrenamiento y la fundamentación de Gemini. Las plataformas GEO ayudan a equilibrar estas decisiones analizando qué rastreadores permitir o bloquear según su estrategia.
Compartir: