Rastreador de IA
Cliente web automatizado que opera una empresa de IA para el entrenamiento de modelos, la búsqueda con IA o la recuperación solicitada por un usuario.
¿Qué es Rastreador de IA?
Los rastreadores de IA son clientes automatizados que solicitan páginas web con distintas finalidades: entrenar modelos, indexar para la búsqueda con IA o recuperar información a petición de un usuario. Algunos ejemplos documentados son GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, Claude-User y PerplexityBot. Un token de control de robots.txt no es necesariamente un agente de usuario HTTP observable: Google-Extended, por ejemplo, controla el uso que Google hace con IA del contenido obtenido por otros rastreadores y no debe contabilizarse como una visita aparte. Permitir un rastreador solo autoriza el acceso; no garantiza la indexación, el uso para entrenamiento, la recuperación ni la citación.
Cómo lo hace accionable Qwairy
Qwairy clasifica los agentes de usuario de IA documentados y observables en los registros de servidor conectados. El análisis de rastreadores muestra los totales de apariciones observadas, la frecuencia conservada, los grupos de páginas solicitadas, las respuestas HTTP y las advertencias de cobertura, sin tratar los tokens de control de robots.txt como visitas.
Preguntas frecuentes
Términos relacionados
GPTBot
Rastreador web de OpenAI para contenido que puede utilizarse en el entrenamiento de modelos de IA generativa, distinto del rastreador de búsqueda OAI-SearchBot.
ClaudeBot
Rastreador web de Anthropic que recopila contenido web público para entrenar y mejorar los modelos Claude; los propietarios de sitios controlan su acceso mediante robots.txt.
ChatGPT-User
Agente de usuario que emplea OpenAI cuando ChatGPT obtiene páginas web en tiempo real durante una conversación, distinto del rastreador de entrenamiento GPTBot.
OAI-SearchBot
Rastreador de búsqueda de OpenAI que indexa la web para alimentar ChatGPT Search, distinto de GPTBot (entrenamiento) y de ChatGPT-User (navegación en vivo).
Google-Extended
Token de control de robots.txt que permite a los editores decidir si Google puede utilizar el contenido rastreado para entrenar y fundamentar sus modelos de IA Gemini.
PerplexityBot
Rastreador web de Perplexity AI que indexa y recupera contenido para las respuestas de búsqueda con IA en tiempo real.
CCBot
Rastreador web de Common Crawl que recopila datos para crear un repositorio abierto de datos de rastreo web.
robots.txt
Archivo de texto situado en la raíz de un sitio web para indicar a los robots de indexación qué páginas pueden explorar y cuáles deben evitar.
llms.txt
Formato de archivo propuesto que ofrece un resumen estructurado del contenido de un sitio para optimizar su comprensión por parte de los LLM.
Generación aumentada por recuperación(RAG)
Arquitectura de IA que recupera información relevante de fuentes externas en tiempo real antes de generar la respuesta.
Facilidad con la que los rastreadores de los buscadores y de la IA, como GPTBot o ClaudeBot, pueden acceder al contenido de un sitio web, recorrerlo e indexarlo.
Recomendación concreta y priorizada obtenida de los datos de monitorización de la visibilidad en la IA, que indica qué crear u optimizar a continuación.