A B C D E F G H I J K L M N O P Q R S T U V W X Y Z

Qué es Crawler

CrawlerDefinición:

Un crawler o rastreador web es un programa automatizado que descubre direcciones, solicita recursos y sigue enlaces para recopilar información de páginas y archivos. También se conoce como spider, robot o bot cuando realiza este recorrido de forma sistemática.

Los buscadores utilizan crawlers como primera etapa de sus sistemas, pero rastrear no significa indexar ni posicionar. El programa obtiene el recurso y sus señales técnicas; después, otros procesos deciden cómo interpretarlo, si puede incorporarse al índice y cuándo podría mostrarse como resultado.

Cómo funciona un crawler

El recorrido habitual comprende estas etapas:

  1. Descubrimiento de URLs: obtiene direcciones desde enlaces conocidos, un sitemap, una cola inicial u otra fuente autorizada.
  2. Planificación: selecciona qué URL solicitar, cuándo hacerlo y con qué prioridad según sus objetivos y recursos.
  3. Petición: envía una solicitud al servidor y recibe un código HTTP, cabeceras y el contenido disponible.
  4. Procesamiento: analiza el documento, extrae enlaces, metadatos y otros elementos y, cuando corresponde, renderiza recursos o JavaScript.
  5. Actualización de la cola: registra el resultado, evita repeticiones innecesarias y programa nuevos descubrimientos o revisitas.

Un crawler no recorre necesariamente todas las páginas. Puede detenerse por restricciones, errores, límites de tiempo, capacidad, duplicados, baja demanda o decisiones de selección.

Políticas que determinan el rastreo

  • Selección: establece qué URLs entran en la cola y cuáles se descartan o aplazan.
  • Revisita: decide cuándo volver a solicitar un recurso para comprobar cambios.
  • Cortesía: limita la frecuencia y la concurrencia para no sobrecargar el servidor.
  • Paralelización: distribuye solicitudes entre procesos, máquinas o dominios manteniendo controles por host.
  • Presupuesto: asigna tiempo y recursos finitos; en buscadores, esta disponibilidad se relaciona con el crawl budget.

El comportamiento depende del objetivo del crawler. Un buscador, un archivo web y una herramienta de auditoría pueden utilizar políticas diferentes aunque todos soliciten documentos mediante HTTP.

Tipos y usos de crawlers

  • Crawlers de buscadores: descubren contenido para sistemas de búsqueda; Googlebot es un ejemplo concreto, no un sinónimo de todos los crawlers.
  • Crawlers de auditoría: recorren un sitio para detectar estados HTTP, enlaces, metadatos, canonicales y problemas de SEO técnico.
  • Crawlers de archivo: conservan copias y cambios de páginas para construir colecciones históricas.
  • Crawlers de monitorización: comprueban disponibilidad, modificaciones, precios u otras propiedades definidas.
  • Crawlers de extracción: recopilan datos estructurados o semiestructurados para investigación, comparación o análisis autorizado.

La posibilidad técnica de solicitar una página no concede permiso ilimitado para copiarla o reutilizar sus datos. El alcance debe respetar condiciones del servicio, privacidad, propiedad intelectual, carga del servidor y legislación aplicable.

Rastreo, indexación y posicionamiento

  • Descubrimiento: el sistema conoce una URL, aunque todavía no la haya solicitado.
  • Rastreo: el crawler obtiene el recurso y observa su respuesta y contenido accesible.
  • Indexación: el buscador procesa la página, evalúa su contenido y decide si almacena una versión en su índice.
  • Canonicalización: agrupa páginas similares y selecciona una versión representativa mediante señales como la rel canonical.
  • Posicionamiento: ordena resultados para una consulta concreta después de considerar relevancia, calidad y contexto.

Una URL rastreada puede no indexarse, y una URL conocida puede aparecer de forma limitada sin que su contenido se haya rastreado. Tampoco existe garantía de posicionamiento por facilitar el acceso al crawler.

Cómo controlar el acceso de los crawlers

  • Robots.txt: comunica reglas de rastreo a bots compatibles, pero no protege información privada ni garantiza que todos las respeten.
  • Autenticación: una contraseña o un control de acceso impide que visitantes no autorizados obtengan el recurso.
  • noindex: solicita a buscadores compatibles que no incorporen la página al índice, pero normalmente requiere que puedan rastrearla para leer la directiva.
  • Estados HTTP: códigos como 401, 403, 404, 410, 429 y 5xx comunican situaciones diferentes y afectan a las revisitas.
  • Límites del servidor: rate limiting, firewall y otras medidas pueden controlar solicitudes, aunque una configuración incorrecta también puede bloquear bots legítimos.

Bloquear una URL en robots.txt gestiona el rastreo, no su confidencialidad ni necesariamente su presencia como dirección conocida en un índice.

Análisis y problemas de rastreo

  • Registros del servidor: muestran qué user agent solicitó cada URL, cuándo lo hizo y qué respuesta recibió.
  • Verificación del bot: el nombre del user agent por sí solo puede falsificarse; los buscadores documentan métodos de validación mediante IP y DNS.
  • Informes de búsqueda: Google Search Console aporta estados de rastreo e indexación para la propiedad verificada.
  • Auditorías controladas: un crawler propio permite reproducir recorridos, comprobar enlaces y comparar respuestas sin asumir que imita exactamente a un buscador.
  • Diagnóstico conjunto: arquitectura, enlaces internos, sitemap, robots, códigos HTTP, canonicales, rendimiento y renderizado deben analizarse como un sistema.

Los fallos habituales incluyen bucles, calendarios infinitos, parámetros combinables, redirecciones encadenadas, enlaces rotos, servidores lentos y contenido dependiente de recursos bloqueados. Corregirlos mejora la eficiencia del recorrido, pero no sustituye la evaluación posterior del contenido.