A B C D E F G H I J K L M N O P Q R S T U V W X Y Z

Qué es Crawl Budget

Definición:Crawl budget

El crawl budget o presupuesto de rastreo es el conjunto de URLs de un sitio que un buscador puede y quiere rastrear durante un periodo. En Google, resulta de combinar el límite de capacidad de rastreo con la demanda que sus sistemas asignan a las URLs conocidas.

No es una cuota fija ni un número que el propietario pueda establecer directamente. Tampoco determina por sí solo la indexación o el posicionamiento. Describe cómo se distribuye una capacidad limitada de rastreo y resulta especialmente relevante en sitios grandes, con muchas URLs o con contenido que cambia rápidamente.

Componentes del crawl budget

Los motores de búsqueda no pueden visitar todas las URLs de Internet con la misma frecuencia. Para Googlebot, el presupuesto se entiende mediante dos componentes que actúan de manera conjunta:

  • Capacidad de rastreo: Número y duración de las conexiones que Google puede mantener sin sobrecargar el servidor. Puede disminuir cuando aumentan la latencia, los errores 5xx o las respuestas 429.
  • Demanda de rastreo: Interés de Google por visitar o volver a visitar determinadas URLs según el inventario conocido, su actualización, calidad, relevancia y otras señales.

Aunque el servidor admita más conexiones, Google puede rastrear menos si la demanda es baja. Del mismo modo, una demanda alta no permite superar indefinidamente la capacidad que el sitio puede atender. El crawl budget refleja las URLs que Google puede y quiere rastrear, no una orden de procesamiento completo.

Importancia del crawl budget

La mayoría de los sitios pequeños o estables no necesita gestionar activamente este concepto. Un sitemap actualizado, una arquitectura clara y el seguimiento habitual de la cobertura suelen ser suficientes cuando las páginas nuevas se descubren y rastrean sin retrasos anómalos.

El presupuesto adquiere mayor importancia cuando existe un inventario extenso, cambios frecuentes, navegación por filtros que genera muchas combinaciones o una proporción elevada de URLs descubiertas pero no rastreadas. En esos escenarios, los recursos pueden consumirse en duplicados, parámetros o páginas sin valor mientras otras URLs relevantes esperan.

Mejorar la eficiencia de rastreo ayuda al descubrimiento y actualización de contenidos, pero no garantiza una mejor posición. El SEO también depende de la indexabilidad, la calidad, la relevancia y otros factores. Aumentar visitas de Googlebot sin resolver estos aspectos puede no producir ningún beneficio orgánico.

Factores que influyen en el rastreo

La actividad de los robots cambia con el estado técnico del sitio y con la información que el buscador conoce sobre sus URLs. Entre los factores más importantes se encuentran:

  • Respuesta del servidor: Una disponibilidad estable y tiempos de respuesta razonables permiten sostener más conexiones.
  • Errores técnicos: Los códigos 5xx, los límites 429 y los fallos de red reducen temporalmente la capacidad.
  • Inventario de URLs: Duplicados, parámetros, calendarios infinitos y filtros pueden ampliar el espacio rastreable sin aportar contenido único.
  • Actualización documental: Los buscadores intentan volver a visitar las páginas con una frecuencia suficiente para detectar cambios relevantes.
  • Popularidad y relevancia: Las URLs consideradas más importantes suelen recibir mayor demanda de rastreo.
  • Cambios globales: Una migración o modificación extensa del sitio puede provocar una revisión temporal del inventario.

Publicar contenido nuevo de forma artificial no crea automáticamente más presupuesto. La demanda depende de cómo el buscador evalúa el conjunto del sitio. La prioridad debe ser ofrecer un inventario coherente y servirlo sin errores, no generar cambios con el único propósito de atraer al robot.

Optimización del rastreo

Optimizar el crawl budget significa ayudar al buscador a concentrarse en URLs útiles y reducir recorridos innecesarios. Las medidas deben basarse en problemas observados, porque bloquear rutas sin analizar su función puede impedir el acceso a recursos necesarios.

Las actuaciones habituales incluyen:

  • Consolidar duplicados: Unificar variantes y reforzar las señales de la versión que debe procesarse.
  • Controlar parámetros: Limitar combinaciones de filtros, búsquedas internas o calendarios que producen espacios prácticamente infinitos.
  • Aplicar robots.txt: Utilizar el archivo robots.txt para impedir el rastreo de rutas prescindibles cuando sea la solución adecuada.
  • Retirar URLs: Devolver 404 o 410 cuando una página ha desaparecido definitivamente y eliminar los enlaces rotos internos.
  • Evitar cadenas: Reducir redirecciones encadenadas y enlaces que obligan al robot a realizar solicitudes adicionales.
  • Mantener sitemaps: Incluir las URLs canónicas que deben rastrearse y actualizar `lastmod` únicamente cuando el contenido cambie de forma significativa.
  • Mejorar el servidor: Corregir errores, reducir latencia y utilizar respuestas 304 cuando un recurso no ha cambiado.

La guía oficial de Google sobre gestión del crawl budget insiste en administrar el inventario y mantener la salud del servidor. Estas medidas mejoran la eficiencia del rastreo, pero no obligan al buscador a visitar una cantidad concreta de páginas.

Medición del crawl budget

No existe una cifra pública exacta que represente todo el presupuesto asignado. El informe de estadísticas de rastreo de Search Console muestra solicitudes, tamaño descargado, tiempo de respuesta, tipos de archivo, códigos y actividad de Googlebot. Los registros del servidor permiten un análisis más detallado por URL, fecha y agente.

El diagnóstico debe comparar las URLs rastreadas con las que deberían recibir atención. Conviene revisar aumentos de parámetros o duplicados, errores 5xx y 429, redirecciones, soft 404, caídas de actividad y diferencias entre secciones. La inspección de URLs ayuda a estudiar casos concretos, pero no sustituye el análisis agregado.

Rastreo, indexación y ranking son etapas relacionadas pero distintas. Una URL puede rastrearse y no indexarse, o permanecer indexada sin visitas recientes. Por ello, una evaluación útil conecta los datos de rastreo con el estado técnico y editorial del sitio, evitando interpretar una mayor frecuencia como una mejora automática del rendimiento orgánico.