Definición:
Googlebot es el nombre genérico de los rastreadores que Google Search utiliza para descubrir y obtener páginas y otros recursos de la web. Sus dos variantes principales son Googlebot Smartphone, que simula un dispositivo móvil, y Googlebot Desktop, que simula un ordenador.
Googlebot participa en la fase de rastreo, pero rastrear una URL no implica que vaya a indexarse ni a posicionarse. Después de obtener el recurso, otros sistemas de Google lo procesan, renderizan cuando es necesario y deciden si su contenido puede incorporarse al índice.
Índice de contenidos
Cómo funciona Googlebot
Googlebot descubre URLs principalmente a través de enlaces encontrados en páginas ya conocidas. También puede obtenerlas de sitemaps y de otras fuentes utilizadas por Google. El proceso general incluye varias acciones:
- Descubrimiento: Google conoce una URL nueva o detecta que una ya registrada podría haber cambiado.
- Planificación: Sus sistemas deciden qué URL solicitar y cuándo hacerlo según la demanda de rastreo y la capacidad del sitio.
- Solicitud: Googlebot pide el recurso al servidor y recibe su código HTTP, cabeceras y contenido accesible.
- Procesamiento: Google analiza el documento y puede solicitar archivos asociados, como CSS, JavaScript o imágenes, para comprender y renderizar la página.
- Revisita: La URL puede volver a rastrearse para comprobar cambios, sin una periodicidad fija garantizada.
Googlebot es un crawler específico de Google Search. No es un programa único que recorra toda la web de forma lineal, sino una infraestructura distribuida que realiza solicitudes desde numerosas máquinas y direcciones IP.
Googlebot Smartphone y Googlebot Desktop
Google distingue dos variantes principales para el rastreo web:
- Googlebot Smartphone: Simula a una persona que utiliza un navegador móvil. Es la variante que realiza la mayoría de las solicitudes porque Google indexa principalmente la versión móvil del contenido.
- Googlebot Desktop: Simula un navegador de escritorio y se utiliza en una proporción menor de solicitudes.
Ambas variantes se identifican mediante cabeceras HTTP user-agent diferentes, pero comparten el token Googlebot en robots.txt. Por este motivo, robots.txt no permite autorizar una variante y bloquear selectivamente la otra.
La antigua división entre Deepbot y Freshbot ya no describe la documentación ni el funcionamiento actual de Googlebot. Tampoco deben confundirse estas dos variantes con Googlebot-Image, Googlebot-Video u otros rastreadores y recuperadores que Google emplea para productos y finalidades concretas.
Rastreo, renderizado e indexación
El rastreo es solo una parte del proceso de Google Search. Conviene diferenciar estas etapas:
- Rastreo: Googlebot solicita una URL y descarga la parte del recurso que puede procesar.
- Renderizado: Los sistemas de Google pueden ejecutar JavaScript y cargar recursos necesarios para observar el contenido generado.
- Indexación: Google analiza el contenido, comprueba señales como la canonicalización y decide si almacena una versión en su índice.
- Posicionamiento: Ante una consulta, Google ordena los resultados que considera pertinentes mediante sus sistemas de clasificación.
Una página puede ser rastreada y no entrar en la indexación. También puede ser conocida por Google sin que su contenido haya sido rastreado recientemente. Facilitar el acceso de Googlebot elimina barreras técnicas, pero no garantiza inclusión, frecuencia de actualización ni posiciones.
Cómo identificar y verificar a Googlebot
Los registros del servidor permiten revisar las solicitudes atribuidas a Googlebot, incluidas la URL, la hora, la IP, el user-agent y el código de respuesta. Sin embargo, el nombre del user-agent se puede falsificar, por lo que no basta con encontrar la palabra Googlebot en el log.
Google recomienda verificar las solicitudes mediante uno de estos métodos:
- Comparar la IP de origen con los rangos publicados por Google para sus rastreadores.
- Realizar una búsqueda DNS inversa de la IP y comprobar después, con una búsqueda directa, que el nombre obtenido resuelve a la misma dirección.
Los nombres verificados de los rastreadores comunes terminan en googlebot.com o geo.googlebot.com. Esta comprobación ayuda a no permitir, bloquear o limitar por error a un bot que solo está suplantando su identidad.
Cómo controlar el acceso de Googlebot
Cada mecanismo resuelve una necesidad distinta:
- Robots.txt: Gestiona qué rutas puede rastrear Googlebot, pero no protege información confidencial ni garantiza que una URL conocida desaparezca de los resultados.
- Meta robots noindex o X-Robots-Tag: Solicita que el recurso no se incluya en Google Search. Googlebot debe poder rastrearlo para leer la directiva.
- Autenticación: Una contraseña u otro control de acceso impide que Googlebot y usuarios no autorizados obtengan contenido privado.
- Códigos HTTP: Respuestas como 404 o 410 indican que un recurso ya no está disponible; 429 y 5xx comunican problemas diferentes y pueden reducir temporalmente el rastreo.
Bloquear una página en robots.txt y añadir noindex al mismo tiempo puede ser contraproducente, ya que Googlebot no podrá acceder a la página para detectar noindex. La medida adecuada depende de si se quiere impedir el rastreo, evitar la indexación, retirar una URL o proteger información.
Cómo analizar problemas de rastreo
Un diagnóstico debe combinar varias fuentes. Los logs muestran las solicitudes reales recibidas por el servidor. Google Search Console permite inspeccionar URLs, consultar estadísticas de rastreo y revisar motivos de exclusión o errores de indexación.
También conviene comprobar robots.txt, códigos HTTP, redirecciones, canonicales, sitemaps, enlaces internos y recursos necesarios para renderizar. La frecuencia de visita no depende solo de una supuesta autoridad: Google tiene en cuenta la capacidad de respuesta del servidor, la demanda de rastreo, los cambios del contenido, su calidad y relevancia, entre otras señales.
La optimización del crawl budget es especialmente pertinente en sitios muy grandes, muy cambiantes o con muchas URLs descubiertas pero no indexadas. En webs pequeñas o estables, mantener un sitemap correcto y revisar el informe de indexación suele ser más útil que intentar forzar una frecuencia concreta de Googlebot.
