A B C D E F G H I J K L M N O P Q R S T U V W X Y Z

Qué es Robots.txt

Robots.txtDefinición:

Robots.txt es un archivo de texto situado en la raíz de un sitio que indica a los rastreadores qué rutas pueden solicitar y cuáles no. Sus reglas forman parte del Protocolo de Exclusión de Robots y se aplican a los crawlers que las reconocen.

El archivo controla el acceso automatizado para rastreo. No se enlaza desde el HTML, no protege contenido privado y no garantiza que una URL desaparezca de los resultados de búsqueda.

Cómo funciona robots.txt

Un rastreador consulta el archivo antes de solicitar otras URLs del sitio:

  1. Solicitud: el bot intenta descargar /robots.txt en el host que va a rastrear.
  2. Identificación: compara su identificador con los grupos definidos mediante User-agent.
  3. Selección de reglas: aplica las directivas Allow y Disallow del grupo más específico que le corresponde.
  4. Comparación de rutas: contrasta cada URL con las rutas declaradas y utiliza la coincidencia más específica.
  5. Decisión de rastreo: solicita o evita la URL según el resultado y el comportamiento que implemente ese rastreador.

El archivo es público y sus instrucciones no equivalen a un mecanismo de autorización. Un bot malicioso puede ignorarlas y cualquier persona puede consultar las rutas que aparecen en él.

Ubicación y alcance

El estándar REP establece que el archivo debe llamarse robots.txt, escribirse en minúsculas y estar disponible en la ruta superior del servicio.

  • Raíz del sitio: para https://www.example.com/, la ubicación es https://www.example.com/robots.txt.
  • Host: las reglas de www.example.com no se aplican automáticamente a shop.example.com.
  • Protocolo: un archivo servido por HTTPS no define por sí mismo las reglas de la versión HTTP.
  • Puerto: un puerto no estándar tiene su propio ámbito.
  • Formato: debe servirse como texto plano codificado en UTF-8; un archivo ubicado dentro de una carpeta no controla el sitio completo.

La ruta distingue mayúsculas y minúsculas. /robots.txt es la ubicación prevista, mientras que /Robots.txt puede tratarse como un recurso diferente.

Directivas y sintaxis

Las líneas se organizan en grupos formados por uno o varios agentes y sus reglas:

  • User-agent: identifica el rastreador al que se dirige el grupo. El valor * representa a los agentes que no tienen un grupo más específico.
  • Disallow: señala una ruta que el agente no debe solicitar. Un valor vacío no bloquea ninguna ruta.
  • Allow: permite una ruta concreta dentro de otra más amplia que está bloqueada.
  • Sitemap: declara la URL absoluta de un sitemap. Esta línea no forma parte de un grupo de agentes.
  • Comentarios: el carácter # hace que el resto de la línea se interprete como comentario.

Las rutas de Allow y Disallow empiezan por /. La especificidad determina qué regla se aplica cuando varias coinciden. La documentación de Google sobre la sintaxis también contempla los caracteres * para una secuencia de caracteres y $ para marcar el final de la URL.

Ejemplos de robots.txt

Permitir el rastreo completo

User-agent: *
Disallow:

La ausencia de una ruta después de Disallow no impone restricciones.

Bloquear una carpeta

User-agent: *
Disallow: /privado/

La regla solicita que los agentes compatibles no rastreen las URLs cuyo camino comienza por /privado/.

Permitir una excepción dentro de una carpeta bloqueada

User-agent: *
Disallow: /recursos/
Allow: /recursos/publico/

La coincidencia más específica permite rastrear /recursos/publico/ aunque la carpeta superior esté bloqueada.

Bloquear todo el sitio y declarar un sitemap

User-agent: *
Disallow: /

Sitemap: https://www.example.com/sitemap.xml

Disallow: / solicita bloquear todo el rastreo para ese grupo. La línea Sitemap puede incluirse, pero no anula el bloqueo.

Rastreo, indexación y seguridad

Robots.txt debe diferenciarse de otros controles:

  • Rastreo: las reglas regulan si un agente compatible puede solicitar el contenido de una ruta.
  • Indexación: una URL bloqueada puede seguir apareciendo en resultados si el buscador la descubre mediante enlaces u otras fuentes.
  • Noindex: esta directiva se coloca en una metaetiqueta o cabecera HTTP para solicitar la exclusión del índice. El buscador necesita rastrear la URL para verla.
  • Privacidad: una ruta indicada en robots.txt sigue siendo pública y accesible directamente. El contenido confidencial necesita autenticación o controles de acceso.
  • Eliminación: bloquear el rastreo no borra una URL ya conocida ni elimina copias almacenadas por otros sistemas.

La guía de Google sobre robots.txt advierte expresamente que el archivo sirve para gestionar el tráfico de rastreo, no para mantener una página fuera de Google.

Respuestas HTTP y comprobación

La respuesta del servidor afecta a cómo se interpretan las reglas. En el caso de Google:

  • 2xx: el archivo se descarga y se procesa.
  • 3xx: el rastreador sigue varias redirecciones antes de considerar que el archivo no está disponible.
  • 4xx: salvo casos concretos como 429, se interpreta normalmente que no existen restricciones de rastreo.
  • 5xx o errores de red: el rastreo puede detenerse temporalmente y utilizarse una versión válida almacenada.

Una comprobación técnica debe revisar:

  • Disponibilidad: /robots.txt responde en el host, protocolo y puerto correctos.
  • Contenido: el servidor entrega texto plano y no una página HTML o un error personalizado.
  • Sintaxis: los grupos, agentes, rutas y comentarios se pueden interpretar sin ambigüedad.
  • Coherencia: no se bloquean recursos necesarios para renderizar o comprender páginas que sí deben rastrearse.
  • Cambios: las modificaciones pueden tardar en reflejarse porque los buscadores almacenan temporalmente el archivo.

El resultado debe comprobarse para cada rastreador relevante, ya que algunas directivas no estandarizadas, como Crawl-delay, no reciben el mismo tratamiento en todos los motores.