robots.txt es un archivo de texto en la raíz del sitio que los rastreadores leen antes de recorrerlo, para saber qué secciones tienen permitido o prohibido visitar. No todos los buscadores interpretan sus directivas igual, y ahí es donde surgen los errores más comunes.
User-agent, Disallow y Allow
El archivo se organiza en bloques que empiezan con User-agent:, seguido de las directivas Disallow y Allow, que marcan rutas prohibidas o permitidas. El rastreador aplica el primer bloque cuyo User-agent coincida con su propio nombre; si no hay coincidencia específica, recurre al bloque User-agent: *.
Crawl-delay: por qué Google lo ignora por completo
Bingbot históricamente respeta la directiva Crawl-delay en robots.txt para espaciar sus peticiones. Google, en cambio, nunca ha soportado esta directiva: si aparece en un bloque dirigido a Googlebot, simplemente la ignora. Para controlar la velocidad de rastreo de Google hay que usar la configuración de velocidad de rastreo en Search Console, no robots.txt.
Sitemap como pista para el rastreador
La directiva Sitemap: indica al buscador dónde está el archivo sitemap.xml. No es obligatoria, pero resulta útil: el rastreador no tiene que adivinar la ruta del mapa del sitio ni depender solo de haberlo registrado en la consola del buscador.
Para qué sirve validar esto
- Revisar la sintaxis de robots.txt antes de publicarlo, para que un error tipográfico no bloquee todo el sitio por accidente.
- Comprobar que ninguna sección importante quede oculta por reglas contradictorias entre bloques.
- Probar una combinación concreta de user-agent y ruta al instante, sin esperar al próximo rastreo.
Por qué Disallow no oculta una página de los resultados
Es la confusión más frecuente: Disallow impide que un bot rastree el contenido de una página, pero no impide que su URL aparezca indexada. Si otro sitio indexado enlaza a esa página bloqueada, Google puede seguir mostrando su URL en los resultados, sin descripción, porque nunca llegó a rastrear el contenido.