robots.txt est un fichier texte placé à la racine du site que les robots d'indexation lisent avant d'explorer les pages, pour savoir quelles sections ils ont le droit de visiter ou non. Tous les moteurs n'interprètent pas ses directives de la même façon, et c'est justement là que naissent la plupart des erreurs de configuration.
Les directives User-agent, Disallow et Allow
Le fichier est organisé en blocs, chacun commençant par User-agent:, suivi des directives Disallow et Allow qui marquent les chemins interdits ou explicitement autorisés. Le robot applique le premier bloc dont le User-agent correspond à son propre nom, et retombe sur le bloc générique User-agent: * en l'absence de correspondance précise.
Crawl-delay : pourquoi Google l'ignore complètement
Bingbot respecte historiquement la directive Crawl-delay pour espacer ses requêtes sur un site. Google, en revanche, n'a jamais pris en charge cette directive dans robots.txt — si elle apparaît dans un bloc destiné à Googlebot, elle est simplement ignorée. Pour ajuster la vitesse d'exploration de Google, il faut passer par les paramètres de la Search Console, pas par robots.txt.
Sitemap : une indication, pas une obligation
La directive Sitemap: indique au moteur où se trouve le fichier sitemap.xml. Elle est facultative mais pratique : le robot n'a pas besoin de deviner l'emplacement du plan du site ni de dépendre uniquement de son enregistrement dans une console de recherche.
Pourquoi vérifier tout cela
- Contrôler la syntaxe de robots.txt avant publication, pour qu'une simple faute de frappe ne bloque pas tout le site par erreur.
- S'assurer qu'aucune section importante n'est masquée par des règles contradictoires entre différents blocs.
- Tester instantanément une combinaison précise de user-agent et de chemin, sans attendre le prochain passage du robot.
Pourquoi Disallow ne masque pas une page des résultats
C'est la confusion la plus fréquente : Disallow empêche un robot d'explorer le contenu d'une page, mais n'empêche pas son URL d'être indexée. Si un autre site indexé pointe vers cette page bloquée, Google peut quand même afficher son URL dans les résultats, sans description, puisque le contenu n'a jamais été exploré.