SEO
robots.txt Validator
Valider le robots.txt — structure des groupes User-agent, directives, test d'un chemin spécifique pour autoriser/bloquer.
Si vous indiquez uniquement le domaine, /robots.txt sera ajouté. Ne fonctionnera pas sur tous les sites — certains bloquent les requêtes intersites (CORS) ; si le chargement échoue, ouvrez robots.txt dans un nouvel onglet et collez le contenu manuellement.
robots.txt controls which paths of a site search bots are allowed to crawl. A mistake in this file can accidentally block an entire site from indexing, or expose internal sections that shouldn't be crawled. This tool checks the file's structure and tests a specific path against allow/disallow rules.
How to use it
- Paste the contents of robots.txt and the tool parses the User-agent groups and directives (Allow, Disallow, Sitemap).
- Enter a specific path (e.g. /admin/ or /blog/post-1) to check whether it's allowed for a chosen bot.
- Syntax errors and suspicious constructs are flagged separately from valid directives.
Common uses
- Checking before a deploy that a new robots.txt hasn't accidentally blocked important pages.
- Debugging why a specific page isn't indexed — it may be caught by a Disallow rule.
- Comparing rules for different bots (Googlebot, Bingbot, etc.) when separate User-agent groups target them.
Things to keep in mind
robots.txt only blocks crawling — it doesn't guarantee a page won't appear in the index: if something else links to it, Google can still show the URL with no description. To reliably exclude a page, use a meta noindex tag, and the page must not be blocked in robots.txt for that tag to be seen.
Paths in robots.txt are case-sensitive — /Page and /page are treated as different paths.
Questions fréquentes
Pourquoi ma règle Disallow ne bloque-t-elle pas la page attendue ?
Les règles de robots.txt sont comparées par préfixe, pas par page exacte, et les règles plus spécifiques l'emportent sur les générales — un Disallow: /blog ne bloquera pas /blog-archive à moins de tenir compte du fonctionnement réel de la correspondance par préfixe, et une règle Allow ailleurs peut l'emporter sur un Disallow plus large.
Le robots.txt empêche-t-il réellement l'indexation d'une page ?
Pas de manière fiable à lui seul. Il ne fait que demander aux robots bien élevés de ne pas récupérer une page — une page interdite peut quand même être indexée (sans son contenu) si d'autres pages y renvoient, donc utilisez une balise meta ou un en-tête noindex pour une garantie réelle.
Le contenu de mon robots.txt est-il envoyé quelque part pour être validé ?
Non. La validation se fait entièrement dans votre navigateur — rien n'est téléchargé vers un serveur.
Googlebot prend-il en charge les caractères génériques * et $ dans robots.txt ?
Oui — Google prend en charge * comme n'importe quelle séquence de caractères et $ comme fin d'une URL, bien qu'il s'agisse d'une extension au-delà de la spécification originale de 1994, donc tous les robots ne sont pas garantis de les reconnaître.
Les chemins dans robots.txt sont-ils sensibles à la casse ?
Oui — /Admin/ et /admin/ sont traités comme des chemins différents, donc une règle Disallow doit correspondre exactement à la casse utilisée dans les vraies URL du site.