SEO

robots.txt Validator

Valider le robots.txt — structure des groupes User-agent, directives, test d'un chemin spécifique pour autoriser/bloquer.

Si vous indiquez uniquement le domaine, /robots.txt sera ajouté. Ne fonctionnera pas sur tous les sites — certains bloquent les requêtes intersites (CORS) ; si le chargement échoue, ouvrez robots.txt dans un nouvel onglet et collez le contenu manuellement.

robots.txt controls which paths of a site search bots are allowed to crawl. A mistake in this file can accidentally block an entire site from indexing, or expose internal sections that shouldn't be crawled. This tool checks the file's structure and tests a specific path against allow/disallow rules.

How to use it

Common uses

Things to keep in mind

robots.txt only blocks crawling — it doesn't guarantee a page won't appear in the index: if something else links to it, Google can still show the URL with no description. To reliably exclude a page, use a meta noindex tag, and the page must not be blocked in robots.txt for that tag to be seen.

Paths in robots.txt are case-sensitive — /Page and /page are treated as different paths.

Article sur cet outil: robots.txt : comment les robots d'indexation décident ce qu'ils peuvent explorer

Questions fréquentes

Pourquoi ma règle Disallow ne bloque-t-elle pas la page attendue ?

Les règles de robots.txt sont comparées par préfixe, pas par page exacte, et les règles plus spécifiques l'emportent sur les générales — un Disallow: /blog ne bloquera pas /blog-archive à moins de tenir compte du fonctionnement réel de la correspondance par préfixe, et une règle Allow ailleurs peut l'emporter sur un Disallow plus large.

Le robots.txt empêche-t-il réellement l'indexation d'une page ?

Pas de manière fiable à lui seul. Il ne fait que demander aux robots bien élevés de ne pas récupérer une page — une page interdite peut quand même être indexée (sans son contenu) si d'autres pages y renvoient, donc utilisez une balise meta ou un en-tête noindex pour une garantie réelle.

Le contenu de mon robots.txt est-il envoyé quelque part pour être validé ?

Non. La validation se fait entièrement dans votre navigateur — rien n'est téléchargé vers un serveur.

Googlebot prend-il en charge les caractères génériques * et $ dans robots.txt ?

Oui — Google prend en charge * comme n'importe quelle séquence de caractères et $ comme fin d'une URL, bien qu'il s'agisse d'une extension au-delà de la spécification originale de 1994, donc tous les robots ne sont pas garantis de les reconnaître.

Les chemins dans robots.txt sont-ils sensibles à la casse ?

Oui — /Admin/ et /admin/ sont traités comme des chemins différents, donc une règle Disallow doit correspondre exactement à la casse utilisée dans les vraies URL du site.

Articles : SEO