SEO
robots.txt Validator
Xác thực robots.txt — cấu trúc nhóm User-agent, các chỉ thị, kiểm tra một đường dẫn cụ thể được phép/chặn.
Nếu chỉ nhập tên miền, /robots.txt sẽ được thêm vào. Sẽ không hoạt động với mọi trang web — một số chặn yêu cầu chéo miền (CORS); nếu tải không thành công, hãy mở robots.txt trong tab mới và dán nội dung thủ công.
robots.txt controls which paths of a site search bots are allowed to crawl. A mistake in this file can accidentally block an entire site from indexing, or expose internal sections that shouldn't be crawled. This tool checks the file's structure and tests a specific path against allow/disallow rules.
How to use it
- Paste the contents of robots.txt and the tool parses the User-agent groups and directives (Allow, Disallow, Sitemap).
- Enter a specific path (e.g. /admin/ or /blog/post-1) to check whether it's allowed for a chosen bot.
- Syntax errors and suspicious constructs are flagged separately from valid directives.
Common uses
- Checking before a deploy that a new robots.txt hasn't accidentally blocked important pages.
- Debugging why a specific page isn't indexed — it may be caught by a Disallow rule.
- Comparing rules for different bots (Googlebot, Bingbot, etc.) when separate User-agent groups target them.
Things to keep in mind
robots.txt only blocks crawling — it doesn't guarantee a page won't appear in the index: if something else links to it, Google can still show the URL with no description. To reliably exclude a page, use a meta noindex tag, and the page must not be blocked in robots.txt for that tag to be seen.
Paths in robots.txt are case-sensitive — /Page and /page are treated as different paths.
Câu hỏi thường gặp
Vì sao quy tắc Disallow của tôi không chặn trang tôi mong đợi?
Quy tắc robots.txt được khớp theo tiền tố, không phải trang chính xác, và quy tắc cụ thể hơn sẽ ghi đè quy tắc chung — Disallow: /blog sẽ không chặn /blog-archive trừ khi bạn tính đến cách khớp tiền tố thực sự hoạt động, và một quy tắc Allow ở nơi khác có thể ghi đè một Disallow rộng hơn.
robots.txt có thực sự ngăn một trang được lập chỉ mục không?
Tự nó không đáng tin cậy. Nó chỉ yêu cầu các trình thu thập dữ liệu có thiện chí không lấy một trang — trang bị cấm vẫn có thể được lập chỉ mục (không có nội dung) nếu trang khác liên kết tới nó, vì vậy hãy dùng thẻ meta hoặc header noindex để có đảm bảo thực sự.
Nội dung robots.txt của tôi có được gửi đi đâu để xác thực không?
Không. Việc xác thực diễn ra hoàn toàn trong trình duyệt của bạn — không có gì được gửi tới máy chủ.
Googlebot có hỗ trợ ký tự đại diện * và $ không?
Có — Googlebot và hầu hết các trình thu thập dữ liệu hiện đại khác hỗ trợ * (khớp bất kỳ chuỗi ký tự nào) và $ (đánh dấu điểm kết thúc URL), nhưng đây là phần mở rộng ngoài đặc tả gốc năm 1994, vì vậy không phải mọi bot đều hỗ trợ chúng.
Đường dẫn trong robots.txt có phân biệt chữ hoa/thường không?
Có. /Admin/ và /admin/ được coi là hai đường dẫn khác nhau, vì vậy một quy tắc Disallow viết sai chữ hoa/thường sẽ hoàn toàn không có tác dụng với đường dẫn thực tế.