SEO

robots.txt Validator

Xác thực robots.txt — cấu trúc nhóm User-agent, các chỉ thị, kiểm tra một đường dẫn cụ thể được phép/chặn.

Nếu chỉ nhập tên miền, /robots.txt sẽ được thêm vào. Sẽ không hoạt động với mọi trang web — một số chặn yêu cầu chéo miền (CORS); nếu tải không thành công, hãy mở robots.txt trong tab mới và dán nội dung thủ công.

robots.txt controls which paths of a site search bots are allowed to crawl. A mistake in this file can accidentally block an entire site from indexing, or expose internal sections that shouldn't be crawled. This tool checks the file's structure and tests a specific path against allow/disallow rules.

How to use it

Common uses

Things to keep in mind

robots.txt only blocks crawling — it doesn't guarantee a page won't appear in the index: if something else links to it, Google can still show the URL with no description. To reliably exclude a page, use a meta noindex tag, and the page must not be blocked in robots.txt for that tag to be seen.

Paths in robots.txt are case-sensitive — /Page and /page are treated as different paths.

Bài viết về công cụ này: robots.txt: bot tìm kiếm quyết định những gì được thu thập dữ liệu như thế nào

Câu hỏi thường gặp

Vì sao quy tắc Disallow của tôi không chặn trang tôi mong đợi?

Quy tắc robots.txt được khớp theo tiền tố, không phải trang chính xác, và quy tắc cụ thể hơn sẽ ghi đè quy tắc chung — Disallow: /blog sẽ không chặn /blog-archive trừ khi bạn tính đến cách khớp tiền tố thực sự hoạt động, và một quy tắc Allow ở nơi khác có thể ghi đè một Disallow rộng hơn.

robots.txt có thực sự ngăn một trang được lập chỉ mục không?

Tự nó không đáng tin cậy. Nó chỉ yêu cầu các trình thu thập dữ liệu có thiện chí không lấy một trang — trang bị cấm vẫn có thể được lập chỉ mục (không có nội dung) nếu trang khác liên kết tới nó, vì vậy hãy dùng thẻ meta hoặc header noindex để có đảm bảo thực sự.

Nội dung robots.txt của tôi có được gửi đi đâu để xác thực không?

Không. Việc xác thực diễn ra hoàn toàn trong trình duyệt của bạn — không có gì được gửi tới máy chủ.

Googlebot có hỗ trợ ký tự đại diện * và $ không?

Có — Googlebot và hầu hết các trình thu thập dữ liệu hiện đại khác hỗ trợ * (khớp bất kỳ chuỗi ký tự nào) và $ (đánh dấu điểm kết thúc URL), nhưng đây là phần mở rộng ngoài đặc tả gốc năm 1994, vì vậy không phải mọi bot đều hỗ trợ chúng.

Đường dẫn trong robots.txt có phân biệt chữ hoa/thường không?

Có. /Admin/ và /admin/ được coi là hai đường dẫn khác nhau, vì vậy một quy tắc Disallow viết sai chữ hoa/thường sẽ hoàn toàn không có tác dụng với đường dẫn thực tế.

Bài viết: SEO