Tất cả bài viết

Sitemap.xml: vì sao công cụ tìm kiếm cần một bản đồ trang web

Sitemap.xml là một tệp XML chứa danh sách URL của trang web, giúp công cụ tìm kiếm phát hiện trang nhanh hơn — nhất là những trang có ít liên kết nội bộ hoặc mới được thêm gần đây.

Cấu trúc tệp và các thẻ bắt buộc

Mỗi URL được mô tả bằng phần tử <url> với thẻ con bắt buộc <loc> (địa chỉ trang) cùng các thẻ tùy chọn <lastmod>, <changefreq><priority>. Giao thức giới hạn một tệp ở mức 50.000 URL và 50 MB khi chưa nén.

Trùng lặp "ẩn" do khác dạng chuẩn hóa Unicode

Hai địa chỉ trong <loc> có thể hiển thị giống hệt nhau nhưng thực ra khác byte, nếu một địa chỉ dùng dạng NFC (ký tự có dấu dựng sẵn) còn địa chỉ kia dùng dạng NFD (chữ cái gốc cộng dấu tổ hợp) cho cùng một chữ tiếng Việt. Một công cụ kiểm tra không chuẩn hóa Unicode trước khi so sánh có thể bỏ sót cặp URL trùng lặp thật sự này.

Nhiều sitemap và tệp chỉ mục

Khi số URL vượt quá giới hạn của một tệp, người ta dùng tệp chỉ mục sitemapindex trỏ đến nhiều tệp sitemap riêng lẻ. Đây là cách làm phổ biến với các trang web lớn có hàng chục nghìn trang.

Công cụ này dùng để làm gì

  • Kiểm tra cấu trúc XML của sitemap có hợp lệ trước khi gửi lên Google Search Console.
  • Xác nhận tệp không vượt quá giới hạn của giao thức về số lượng URL hoặc dung lượng.
  • Tìm liên kết hỏng hoặc trùng lặp trong một tệp sitemap lớn.

Có trong sitemap không đảm bảo được lập chỉ mục

Một sitemap hợp lệ chỉ cho trình thu thập dữ liệu biết nên tìm ở đâu — đó là danh sách ứng viên, không phải mệnh lệnh. Google tự quyết định một URL có đáng được lập chỉ mục hay không, dựa trên chất lượng nội dung, trùng lặp và các tín hiệu khác mà một công cụ kiểm tra không thể xác minh được.

Dùng thử công cụ