Все статьи

Sitemap.xml: зачем поисковикам нужна карта сайта

Sitemap.xml — это XML-файл со списком URL сайта, который помогает поисковым системам находить страницы быстрее, особенно те, на которые мало внутренних ссылок или которые добавлены недавно.

Структура файла и обязательные теги

Каждый URL описывается тегом <url> с обязательным дочерним <loc> (адрес страницы) и необязательными <lastmod>, <changefreq> и <priority>. Протокол ограничивает один файл 50 000 URL и 50 МБ в несжатом виде.

Кириллические URL в валидном sitemap

Если в <loc> вставить кириллический адрес напрямую, без percent-encoding байтов UTF-8, многие валидаторы формально не отклонят файл как невалидный XML, но это нарушает требование RFC к синтаксису URI внутри loc — корректный sitemap должен содержать уже закодированный адрес вида %D1%81%D1%82%D0%B0%D1%82%D1%8C%D1%8F, а не сырую кириллицу.

Несколько sitemap и sitemap index

Когда URL больше, чем допускает один файл, используется файл-индекс sitemapindex, который ссылается на несколько отдельных sitemap-файлов. Это стандартная практика для крупных сайтов с десятками тысяч страниц.

Зачем это нужно

  • Проверить валидность XML-структуры sitemap перед отправкой в Google Search Console или Яндекс.Вебмастер.
  • Убедиться, что файл не превышает лимиты протокола по количеству URL или размеру.
  • Найти битые или дублированные ссылки в большом sitemap-файле.

Присутствие в sitemap не гарантирует индексацию

Валидный sitemap лишь подсказывает краулеру, где искать — это список кандидатов, а не команда. Google и Яндекс самостоятельно решают, стоит ли индексировать конкретный URL, опираясь на качество контента, дубликаты и другие сигналы, которые валидатор проверить не может.

Попробовать инструмент