Sitemap – это служебный XML-файл со списком адресов, которые владелец хочет показать поиску. Через этот файл владелец сообщает Яндексу об актуальной структуре ресурса. Поисковая система получает готовую опись и не тратит время на то, чтобы вычислять её обходом внутренних связей.
В этой статье разбираем, как устроен в Яндексе Sitemap для сайта, какие требования он предъявляет, чем собрать файл, как проверить его перед отправкой, где указать на него и что означают статусы обработки. Отдельно смотрим типовые ошибки и приёмы ускорения индексации.
Зачем нужен файл Sitemap и как его использует Яндекс
Индексирующий алгоритм находит новое двумя путями. Он переходит по внутренним связям, а ещё читает карту сайта xml, если она есть. Второй вариант короче. На ресурсе с глубокой вложенностью, слабой перелинковкой или свежими рубриками часть материалов алгоритм обнаружит с задержкой в недели, и готовая опись эту задержку сокращает.
В справке «Файлы Sitemap» назначение файла сформулировано прямо. Через него владелец сообщает об актуальной структуре ресурса. Указать на него можно директивой в robots.txt либо в интерфейсе сервиса, и оба способа допустимо использовать одновременно.
Задачи, которые карта сайта Яндекс Sitemap xml решает для поисковой системы:
- Обнаружение. Алгоритм получает опись целиком, не дожидаясь, пока доберётся до каждой строки внутренними переходами.
- Экономия краулингового бюджета. Число обращений к домену ограничено, и готовый список помогает тратить его на содержательное, а не на дубли.
- Передача метаданных. По значению lastmod с датой изменения алгоритм выбирает, что переобойти в первую очередь.
- Специализированные данные об изображениях. Их передают в том же файле расширением image, и картинки попадают в поиск по изображениям; о видео Яндекс узнаёт из микроразметки страницы, а не из карты.
Сам по себе файл не влияет на ранжирование и не поднимает позиции. Он ускоряет обнаружение нового. Решение о включении страницы в базу принимает алгоритм, и запись в файле его не гарантирует. Но без индексации в выдаче не виден даже сильный текст, поэтому настройка остаётся базовой.
Требования к файлу Sitemap
Собственного формата у поисковой системы нет. Sitemap xml для Яндекса собирают по общему протоколу sitemaps.org. Файл лежит в открытом доступе, отдаётся сервером как разметка и кодируется в UTF-8. Внутри указывают абсолютные пути, с тем же протоколом и хостом, что и у самого файла. Для поддоменов собирают отдельные файлы: они считаются самостоятельными сайтами.
Есть и лимит на длину ссылки, который составляет 2048 символов, из них 1024 отводятся доменному имени и ещё 1024 внутреннему пути.
Структура файла и теги
Внутри корневого элемента urlset каждая страница описана блоком url. Обязательное поле там одно: loc с абсолютным адресом. Остальные воспринимаются как рекомендации:
- loc – адрес страницы, без него блок не имеет смысла.
- lastmod, дата последнего изменения в формате ГГГГ-ММ-ДД. Алгоритму она полезна, но ставить её стоит только при реальных правках: одинаковое «сегодня» у всех страниц обесценивает подсказку.
- changefreq, предполагаемая частота обновления. Рекомендация, а не команда.
- priority – относительная важность адреса от 0 до 1 внутри одного хоста. На выдачу значение не влияет.
Один файл вмещает не больше 50 000 URL и весит не больше 50 МБ в несжатом виде. Отдавать файл разрешено в сжатом виде gzip, лимит объёма при этом считается по распакованному размеру.
Файл индекса Sitemap для больших сайтов
Когда адресов больше лимита, их разбивают на части и собирают в файл индекса sitemap с корневым элементом sitemapindex, где каждый блок ссылается на свою часть и может нести свой lastmod. Поисковая система обрабатывает каждый вложенный файл отдельно.
Разбивку удобно делать по смыслу: отдельно карточки товаров, отдельно каталог, отдельно блог. Тогда по статистике видно, где возникли сложности, и не приходится искать проблему в перечне на десятки тысяч строк.
Как создать Sitemap
Способов, как сделать карту сайта, четыре: плагин или модуль CMS, онлайн-генератор по домену, программный краулер и ручная сборка в текстовом редакторе.
Выбор зависит от размера проекта и от того, как часто меняется структура.
Общее правило одно: перечень должен обновляться сам. Ручная сборка и разовая выгрузка генератора устаревают в тот момент, когда появляется новая страница, поэтому магазинам и медиа подходит только автоматика.
Плагины и модули CMS
Это рабочий вариант для большинства сайтов. В WordPress файл собирают плагины Yoast SEO, Rank Math и All in One SEO, в 1С-Битрикс за это отвечает встроенный модуль поисковой оптимизации, а Tilda генерирует всё сама. Плагин следит за изменениями, поэтому опубликованная запись попадает в файл без вашего участия.
Порядок включения генерации в CMS на примере WordPress:
- Установите и активируйте плагин из каталога.
- Включите генерацию в его настройках.
- Выберите типы контента для выгрузки: страницы, записи, категории и метки.
- Исключите служебные разделы, архивы автора, дубли меток и страницы внутренней выдачи.
- Сохраните настройки и откройте получившийся файл в браузере, чтобы убедиться, что он отдаётся.
Дальше он работает сам.
Онлайн-генераторы
Сервис принимает домен, обходит доступные разделы и отдаёт готовый файл для загрузки в корень. Способ выручает, когда проект написан без CMS или модуля для неё нет.
Ограничения известны. Бесплатные версии обходят проекты до определённого размера, динамический контент на JavaScript обрабатывают не всегда корректно, а результат не обновляется сам.
При каждой правке структуры генерацию повторяют вручную.
Программная генерация и создание вручную
Программные краулеры вроде Screaming Frog сканируют сайт так же, как поисковая система, и выгружают результат сканирования готовым файлом. Такой генератор видит редиректы, коды ответа и канонические версии, поэтому файл получается чище, чем у простого онлайн-сервиса.
Крупные сайты генерируют файл на стороне сервера: скрипт обращается к базе и собирает его по расписанию либо отдаёт динамически при запросе. На визитке из десятка страниц оправдана и ручная сборка: разобраться, как создать sitemap xml руками, несложно, а структура там меняется раз в полгода.
Как проверить Sitemap перед отправкой
До того как сообщать Яндексу о файле, стоит убедиться, что он вообще откроется.
Проверка занимает минуты и снимает большую часть причин, по которым файл потом висит с ошибкой.
Правило отбора простое. Каждый адрес ведёт на доступную, индексируемую и каноническую страницу. Если хоть одно условие не выполняется, адрес убирают:
- Файл открывается публично, без авторизации, и отдаёт разметку, а не HTML-страницу и не редирект.
- Кодировка UTF-8, все элементы закрыты, разметка не нарушена.
- Убраны страницы с метатегом noindex: как их находить и настраивать, разобрано в материале про тег noindex.
- Убрано всё, что закрыто в robots.txt директивой Disallow, вместе со служебными каталогами.
- Убраны редиректы, в файле остаются только конечные URL.
- Убрано всё с параметрами-дублями, битые адреса и дубли без указания канонической версии.
За разметку отвечает валидатор в блоке «Инструменты». Файл туда передают тремя способами: вставкой текста, ссылкой либо загрузкой. На выходе инструмент даёт перечень сломанных мест и непонятных элементов. Отдельно стоит прогнать проверку ответа сервера по полному пути. Любой код, кроме 200, означает, что до содержимого краулер не доберётся.
Как сообщить Яндексу о файле Sitemap
Способов два, и они не исключают друг друга. Это директива в robots.txt и добавление адреса прямо в интерфейсе.
Указание Sitemap в robots.txt
Этот файл лежит в корневом каталоге. Строка Sitemap в robots.txt пишется отдельно от блоков User-agent и выглядит так: Sitemap: https://example.com/sitemap.xml. Когда карт несколько, такие записи перечисляют подряд, по одной на каждую. Директива межсекционная, поэтому её место в документе роли не играет.
Добавление файла в Яндекс Вебмастер
Разберём, как добавить sitemap в Яндекс Вебмастер вручную. Этот способ отличается обратной связью, ведь интерфейс покажет, что с файлом произошло дальше. Понадобятся подтверждённые права, иначе поле для ввода будет недоступно.
- В левом меню разверните пункт «Индексирование» и перейдите к странице со списком карт.
- Убедитесь, что вверху выбран нужный проект, если их у вас несколько.
- Укажите полную ссылку на файл вместе с протоколом, а не только путь от корня.
- Подтвердите ввод кнопкой добавления.
Что происходит после добавления: статусы и обновление файла
Добавленный файл попадает в очередь на обработку: сразу его не разбирают. На загрузку отводится до двух недель, и считается он для каждого файла Sitemap, который получил Яндекс. Вложенные в индекс тоже идут своей очередью. Пока срок не вышел, пустая таблица ни о чём плохом не говорит.
После обработки по карте сайта Яндекс Вебмастер показывает три величины: число найденных внутри адресов, число уже попавших в индекс и число давших ошибку. Заметная разница между первыми двумя выдаёт трудности с обходом или слабое содержимое материалов. Отдельно проверяйте дату последнего обращения. Если она давняя, проверьте, открывается ли файл вообще.
Статусы файла в Вебмастере
Напротив каждой строки сервис показывает один из четырёх статусов, и по каждому есть своё действие:
- «OK». Всё сформировано правильно и загружено в базу робота, рядом стоит дата последней загрузки. Делать ничего не нужно.
- «Редирект». Указанный URL ведёт на другой путь. Уберите перенаправление и отправьте файл на переобход.
- «Ошибка». Разметка составлена неправильно. Откройте подробности по ссылке в статусе, исправьте файл и отправьте его на переобход.
- «Не проиндексирован». Сервер отдал код, отличный от 200, либо доступ закрыт директивой Disallow. Проверьте ответ по полному пути и снимите запрет.
Убедиться, что перечисленное дошло до выдачи, помогает вкладка «Страницы в поиске» в том же блоке индексирования. Там видно и попавшее в индекс, и причины исключения остального. Подробнее эти способы разобраны в статье о том, как проверить индексацию сайта и страниц.
Как обновлять и удалять Sitemap
Правки внутри файла заново загружать не требуется: содержимое перечитывается по расписанию само. Ускорить это перечитывание помогает значок рядом со строкой, после нажатия на который свежие данные подтягиваются за три дня. Ограничение на такое ускорение составляет 10 нажатий на один хост. Исчерпав их, придётся ждать, потому что очередная попытка откроется спустя 30 дней после самой первой, и точную дату сервис назовёт сам.
Когда файлов несколько и они собраны индексом, обработку разрешено запускать по каждому из них поштучно. Удаляют файл значком удаления напротив его строки, не забывая стереть директиву Sitemap в robots.txt, если она там стояла. Из базы сведения исчезают за несколько недель.
Ошибки Sitemap и как их исправить
Ошибки делятся на две группы. Одни лежат в самом файле, другие в его доступности для робота. Первые находит «Анализ файлов Sitemap», вторые показывает «Проверка ответа сервера».
Внутри чаще всего встречаются адреса чужих доменов и поддоменов, битые ссылки и редиректы, из-за которых падает доверие поиска к файлу, неверная кодировка, незакрытые теги и нарушенная разметка, размещение в закрытой директории, а также changefreq, не соответствующий реальной частоте обновлений.
Некоторые статусы выглядят пугающе, но поводом для правок не служат. «Неизвестный тег» появляется из-за элементов, которых протокол не предусматривает: неподдерживаемое просто пропускается мимо, всё остальное учитывается, и трогать разметку не надо.
Ещё сервис умеет показывать вашу карту среди исключённого с пометкой «Неверный формат документа». Смысл у пометки справочный, ведь краулер попробовал прочитать файл как обычную страницу и не смог. Так же безобидны «Документ не содержит текст» и «Запрещён метатегом noindex», ни один из них обработке не мешает.
Статус «Не проиндексирован» возникает по трём причинам:
- робот обошёл файл недавно и ещё не обработал его;
- ресурс был ему недоступен;
- доступ запрещён директивой Disallow или сервер отвечает кодом не 200.
Как устроен запрет и как его снять, разобрано в материале про директиву Disallow в robots.txt.
Если файл не обрабатывается дольше двух недель, проверьте три вещи по порядку. Относится ли он к тому же хосту, включая протокол и www; какой код приходит по этому адресу; что показывает валидация в инструменте «Анализ файлов Sitemap». Когда причина лежит глубже, в настройках сервера или в редиректах, помогает технический аудит сайта, при котором эти настройки проверяют вместе.
Как ускорить индексацию после добавления Sitemap
Перечень сообщает роботу об адресах, но не управляет очередью обхода. Когда материалы нужны в выдаче быстрее, к нему добавляют другие инструменты Вебмастера:
- «Переобход страниц». Это ручная заявка на конкретные адреса. Число заявок ограничено суточной квотой, лимит виден в самом инструменте, поэтому отправляют туда приоритетные разделы, а не весь каталог.
- Протокол IndexNow. Здесь ресурс сам сообщает об изменении, добавлении или удалении своих адресов, не дожидаясь планового визита.
- «Обход по счётчикам» через Яндекс Метрику. Здесь поиск узнаёт о новых материалах по визитам живых пользователей. Перед включением стоит настроить обработку GET-параметров, иначе в обход уйдут дубли с метками.
Помогает и работа с самим перечнем. На большом проекте из него убирают то, что Яндексу уже известно, и оставляют новое или часто обновляемое. Что именно робот успел обойти, видно в разделе Индексирование → Статистика обхода. В файле индекса тегом lastmod помечают те части, которые обновляются чаще других.
Если новое не появляется в выдаче неделями, причина обычно не в нём. Сервер отвечает медленно, разделы закрыты от индексации, содержимое дублируется. Остальные причины долгой индексации и порядок их устранения разобраны в материале про проблемы индексации сайта.





