Как проверить robots.txt и sitemap: что значат замечания и что исправить
Файлы robots.txt и sitemap.xml небольшие, но одна неверная строка может закрыть от поиска весь сайт или отправить робота в пустоту. Проверка занимает минуту и не требует доступа к сайту.
Коротко. Откройте проверку robots.txt и sitemap, введите домен и при необходимости путь страницы, нажмите «Проверить». Сначала исправьте «Ошибки» (закрытый сайт, коды 4xx и 5xx на файле), затем «Предупреждения». Если страница «Разрешена», а в поиске её нет, причина не в robots.txt: смотрите noindex, canonical и ответ сервера.
Что проверяют robots.txt и sitemap
Файл robots.txt лежит в корне сайта (example.ru/robots.txt) и подсказывает роботам, какие разделы можно читать, а какие нет. Sitemap это XML-файл со списком страниц, которые вы хотите показать поиску.
У них разные задачи. Robots.txt ограничивает обход, sitemap подсказывает, что обойти. Если страница закрыта в robots.txt, но лежит в карте, поисковик получает противоречивые сигналы: такую страницу стоит либо открыть, либо убрать из карты.
Как запустить проверку
- Откройте проверку robots.txt и sitemap. Регистрация и почта не нужны, доступ к сайту, Search Console и Вебмастеру тоже.
- В поле «Адрес сайта» впишите домен, например
example.ru. Если вставите адрес сhttps://и путём, лишнее отрежется, а путь подставится во второе поле. - Чтобы узнать про конкретную страницу, заполните поле «Проверить, открыта ли страница»: путь
/catalog/или полный адрес страницы этого же сайта. - Нажмите «Проверить». Обычно это занимает несколько секунд, на медленных сайтах до минуты.
- Прочитайте результат сверху вниз. После правок на сайте нажмите «Проверить» ещё раз.
Проверка берёт файлы у сайта так же, как это делает робот, и ничего на сайте не меняет.
Как читать результат
Результат для нашего сайта: сводка, код ответа файла и правила для роботов.
Сверху стоит сводка: сколько найдено ошибок, предупреждений и заметок. Уровень написан словом, а не только цветом. «Ошибка» ломает работу файла или закрывает сайт, «Предупреждение» может навредить, «Заметка» только информирует. Ниже четыре блока.
- robots.txt. Адрес, код ответа, размер, найденные строки Sitemap и правила по группам: что закрыто (Disallow), что открыто (Allow). На снимке видно, что у нашего сайта для всех роботов закрыты служебные разделы вроде
/login/и/api/, остальное открыто. - Замечания. Список с пояснением и строкой «Что делать».
- Открыта ли страница. Таблица по Googlebot, YandexBot, Bingbot и остальным роботам: разрешено или закрыто и какое правило сработало. Действует самое длинное подходящее правило, а при равной длине побеждает Allow. Маски
*и$поддерживаются. - Sitemap. Адрес, код ответа, тип (карта страниц или индекс карт), число адресов, размер и пример нескольких адресов с кодами ответа. В карте должны лежать открытые адреса с кодом 200.
Какие замечания исправлять первыми
Сначала то, что закрывает сайт или ломает файл.
- Закрыт весь сайт (
Disallow: /для всех роботов). Уберите правило, если сайт должен быть в поиске, и закрывайте только служебные разделы. - Файла нет (код 404). Создайте файл в корне: строка
User-agent: *и строкаSitemapс адресом карты. - Ошибка сервера (5xx) на robots.txt. Найдите причину в логах и добейтесь ответа 200: при ошибке Google может на время прекратить обход сайта.
- Коды 401 и 403. Откройте файл для всех, без входа и без проверки браузера.
Затем предупреждения.
- Директива Host. Удалите строку: Яндекс перестал её учитывать. Главное зеркало задайте 301-редиректом и в Яндекс Вебмастере.
- Crawl-delay. Google эту директиву игнорирует. Скорость обхода для Google меняют в Search Console, для Яндекса в Вебмастере.
- Файл больше 500 КиБ. Google читает только начало файла. Уберите повторы и устаревшие правила, используйте маски.
- Sitemap без полного адреса. Впишите адрес целиком, с
https://и доменом.
Замечания к карте сайта.
- Карта не открывается или не разбирается как XML. Проверьте адрес в строке Sitemap: нужен ответ 200 без пароля. Частая причина: вместо файла отдаётся HTML-страница.
- Больше 50 000 адресов или 50 МБ. Разделите карту на части и соберите через sitemap index.
- Адреса чужого хоста, http вместо https, www и без www. Оставьте в карте только адреса основного варианта сайта по https.
- Неверный lastmod или дата из будущего. Используйте формат
2026-10-07и реальную дату изменения страницы.
Замечание, которого нет в справочнике, сервис показывает как есть, с текстом и номером строки. Полная расшифровка: справка по проверке.
Что проверка не гарантирует
«Разрешено» в таблице значит только, что правила robots.txt не мешают обходу. В индексе страница может не оказаться из-за noindex, canonical или ответа сервера. Не закрывайте страницу в robots.txt и noindex одновременно: робот, которому нельзя открыть страницу, не прочитает на ней noindex.
Если вы исправили файл, а проверка показывает старую версию, откройте example.ru/robots.txt в браузере. Когда и там старая версия, очистите кеш сайта или CDN. Если в браузере сайт открывается, а проверка пишет 401, 403 или 5xx, защита от ботов или файрвол режет запросы и, скорее всего, запросы поисковых роботов тоже. Это стоит исправить в первую очередь.
Что делать дальше
- Исправьте ошибки и проверьте сайт ещё раз.
- Если страница «Разрешена», но в поиске её нет, посмотрите её глазами робота: как увидеть страницу глазами поискового робота и бесплатная проверка страницы. Общий порядок причин разобран в статье почему страница не в индексе.
- Сообщите поисковикам об исправлениях через IndexNow: так о новых и изменённых страницах узнают Яндекс и Bing.
- Чтобы не проверять руками, подключите сайт в кабинете: раздел «Здоровье» проверяет robots.txt и sitemap по расписанию, а оповещения сообщат о закрытом robots.txt.
Частые вопросы
Нужна ли регистрация для проверки?
Нет. Нужен только адрес сайта. Без регистрации действует лимит 20 проверок в час, в бесплатном аккаунте он выше: 100 проверок в час.
Чем robots.txt отличается от noindex?
Robots.txt управляет обходом: он говорит роботу, какие страницы не открывать. Noindex это запрет добавлять уже открытую страницу в поиск, он задаётся метатегом или заголовком ответа.
Страница «Разрешена», но в индексе её нет. Что смотреть?
Проверьте noindex, canonical, код ответа и наличие текста в HTML. Всё это показывает проверка страницы глазами робота.
Как часто проверять robots.txt и sitemap?
После каждого релиза, смены CMS, хостинга или правил редиректов. Разовая проверка показывает состояние на сейчас, для регулярной проверки нужен кабинет: раздел «Здоровье» делает её по расписанию.
Читайте также
- Почему страница не в индексе Google и Яндекса: причины и как проверить
- Как увидеть страницу глазами поискового робота: noindex, canonical, редиректы и клоакинг
- IndexNow: как ускорить индексацию в Яндексе и Bing без регистрации
Справка по теме
Разборы SEO и GEO выходят и в Telegram, в канале основателя платформы Алексея Дёмкина: @ademkin_seo.
