Что такое robots.txt и где он должен лежать?
Текстовый файл с правилами для поисковых роботов: какие разделы сайта можно обходить, а какие нет. Он должен открываться по адресу https://ваш-домен/robots.txt с кодом 200 и относится только к тому домену и протоколу, где лежит. Для поддомена нужен свой файл. Если файла нет (код 404), роботы считают, что ограничений нет.
Чем Disallow отличается от noindex?
Disallow в robots.txt запрещает роботу заходить на страницу, но не запрещает показывать её адрес в поиске, если на неё ведут ссылки. Noindex в мета-теге или заголовке ответа разрешает зайти, но просит не добавлять страницу в индекс. Чтобы убрать страницу из выдачи, она должна быть открыта для робота и отдавать noindex: закрытую в robots.txt страницу робот не откроет и тега не увидит.
Почему страница закрыта в robots.txt, но есть в индексе?
Индекс и обход работают отдельно. Если страница попала в индекс до запрета или на неё ведут ссылки, поисковик может оставить её в выдаче без описания, а содержимое прочитать не сможет. Решение: временно откройте страницу в robots.txt, добавьте на неё noindex и дождитесь переобхода. После исчезновения из выдачи при необходимости закройте раздел снова. Проверить, какое правило закрывает адрес, можно в блоке «Открыта ли страница» выше.
Какой лимит размера robots.txt у Google?
Google читает первые 500 КиБ файла, всё, что дальше, игнорирует. Правила из хвоста файла просто не сработают, и закрытые разделы окажутся открытыми. Если файл разросся, уберите повторы и устаревшие правила и заменяйте длинные списки масками со знаками * и $. Размер файла показан в блоке robots.txt в результате проверки.
Что делать с sitemap?
Укажите полный адрес карты в robots.txt строкой Sitemap: https://ваш-домен/sitemap.xml и отправьте её в Search Console и Яндекс Вебмастер. В одной карте допустимо до 50 000 адресов и 50 МБ, большие сайты делят карту на части и собирают через sitemap index. В карте должны быть только открытые адреса вашего сайта с кодом 200, на одном и том же варианте домена и по https. Проверка выше покажет число адресов, замечания и коды ответа нескольких адресов для примера.
Нужна ли директива Host в robots.txt?
Нет. Директиву Host поддерживал только Яндекс и перестал учитывать её в 2018 году, Google её не знал никогда. Главное зеркало задаётся 301-редиректом на нужный вариант домена, а для Яндекса ещё и в Вебмастере. Если проверка нашла Host, строку можно удалить без последствий.
Какие лимиты и что даёт регистрация?
Без регистрации: 20 проверок в час. В бесплатном аккаунте: 100 проверок в час, на платных тарифах: 300 проверок в час. Войдите в аккаунт в этом же браузере, и страница сама применит ваш лимит и покажет остаток. Аккаунт включает ещё и ежедневную проверку и письмо при изменениях. Если лимит исчерпан, страница назовёт причину и время повтора.