Чем отличается ответ для бота и для обычного пользователя?
Сайт видит User-Agent и IP запроса и может отдать разное: другой код ответа, редирект по региону или языку, другую разметку. Небольшие различия нормальны: реклама, персональные блоки, баннер про cookie. Опасно, когда роботу показывают другой текст или другие ссылки, чем людям. Это называется клоакингом, и за него поисковики понижают сайт или исключают страницу. Проверка сравнивает код ответа, итоговый адрес, заголовок и долю отличающегося текста у Googlebot, YandexBot и браузера.
Что такое canonical и почему он указывает на другой адрес?
Canonical это тег link rel="canonical" в head страницы: он подсказывает поисковику, какой адрес считать главным среди дублей. Если на странице стоит canonical на другой адрес, поисковик, скорее всего, покажет в выдаче тот адрес, а эту страницу выкинет как дубль. Это нормально для версий с параметрами и пагинации по задумке, но ошибка, если canonical по недосмотру ведёт на главную или на чужую страницу. У нормальной страницы canonical указывает на неё саму.
Чем noindex в заголовке ответа отличается от noindex в мета-теге?
Смысл один: не добавлять страницу в индекс. Мета-тег meta name="robots" лежит в коде страницы и работает только для HTML. Заголовок X-Robots-Tag отдаёт сервер, он работает и для PDF, картинок и других файлов, а в исходном коде страницы его не увидеть, поэтому его часто забывают после тестового запуска. При конфликте поисковик берёт самое строгое значение. Проверка показывает оба значения отдельно для каждого робота.
Почему страница с кодом 200 может быть «мягкой 404» и что делать?
Мягкая 404 это страница, которая для поисковика выглядит как «не найдено», хотя сервер отвечает кодом 200: мало текста, фразы вроде «товара нет» или «страница не существует», пустая выдача. Такие страницы Google и Яндекс исключают из индекса. Если страницы действительно нет, верните настоящий 404 или 410. Если страница нужна, наполните её содержимым или настройте 301 на близкую по смыслу. Для пустых категорий добавьте реальные товары или закройте их noindex.
Что делать, если сайт строится JavaScript?
Проверка загружает HTML и не выполняет скрипты, как робот на первом шаге. Если в ответе почти нет текста, а в body лежит только контейнер, значит содержимое появляется после работы JavaScript. Google выполняет скрипты с задержкой и не всегда полностью, Яндекс делает это ограниченно, а чат-боты нейросетей чаще не выполняют их вовсе. Поэтому важный текст, заголовки, ссылки и мета-теги отдавайте в готовом HTML: серверный рендеринг, предрендер или статическая генерация.
Это настоящий робот Google и Яндекса?
Нет. Запрос идёт с нашего сервера, и мы лишь подставляем в него User-Agent Googlebot и YandexBot. Настоящих ботов сайты отличают по IP-адресу, поэтому, если сервер отдаёт им особый ответ, здесь он не проявится. Проверку настоящим роботом даёт «Проверка URL» в Search Console и «Проверка ответа сервера» в Яндекс Вебмастере, а ещё логи вашего сервера, где видно реальные визиты ботов.
Какие лимиты и что даёт регистрация?
Без регистрации: 15 проверок в час и 30 проверок в сутки на один сайт. В бесплатном аккаунте: 60 проверок в час и 100 проверок в сутки на один сайт, на платных тарифах: 200 проверок в час и 200 проверок в сутки на один сайт. Войдите в аккаунт в этом же браузере, и страница сама применит ваш лимит и покажет остаток. Аккаунт включает ещё и ежедневную проверку и письмо при изменениях. Если лимит исчерпан, страница назовёт причину и время повтора.