Проверка noindex на сайте: как найти страницы, случайно закрытые от индексации

Директива noindex полезна для служебных и дублирующих страниц, но одна забытая настройка может закрыть от поисковых систем важный URL. Разберём, где искать запрет, как проверить его технически и как определить, действительно ли он лишний.

Что именно означает noindex

noindex — инструкция поисковому роботу не включать документ в индекс. В рамках этой проверки нас интересуют два способа её передачи: HTML-тег meta robots внутри страницы и HTTP-заголовок X-Robots-Tag в ответе сервера.

<meta name="robots" content="noindex, follow">
HTTP/2 200
X-Robots-Tag: noindex, follow

Первый вариант обычно появляется из шаблона CMS, SEO-модуля или ручной разметки. Второй может быть задан веб-сервером, приложением, прокси или CDN. Заголовок особенно легко пропустить: его не видно в исходном HTML, хотя робот получает инструкцию вместе с ответом.

Значение follow не отменяет noindex. Оно касается перехода по ссылкам, а не возможности индексировать сам документ. Аналогично, none обычно трактуется как сочетание noindex, nofollow.

Эта диагностика не отвечает на вопрос, присутствует ли страница сейчас в выдаче Яндекса. Она проверяет технический запрет в ответе URL. Индекс поисковой системы может обновляться не сразу, а исключение из выдачи может иметь и другие причины.

Когда запрет становится ошибкой

Наличие noindex само по себе не доказывает проблему. Сначала нужно определить назначение URL. Запрет выглядит подозрительно, если страница должна привлекать посетителей из поиска: это карточка доступного товара, категория, статья, страница услуги, города или другой самостоятельный посадочный документ.

Напротив, noindex может быть осознанным для результатов внутреннего поиска, технических фильтров, страниц входа, корзины, личного кабинета, тестовых представлений и некоторых дублей. Решение зависит от архитектуры сайта: универсального списка URL, которые всегда следует закрывать, нет.

Проверяемые признаки случайного закрытия

  • URL указан в XML-карте сайта, но одновременно содержит noindex;
  • на страницу ведут основные пункты меню, каталог или другие важные внутренние ссылки;
  • у страницы есть уникальные title, H1 и содержимое, рассчитанное на внешний спрос;
  • аналогичные страницы раздела открыты для индексации, а запрет стоит только на части URL;
  • noindex появился после переноса, смены шаблона, релиза или копирования настроек тестового сайта.

Каждый признак требует проверки контекста. Например, наличие URL в sitemap может означать не ошибочный noindex, а устаревшую карту сайта. Исправлять нужно источник противоречия, а не обязательно директиву.

Алгоритм проверки noindex на сайте

1. Составьте список URL для проверки

Начните с XML-карты сайта, важных разделов и посадочных страниц. Добавьте URL, которые недавно создавались, переносились или меняли шаблон. Для крупного проекта полезно разделить выборку по типам: товары, категории, статьи, услуги и служебные документы. Так проще заметить отклонение внутри одного шаблона.

2. Получите конечный HTTP-ответ

Проверяйте не только введённый адрес, но и URL после всех перенаправлений. Команда curl позволяет увидеть цепочку ответов и заголовки:

curl -sS -L -D - -o /dev/null https://example.ru/page/

Найдите X-Robots-Tag в конечном ответе и промежуточных ответах. Заголовок может встречаться несколько раз. При объединении директив действует наиболее ограничивающая инструкция: наличие index в одном месте не следует считать гарантированной отменой noindex из другого.

3. Проверьте HTML конечной страницы

Откройте исходный код ответа, а не только панель Elements в браузере. Найдите теги с именами robots и именами конкретных поисковых роботов. Типовой вариант:

<meta name="robots" content="noindex">

Учитывайте регистр без строгой привязки: NOINDEX и noindex должны попасть в отчёт одинаково. Проверьте все совпадения, потому что два тега могут содержать конфликтующие инструкции. Отдельно зафиксируйте теги для конкретного робота: общая директива может сочетаться с адресной.

4. Сопоставьте директиву с назначением URL

Для каждого найденного запрета назначьте статус: «обоснован», «ошибка» или «требует решения». Не удаляйте директиву массово только потому, что URL отвечает кодом 200. Служебная страница тоже может корректно возвращать успешный ответ.

5. Найдите источник настройки

Если запрет ошибочный, определите, откуда он пришёл: поле SEO-настроек, условие шаблона, middleware приложения, конфигурация сервера или правило CDN. Это важнее точечной правки HTML: иначе директива вернётся после публикации или продолжит действовать на соседних страницах.

6. Повторите проверку после изменения

Очистите применимые кэши, запросите публичный URL заново и проверьте как HTML, так и заголовки. Убедитесь, что noindex исчез только там, где требовалось, а служебные страницы сохранили ожидаемые ограничения.

Рабочая таблица аудита

Что проверить Нормальный результат Сигнал для разбора
Конечный статус URL Ожидаемый код и понятная цепочка редиректов Проверяется не тот URL или возникает неожиданное перенаправление
meta robots Нет noindex на индексируемой странице Один или несколько тегов запрещают индексацию
X-Robots-Tag Нет запрещающей инструкции noindex добавлен сервером, приложением или CDN
Назначение страницы Директива соответствует роли URL Посадочная страница закрыта, служебная — открыта без решения
Единообразие шаблона Однотипные URL обрабатываются предсказуемо Запрет есть только на случайной части раздела
Sitemap и внутренние ссылки Сигналы не противоречат выбранной политике Закрытый URL продвигается навигацией и включён в sitemap

Типовые ошибки диагностики

Искать только строку в видимой части страницы

Meta-тег расположен в head и не показывается пользователю. Кроме того, запрет может находиться исключительно в HTTP-заголовке. Нужны оба уровня проверки.

Проверять только домашнюю страницу

Директива часто зависит от типа документа, параметра, категории или записи в CMS. Открытая главная ничего не говорит о карточках товаров и статьях. Нужна репрезентативная выборка каждого шаблона.

Не учитывать разные варианты URL

Адреса с HTTP и HTTPS, www и без него, завершающим слешем, параметрами или разным регистром пути могут приводить к разным ответам либо редиректам. Проверять следует канонический публичный вариант и фактическую конечную страницу.

Считать index явным разрешением

Запись index обычно избыточна и не должна использоваться как способ «перебить» запрет из другого источника. Надёжное исправление — удалить нежелательный noindex во всех применимых инструкциях.

Смешивать meta robots и robots.txt

robots.txt управляет доступом робота к обходу, а noindex в meta или заголовке передаёт инструкцию об индексировании документа. Это разные механизмы. В этой статье намеренно не рассматриваются ошибки и правила robots.txt.

Границы метода

Отсутствие noindex не означает, что URL обязательно появится в поиске. На обработку могут влиять доступность страницы для обхода, код ответа, canonical, качество и дублирование содержимого, внутренняя структура сайта и решения самой поисковой системы. Техническая проверка подтверждает только наличие или отсутствие рассматриваемой директивы в полученном ответе.

Также проверка одного момента не исключает нестабильность. Сервер может отдавать разные заголовки для устройств, регионов, авторизованных посетителей или узлов CDN. Если результаты расходятся, повторите запросы без cookies, из внешней сети и с фиксацией всей цепочки ответов.

Проверять нужно публичный URL. Просмотр шаблона в CMS или локальной копии не подтверждает, какой ответ получает робот на рабочем домене.

Итог

Надёжная проверка noindex на сайте состоит из четырёх частей: собрать важные URL, изучить HTML и X-Robots-Tag, сопоставить запрет с назначением страницы и повторно проверить публичный ответ после изменения. Ключевой результат аудита — не список всех noindex, а перечень противоречий, где техническая директива не соответствует роли URL.

Приоритет отдавайте страницам из sitemap, основного меню и коммерчески или информационно значимых разделов. Исправляйте источник правила, документируйте ожидаемую политику по шаблонам и не смешивайте эту задачу с проверкой фактического присутствия URL в выдаче.

Проверьте публичную страницу

SiteVisor анализирует публичный URL без доступа к CMS и помогает оценить технические, SEO/GEO и конверсионные сигналы. Результат проверки стоит сопоставить с назначением конкретной страницы и настройками проекта.

Запустить бесплатную проверку в SiteVisor