Как найти и устранить блокировку индексации в Яндексе

Обложка статьи: Как найти и устранить блокировку индексации в Яндексе

Коротко: если страница закрыта от робота Яндекса или помечена noindex, никакая другая оптимизация не поможет - её не будет ни в обычной выдаче, ни в ответах Алисы AI. Диагностику начинайте в разделе «Страницы в поиске» Яндекс Вебмастера, а починку ведите по порядку: сначала случайный noindex, затем robots.txt, sitemap, canonical и коды ответа. Ниже - как пройти этот путь самому.

Как проверить индексацию сайта и найти причину, по которой страница выпала из поиска?

Откройте раздел «Страницы в поиске» в Яндекс Вебмастере - он показывает точную причину по каждой странице, а не только сам факт исключения.

Сразу разведите два понятия, их часто путают:

  • Обход - когда робот скачивает страницу с вашего сайта.
  • Индексация - когда поисковик добавил страницу в свою базу и она может показываться в выдаче.

Если Вебмастер у вас ещё не подключён, начните с подключения - без него часть проверок просто недоступна.

Порядок шагов ниже не случайный. Сначала идут запреты, которые убирают страницу из поиска целиком: noindex и robots.txt. Потом то, что влияет на выбор адреса и скорость обхода: sitemap, canonical и коды ответа. Если пойти с конца, можно долго чинить карту сайта для страницы, которую поисковику в это время запрещено показывать.

Шаг 1. Не стоит ли на важных страницах случайный noindex - и как его снять

Как это обычно выглядит: на коммерческой странице услуги случайно стоит noindex; важный раздел спрятан за логином (доступен только после входа); заблокированы файлы, без которых поисковик не может отрисовать страницу.

Что делать:

  1. Проверьте важные страницы (услуги, каталог, статьи) на наличие noindex, none и заголовка X-Robots-Tag.
  2. Снимите noindex со всех страниц, которые должны быть в поиске. Оставьте его только на служебных - корзина, личный кабинет, страница «спасибо» после заявки.
  3. Откройте контент для робота: коммерческие и контентные страницы не должны прятаться за авторизацией, за логином место только личным кабинетам.
  4. Разблокируйте файлы, нужные для отрисовки страницы.

Заголовок X-Robots-Tag живёт не в HTML-коде, а в ответе сервера - его правят в настройках сервера и в правилах CDN, сервиса, который раздаёт сайт по сети.

Честно: снятие noindex не гарантирует, что страница попадёт в индекс и поднимется в выдаче. Решение принимает Яндекс сам - вы лишь убираете преграду.

Шаг 2. Не закрыт ли важный раздел в robots.txt?

Откройте robots.txt своего сайта и проверьте, нет ли запрещающей директивы Disallow на разделах, которые должны быть в поиске. Запрет только в robots.txt может обернуться тем, что страница всё равно попадёт в выдачу, но без описания.

Типичные поломки: Disallow стоит на разделах услуг или каталога; файл лежит в подкаталоге, а не в корне домена; отвечает не кодом 200; в файле случайно оказалась строка Disallow: /, которая закрывает весь сайт целиком.

Как чинить:

  1. Перенесите robots.txt в корень домена (адрес вида https://site.ru/robots.txt).
  2. Добейтесь, чтобы файл отдавал код 200 (сигнал «всё в порядке, страница открыта»).
  3. Снимите запреты с важных разделов.
  4. Закрывайте только служебное - например /admin/, /cart/, /login/.

Отдельно проверьте двух роботов Яндекса. YandexBot отвечает за обычный поиск: если он закрыт для нужных разделов, Яндекс не сможет их обойти и проиндексировать. YandexAdditional отвечает за ответы Алисы: запрет для него в robots.txt убирает сайт из AI-ответов, даже когда с обычной индексацией всё в порядке. Каких именно роботов Яндекса блокировать нельзя, разобрано в отдельном материале - «Роботы ИИ на вашем сайте: кого нельзя блокировать».

И обратное правило, о которое легко споткнуться: страницу, которую вы закрываете метатегом noindex, нельзя одновременно запрещать в robots.txt. Робот не станет её обходить, а значит и не увидит запрет - страница так и останется в выдаче. Чтобы убрать страницу из поиска, её оставляют открытой для обхода и помечают noindex.

Шаг 3. Проверить и починить sitemap

Если карта недоступна или отвечает ошибкой, робот её не обработает, и обнаружение новых и изменённых страниц замедляется. Вредят и закрытые или несуществующие адреса внутри самой карты.

Как чинить:

  1. Сгенерируйте актуальный sitemap (это делают движок сайта или плагин).
  2. Убедитесь, что он отдаёт код 200.
  3. Пропишите путь к нему в robots.txt строкой Sitemap: https://site.ru/sitemap.xml и добавьте карту в Яндекс Вебмастере.
  4. Держите в карте только те адреса, которые должны быть в индексе.

Честно: sitemap ускоряет обнаружение страниц, но не гарантирует их индексацию и рост позиций.

Шаг 4. Куда указывает canonical - и почему это подсказка, а не команда?

Сам canonical - это строка в коде, которая говорит поисковику, какой адрес считать основным среди похожих: например, когда один и тот же товар открывается по нескольким URL из-за сортировок, фильтров или меток в адресе.

Частые поломки: canonical ведёт на адрес, который сам закрыт от индексации; прописан относительным путём вместо полного адреса; на одной странице стоят несколько разных canonical, которые спорят друг с другом.

Что делать: оставьте один абсолютный canonical, ведущий на нужный адрес с кодом 200, и уберите конфликтующие. Дубли, которые плодятся из-за меток в адресе (UTM и подобные), закрывают директивой Clean-param в robots.txt или указывают canonical на основной адрес.

Шаг 5. Проверить коды ответа сервера и редиректы

Код ответа сервера - это короткий сигнал, который страница возвращает браузеру и роботу о своём состоянии: soft-404 - это страница «ничего не найдено», которая при этом отвечает 200 и тем самым путает поисковик, а длинная цепочка редиректов - это несколько автоматических переадресаций подряд с одного адреса на другой.

Что делать: верните 200 рабочим страницам; несуществующим отдавайте 404 или 410; на время техработ - 503; сократите редиректы до одного шага без петель, чтобы конечная страница отвечала 200. Для постоянного переезда, включая переход с HTTP на HTTPS, используйте 301 или 308, а не временные 302 и 307.

КодЧто означаетКогда отдавать
200Страница есть и открытаВсем рабочим, целевым страницам
404Страница не найденаНесуществующим адресам
410Страница удалена навсегдаСтраницам, которые убрали совсем
503Сервис временно недоступенНа время техработ (желательно с заголовком Retry-After - подсказкой, когда зайти снова)
301Постоянный переезд на новый адресПри постоянной смене адреса, HTTP→HTTPS
308Постоянный переезд (аналог 301)То же, что 301 - современный вариант
302Временный переездТолько если адрес скоро вернётся на место
307Временный переезд (аналог 302)То же, что 302

Как проверить самому: чеклист

  • Подключён Яндекс Вебмастер, изучены причины исключения в разделе «Страницы в поиске».
  • На важных страницах нет случайного noindex, none или заголовка X-Robots-Tag.
  • robots.txt лежит в корне, отдаёт 200, важные разделы не под Disallow, YandexBot не закрыт.
  • YandexAdditional не закрыт в robots.txt, если сайт должен попадать в ответы Алисы.
  • Страницы с noindex открыты для обхода, а не закрыты в robots.txt одновременно.
  • sitemap доступен (код 200), не закрыт, указан директивой Sitemap:, содержит только нужные адреса.
  • canonical абсолютный, единственный, ведёт на нужный адрес с кодом 200.
  • Рабочие страницы отдают 200, нет soft-404, редиректы короткие (один 301 или 308).

Если проверка по списку упирается в правки сервера, передайте их разработчику или поддержке хостинга: настройки robots.txt, кодов ответа, canonical и заголовка X-Robots-Tag живут на стороне сайта, а не в тексте страницы. Точные сроки, за которые Яндекс переиндексирует страницу после починки, назвать нельзя. Общий обзор по технике и другим сигналам - в материале «SEO-оптимизация сайта».

Хотите проверить, как поиск видит вашу страницу? Введите URL - покажем диагноз и список правок.

Проверить свой сайт

Частые вопросы

Может ли robots.txt удалить страницу из поиска?

Нет. robots.txt управляет обходом - разрешает или запрещает роботу скачивать страницу, - но сам по себе не убирает её из выдачи. Чтобы убрать страницу из поиска, нужен метатег noindex, а страницу с noindex нельзя одновременно закрывать в robots.txt: если робот не сможет её обойти, он не увидит и сам запрет.

Что будет, если закрыть YandexAdditional в robots.txt?

Сайт перестанет попадать в ответы Алисы AI, даже если с обычной индексацией всё в порядке: YandexAdditional - отдельный робот Яндекса, который отвечает именно за AI-ответы. При этом открытие YandexAdditional само по себе не гарантирует, что сайт попадёт в ответы Алисы - решение принимает Яндекс.

Сколько времени занимает переиндексация страницы после починки?

Точные сроки Яндекс не называет, и обещать их нельзя. Робот обходит и переобходит страницы по своему расписанию, поэтому эффект от исправлений может проявиться не сразу.

В каком порядке чинить технические блокировки, если проблем несколько?

Сначала запреты, которые убирают страницу из поиска целиком, - случайный noindex и robots.txt, а уже потом то, что влияет на выбор адреса и скорость обхода, - sitemap, canonical и коды ответа. Если начать с конца, можно долго чинить карту сайта для страницы, которую поисковику в это время запрещено показывать.

Гарантирует ли исправление технических блокировок рост позиций в поиске?

Нет. Устранение технических блокировок убирает техническое препятствие, но не гарантирует индексацию, рост позиций или трафика - решение о показе страницы в выдаче принимает сам Яндекс.

Источники

  • Яндекс, справка по robots.txt.
  • Яндекс Вебмастер, раздел «Страницы в поиске».
  • Яндекс, справка про директиву Clean-param.
  • Яндекс, справка про Поиск с Алисой.
Поделиться: ВКонтакте Telegram