Роботы ИИ и robots.txt: кого нельзя блокировать на сайте

Обложка статьи: Роботы ИИ и robots.txt: кого нельзя блокировать на сайте

Коротко: у площадок есть раздельные роботы - одни собирают тексты для обучения нейросетей, другие обходят сайт для поиска. Поэтому отказаться от обучения ИИ можно, не выпав из поиска: запрещать надо точечно, по имени робота в robots.txt. Опасность - рубить скопом. Галка «блокировать ИИ-ботов» в Cloudflare заодно режет Googlebot, Bingbot и Applebot, то есть вашу обычную поисковую видимость. И ещё: AI-ответы Google и Яндекса собираются из обычного поискового индекса. Отдельной двери в них нет - есть только своя, которую можно случайно закрыть.

Кто ходит по вашему сайту и при чём тут robots.txt

По сайту ходят краулеры - программы, которые сами обходят страницы и забирают их содержимое. Никто их не зовёт, они приходят сами.

Ключевое, чего обычно не знают: у одной компании краулер не один. Googlebot собирает страницы для поиска, Google-Extended забирает тексты для обучения Gemini, GoogleOther занят служебными задачами. У OpenAI та же картина: отдельный робот для обучения моделей, отдельный - для поисковых ответов ChatGPT.

Каждый робот приходит со своим именем - это называется user-agent (грубо говоря, «как робот представляется на входе»). Именно к имени вы обращаетесь, когда пишете правила. Отсюда и вся развилка: правило можно адресовать одному роботу, а можно всем сразу. Разница между этими двумя строчками - разница между «мои тексты не пойдут в обучение ИИ» и «меня нет в поиске».

Как читается robots.txt

robots.txt - текстовый файл в корне сайта, в котором вы говорите роботам, какие адреса им можно обходить. Открывается по адресу вашсайт.ru/robots.txt - откройте прямо сейчас, это займёт минуту. Файл на сайте ровно один, называется ровно так и лежит именно в корне: в другом месте или под другим именем он не работает.

Внутри - пары строк. User-agent - кому адресовано правило, Disallow - какие адреса этому роботу обходить нельзя. Есть ещё Allow, им делают исключение внутри запрета.

User-agent: GPTBot
Disallow: /

Это читается так: роботу с именем GPTBot нельзя обходить ничего на сайте. А вот сочетание, из-за которого сайты теряют поиск:

User-agent: *
Disallow: /

Звёздочка означает «все роботы». В справке Google эта конструкция так и называется - запрет обхода всего сайта. Увидели такие две строки у себя - снимайте.

Краулеры Google при автоматическом обходе robots.txt всегда соблюдают, так что файл работает.

Почему запрет в robots.txt не удаляет страницу из поиска

robots.txt управляет обходом, а не индексом. Индексация - это когда поисковик добавил страницу в свою базу и может показать её в результатах, и robots.txt на это влияет только косвенно.

Google пишет прямо: robots.txt - не механизм, чтобы убрать страницу из поиска. Страница, закрытая в robots.txt, всё равно может попасть в выдачу, если на неё ссылаются с других сайтов, и тогда Google покажет голый адрес без описания. Яндекс говорит то же самое: ограниченные в robots.txt страницы могут участвовать в поиске, а чтобы убрать их оттуда, нужна директива noindex - отдельное указание в коде страницы или в HTTP-заголовке, означающее «не показывай меня в результатах».

Google: Googlebot против Google-Extended

Google-Extended можно закрывать, Googlebot - нет. Google-Extended - это отдельное имя, введённое ровно для одного: отказаться от использования вашего контента в обучении Gemini. Его блокировка, пишет Google, не влияет на попадание сайта в Google Поиск и не является сигналом ранжирования. То есть цена такого запрета - ноль.

С Googlebot всё иначе. Правила для него управляют доступом ко всему Google Поиску сразу: обычная выдача, Discover, Картинки, Видео, Новости.

РоботЗа что отвечаетЧто будет, если закрыть
GooglebotGoogle Поиск целиком, включая Discover, Картинки, Видео, Новости. Через него же поиск получает контент для AI OverviewsСайт перестаёт обходиться и индексироваться. Отдельные адреса могут ещё висеть в выдаче без описания, но контента там не будет
Google-ExtendedОбучение GeminiНичего в поиске не меняется. Google прямо говорит: на попадание в поиск не влияет, сигналом ранжирования не является
GoogleOtherСлужебные задачиНи на один продукт Google не влияет

Если ваша цель - «не хочу, чтобы на моих текстах учили нейросеть», вам нужен ровно один робот: Google-Extended. Всё остальное трогать не надо.

AI Overviews берут страницы из обычного индекса

Отдельных требований для попадания в AI Overviews нет. AI Overviews - это ответ нейросети, который Google показывает над обычными результатами; AI Mode - режим поиска, устроенный так же. Чтобы страница могла оказаться в них ссылкой-источником, она должна быть проиндексирована и годна к показу в обычном поиске. Google говорит это без обиняков: никаких дополнительных требований и особых оптимизаций для AI-ответов не нужно. ИИ встроен в поиск, и управление доступом к нему - те же самые правила robots.txt для Googlebot.

Отсюда следует вывод, которого у Google нет одной фразой, но который вытекает из его же документации. Закрыв Googlebot, вы закрываете поиск и AI-ответы разом: контент перестанет обходиться и индексироваться, а значит, страница не будет годна ни к обычной выдаче, ни к роли источника в AI Overviews. Голые адреса в выдаче остаться могут (см. предыдущий раздел), но это не видимость, а тень от неё. Разделить «пусть будет в поиске, но не в AI-ответах» через robots.txt нельзя: робот один.

Отсюда простое следствие: работа на попадание в AI-ответы - это работа над обычной страницей. Что именно проверить на своей, разобрано в статье AI-готовность страницы; чем оптимизация под поиск отличается от оптимизации под ИИ-ответы - в статье SEO и GEO: в чём разница.

Если ограничить нужно именно показ вашего текста в ИИ-ответах, а из поиска выпадать не хочется, у Google есть другие инструменты: nosnippet (не показывать фрагмент текста), data-nosnippet (не показывать конкретный кусок страницы), max-snippet (ограничить длину фрагмента). Это правила про сниппеты, а не про обход, из индекса они страницу не выбрасывают.

OpenAI: GPTBot и OAI-SearchBot - это разные роботы

У OpenAI обучение и поиск разведены так же, как у Google. Путать их дорого: люди закрывают «ботов ChatGPT» целиком и заодно убирают себя из поисковых ответов ChatGPT.

РоботЗа что отвечаетЧто будет, если закрыть
GPTBotЗабирает контент для обучения моделейВаш контент не используется в обучении генеративных моделей OpenAI
OAI-SearchBotПоиск в ChatGPTСайт не будет показан в поисковых ответах ChatGPT. Об этом OpenAI пишет прямо
ChatGPT-UserХодит по ссылке по прямому запросу человекаНа видимость в поиске не влияет

Логика та же: хотите отказаться от обучения - закрывайте GPTBot и не трогайте OAI-SearchBot.

Яндекс: кто отвечает за ответы Алисы AI

За показ вашего контента в ответах Алисы AI отвечают два робота: YandexAdditional и YandexAdditionalBot. Поставили им запрет в robots.txt - контент в ответах Алисы не показывается, так Яндекс говорит открытым текстом. И наоборот: ответы Алисы строятся с опорой на результаты поиска, поэтому страница для начала должна быть проиндексирована.

Правки robots.txt Яндекс учитывает по мере обновления поисковых данных, в течение 2-14 дней. Поправили - не проверяйте на следующее утро.

Подробный разбор, как посмотреть, цитирует ли Алиса ваш сайт, и что с этим делать, - в статье видимость сайта в Алисе AI.

Чем опасна галка «блокировать ИИ-ботов» в Cloudflare

Этой галкой вы блокируете не только ИИ. Cloudflare - сервис-посредник, через который проходит трафик многих сайтов (такие сервисы называют CDN: они ускоряют отдачу страниц и фильтруют вредный трафик). У него есть настройка блокировки ИИ-ботов, и её включают, не читая, что именно она уносит.

Cloudflare делит роботов не по именам, а по поведению, на три класса: Search (собирает и индексирует контент, чтобы потом отвечать на вопросы о нём), Agent (действует в реальном времени по поручению человека) и Training (обходит контент, чтобы обучить модель). Беда в том, что универсальные краулеры делают сразу несколько вещей. Cloudflare пишет об этом сам: у клиентов, выбравших блокировку Training, будут заблокированы такие многоцелевые краулеры, как Googlebot, Applebot и BingBot. И отдельно: смешанные краулеры, совмещающие Search и Training, блокируются при любой конфигурации блокировки обучения ИИ.

Переведём. Вы нажали «не хочу кормить ИИ» - и выключили себе Google, Bing и поиск Apple.

Настройка живёт в Security Settings, раздел Configure AI bot policies (прежнее название - Block AI bots). Действий три: Block (на всех страницах), Block on pages with ads (только на страницах с рекламой), Allow (не блокировать). С 15 сентября 2026 года Cloudflare меняет умолчание, но узко: только для новых доменов, только на страницах с рекламой и только для классов Training и Agent. Search остаётся разрешён по умолчанию.

Как Cloudflare классифицирует роботов Яндекса, в открытой документации не сказано, и додумывать за неё мы не будем.

Как узнать, стоит ли ваш сайт за Cloudflare

Посмотрите whois вашего домена - публичную карточку с данными о регистрации, её открывает любой whois-сервис по имени домена. В ней найдите поле Name Server (неймсервер - сервер, который подсказывает интернету, где искать ваш сайт).

В полном режиме Cloudflare работает через смену неймсерверов: домену выдаются два авторитетных неймсервера самого Cloudflare. Стоят в поле Name Server имена, оканчивающиеся на cloudflare.com, - сайт за Cloudflare, настройку ИИ-ботов надо проверить. Стоят неймсерверы хостинга или регистратора - этот раздел вас не касается, идите настраивать robots.txt.

Что делать, если вы не хотите кормить ИИ обучением

Запрещайте точечно, по именам роботов, а не «всё ИИ-шное скопом». Это единственный способ отказаться от обучения и остаться в поиске.

  1. Закройте обучающих роботов, по которым решение принято: Google-Extended (обучение Gemini) и GPTBot (обучение моделей OpenAI). Ни тот, ни другой к поиску отношения не имеет.
  2. Оставьте открытыми поисковых: Googlebot, OAI-SearchBot. Первый - это ваш Google целиком вместе с AI-ответами, второй - показ в поисковых ответах ChatGPT.
  3. По Яндексу решите отдельно: YandexAdditional и YandexAdditionalBot управляют показом в ответах Алисы AI, а не обучением. Закрывая их, вы убираете себя из ответов Алисы, а не защищаете тексты от обучения. Наша позиция: не закрывать.
  4. Не включайте общую блокировку ИИ-ботов в Cloudflare. Она бьёт по поисковым краулерам, а обучающих роботов вы и так закрыли адресно в robots.txt.
  5. Никогда не пишите User-agent: * + Disallow: / в надежде спрятаться от ИИ. Это запрет обхода всего сайта всеми роботами.

Правило, которое стоит запомнить одной строкой: имя робота знаете - запрещайте; не знаете, кто перед вами, - не запрещайте.

Как проверить самому: чеклист

  • Открыт вашсайт.ru/robots.txt, файл на месте.
  • В файле нет User-agent: * + Disallow: /.
  • Googlebot не закрыт.
  • Решение по Google-Extended принято (закрывать его безопасно).
  • Решение по GPTBot принято, OAI-SearchBot не тронут.
  • Проверены YandexAdditional и YandexAdditionalBot.
  • В whois поле Name Server: есть cloudflare.com - проверить Security Settings > Configure AI bot policies, общая блокировка обучения ИИ выключена.
  • Для удаления страницы из поиска взят noindex, а не Disallow.
  • После правок выждано 2-14 дней (срок Яндекса), а не одна ночь.

Хотите проверить, как поиск видит вашу страницу? Введите URL - покажем диагноз и список правок.

Проверить свой сайт

Источники

  • Справка Google Search: «Introduction to robots.txt», «Create and submit a robots.txt file», полезные правила robots.txt.
  • Справка Google: список основных краулеров (Googlebot, Google-Extended, GoogleOther) и обзор краулеров Google.
  • Справка Google Search: AI-функции в поиске (AI Overviews и AI Mode).
  • Документация OpenAI для разработчиков: боты OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User).
  • Справка Яндекса: «Robots.txt», «Запрет индексирования», «Проверка робота Яндекса».
  • Документация Cloudflare: классы ботов (Search / Agent / Training), блокировка ИИ-ботов, настройка полного режима через неймсерверы.
  • Блог Cloudflare: материал о вариантах политики по ИИ-ботам и изменении умолчаний.
Поделиться: ВКонтакте Telegram