Коротко: у площадок есть раздельные роботы - одни собирают тексты для обучения нейросетей, другие обходят сайт для поиска. Поэтому отказаться от обучения ИИ можно, не выпав из поиска: запрещать надо точечно, по имени робота в robots.txt. Опасность - рубить скопом. Галка «блокировать ИИ-ботов» в Cloudflare заодно режет Googlebot, Bingbot и Applebot, то есть вашу обычную поисковую видимость. И ещё: AI-ответы Google и Яндекса собираются из обычного поискового индекса. Отдельной двери в них нет - есть только своя, которую можно случайно закрыть.
Кто ходит по вашему сайту и при чём тут robots.txt
По сайту ходят краулеры - программы, которые сами обходят страницы и забирают их содержимое. Никто их не зовёт, они приходят сами.
Ключевое, чего обычно не знают: у одной компании краулер не один. Googlebot собирает страницы для поиска, Google-Extended забирает тексты для обучения Gemini, GoogleOther занят служебными задачами. У OpenAI та же картина: отдельный робот для обучения моделей, отдельный - для поисковых ответов ChatGPT.
Каждый робот приходит со своим именем - это называется user-agent (грубо говоря, «как робот представляется на входе»). Именно к имени вы обращаетесь, когда пишете правила. Отсюда и вся развилка: правило можно адресовать одному роботу, а можно всем сразу. Разница между этими двумя строчками - разница между «мои тексты не пойдут в обучение ИИ» и «меня нет в поиске».
Как читается robots.txt
robots.txt - текстовый файл в корне сайта, в котором вы говорите роботам, какие адреса им можно обходить. Открывается по адресу вашсайт.ru/robots.txt - откройте прямо сейчас, это займёт минуту. Файл на сайте ровно один, называется ровно так и лежит именно в корне: в другом месте или под другим именем он не работает.
Внутри - пары строк. User-agent - кому адресовано правило, Disallow - какие адреса этому роботу обходить нельзя. Есть ещё Allow, им делают исключение внутри запрета.
User-agent: GPTBot
Disallow: /
Это читается так: роботу с именем GPTBot нельзя обходить ничего на сайте. А вот сочетание, из-за которого сайты теряют поиск:
User-agent: *
Disallow: /
Звёздочка означает «все роботы». В справке Google эта конструкция так и называется - запрет обхода всего сайта. Увидели такие две строки у себя - снимайте.
Краулеры Google при автоматическом обходе robots.txt всегда соблюдают, так что файл работает.
Почему запрет в robots.txt не удаляет страницу из поиска
robots.txt управляет обходом, а не индексом. Индексация - это когда поисковик добавил страницу в свою базу и может показать её в результатах, и robots.txt на это влияет только косвенно.
Google пишет прямо: robots.txt - не механизм, чтобы убрать страницу из поиска. Страница, закрытая в robots.txt, всё равно может попасть в выдачу, если на неё ссылаются с других сайтов, и тогда Google покажет голый адрес без описания. Яндекс говорит то же самое: ограниченные в robots.txt страницы могут участвовать в поиске, а чтобы убрать их оттуда, нужна директива noindex - отдельное указание в коде страницы или в HTTP-заголовке, означающее «не показывай меня в результатах».
Google: Googlebot против Google-Extended
Google-Extended можно закрывать, Googlebot - нет. Google-Extended - это отдельное имя, введённое ровно для одного: отказаться от использования вашего контента в обучении Gemini. Его блокировка, пишет Google, не влияет на попадание сайта в Google Поиск и не является сигналом ранжирования. То есть цена такого запрета - ноль.
С Googlebot всё иначе. Правила для него управляют доступом ко всему Google Поиску сразу: обычная выдача, Discover, Картинки, Видео, Новости.
| Робот | За что отвечает | Что будет, если закрыть |
|---|---|---|
| Googlebot | Google Поиск целиком, включая Discover, Картинки, Видео, Новости. Через него же поиск получает контент для AI Overviews | Сайт перестаёт обходиться и индексироваться. Отдельные адреса могут ещё висеть в выдаче без описания, но контента там не будет |
| Google-Extended | Обучение Gemini | Ничего в поиске не меняется. Google прямо говорит: на попадание в поиск не влияет, сигналом ранжирования не является |
| GoogleOther | Служебные задачи | Ни на один продукт Google не влияет |
Если ваша цель - «не хочу, чтобы на моих текстах учили нейросеть», вам нужен ровно один робот: Google-Extended. Всё остальное трогать не надо.
AI Overviews берут страницы из обычного индекса
Отдельных требований для попадания в AI Overviews нет. AI Overviews - это ответ нейросети, который Google показывает над обычными результатами; AI Mode - режим поиска, устроенный так же. Чтобы страница могла оказаться в них ссылкой-источником, она должна быть проиндексирована и годна к показу в обычном поиске. Google говорит это без обиняков: никаких дополнительных требований и особых оптимизаций для AI-ответов не нужно. ИИ встроен в поиск, и управление доступом к нему - те же самые правила robots.txt для Googlebot.
Отсюда следует вывод, которого у Google нет одной фразой, но который вытекает из его же документации. Закрыв Googlebot, вы закрываете поиск и AI-ответы разом: контент перестанет обходиться и индексироваться, а значит, страница не будет годна ни к обычной выдаче, ни к роли источника в AI Overviews. Голые адреса в выдаче остаться могут (см. предыдущий раздел), но это не видимость, а тень от неё. Разделить «пусть будет в поиске, но не в AI-ответах» через robots.txt нельзя: робот один.
Отсюда простое следствие: работа на попадание в AI-ответы - это работа над обычной страницей. Что именно проверить на своей, разобрано в статье AI-готовность страницы; чем оптимизация под поиск отличается от оптимизации под ИИ-ответы - в статье SEO и GEO: в чём разница.
Если ограничить нужно именно показ вашего текста в ИИ-ответах, а из поиска выпадать не хочется, у Google есть другие инструменты: nosnippet (не показывать фрагмент текста), data-nosnippet (не показывать конкретный кусок страницы), max-snippet (ограничить длину фрагмента). Это правила про сниппеты, а не про обход, из индекса они страницу не выбрасывают.
OpenAI: GPTBot и OAI-SearchBot - это разные роботы
У OpenAI обучение и поиск разведены так же, как у Google. Путать их дорого: люди закрывают «ботов ChatGPT» целиком и заодно убирают себя из поисковых ответов ChatGPT.
| Робот | За что отвечает | Что будет, если закрыть |
|---|---|---|
| GPTBot | Забирает контент для обучения моделей | Ваш контент не используется в обучении генеративных моделей OpenAI |
| OAI-SearchBot | Поиск в ChatGPT | Сайт не будет показан в поисковых ответах ChatGPT. Об этом OpenAI пишет прямо |
| ChatGPT-User | Ходит по ссылке по прямому запросу человека | На видимость в поиске не влияет |
Логика та же: хотите отказаться от обучения - закрывайте GPTBot и не трогайте OAI-SearchBot.
Яндекс: кто отвечает за ответы Алисы AI
За показ вашего контента в ответах Алисы AI отвечают два робота: YandexAdditional и YandexAdditionalBot. Поставили им запрет в robots.txt - контент в ответах Алисы не показывается, так Яндекс говорит открытым текстом. И наоборот: ответы Алисы строятся с опорой на результаты поиска, поэтому страница для начала должна быть проиндексирована.
Правки robots.txt Яндекс учитывает по мере обновления поисковых данных, в течение 2-14 дней. Поправили - не проверяйте на следующее утро.
Подробный разбор, как посмотреть, цитирует ли Алиса ваш сайт, и что с этим делать, - в статье видимость сайта в Алисе AI.
Чем опасна галка «блокировать ИИ-ботов» в Cloudflare
Этой галкой вы блокируете не только ИИ. Cloudflare - сервис-посредник, через который проходит трафик многих сайтов (такие сервисы называют CDN: они ускоряют отдачу страниц и фильтруют вредный трафик). У него есть настройка блокировки ИИ-ботов, и её включают, не читая, что именно она уносит.
Cloudflare делит роботов не по именам, а по поведению, на три класса: Search (собирает и индексирует контент, чтобы потом отвечать на вопросы о нём), Agent (действует в реальном времени по поручению человека) и Training (обходит контент, чтобы обучить модель). Беда в том, что универсальные краулеры делают сразу несколько вещей. Cloudflare пишет об этом сам: у клиентов, выбравших блокировку Training, будут заблокированы такие многоцелевые краулеры, как Googlebot, Applebot и BingBot. И отдельно: смешанные краулеры, совмещающие Search и Training, блокируются при любой конфигурации блокировки обучения ИИ.
Переведём. Вы нажали «не хочу кормить ИИ» - и выключили себе Google, Bing и поиск Apple.
Настройка живёт в Security Settings, раздел Configure AI bot policies (прежнее название - Block AI bots). Действий три: Block (на всех страницах), Block on pages with ads (только на страницах с рекламой), Allow (не блокировать). С 15 сентября 2026 года Cloudflare меняет умолчание, но узко: только для новых доменов, только на страницах с рекламой и только для классов Training и Agent. Search остаётся разрешён по умолчанию.
Как Cloudflare классифицирует роботов Яндекса, в открытой документации не сказано, и додумывать за неё мы не будем.
Как узнать, стоит ли ваш сайт за Cloudflare
Посмотрите whois вашего домена - публичную карточку с данными о регистрации, её открывает любой whois-сервис по имени домена. В ней найдите поле Name Server (неймсервер - сервер, который подсказывает интернету, где искать ваш сайт).
В полном режиме Cloudflare работает через смену неймсерверов: домену выдаются два авторитетных неймсервера самого Cloudflare. Стоят в поле Name Server имена, оканчивающиеся на cloudflare.com, - сайт за Cloudflare, настройку ИИ-ботов надо проверить. Стоят неймсерверы хостинга или регистратора - этот раздел вас не касается, идите настраивать robots.txt.
Что делать, если вы не хотите кормить ИИ обучением
Запрещайте точечно, по именам роботов, а не «всё ИИ-шное скопом». Это единственный способ отказаться от обучения и остаться в поиске.
- Закройте обучающих роботов, по которым решение принято:
Google-Extended(обучение Gemini) иGPTBot(обучение моделей OpenAI). Ни тот, ни другой к поиску отношения не имеет. - Оставьте открытыми поисковых:
Googlebot,OAI-SearchBot. Первый - это ваш Google целиком вместе с AI-ответами, второй - показ в поисковых ответах ChatGPT. - По Яндексу решите отдельно:
YandexAdditionalиYandexAdditionalBotуправляют показом в ответах Алисы AI, а не обучением. Закрывая их, вы убираете себя из ответов Алисы, а не защищаете тексты от обучения. Наша позиция: не закрывать. - Не включайте общую блокировку ИИ-ботов в Cloudflare. Она бьёт по поисковым краулерам, а обучающих роботов вы и так закрыли адресно в robots.txt.
- Никогда не пишите
User-agent: *+Disallow: /в надежде спрятаться от ИИ. Это запрет обхода всего сайта всеми роботами.
Правило, которое стоит запомнить одной строкой: имя робота знаете - запрещайте; не знаете, кто перед вами, - не запрещайте.
Как проверить самому: чеклист
- Открыт
вашсайт.ru/robots.txt, файл на месте. - В файле нет
User-agent: *+Disallow: /. -
Googlebotне закрыт. - Решение по
Google-Extendedпринято (закрывать его безопасно). - Решение по
GPTBotпринято,OAI-SearchBotне тронут. - Проверены
YandexAdditionalиYandexAdditionalBot. - В whois поле Name Server: есть
cloudflare.com- проверить Security Settings > Configure AI bot policies, общая блокировка обучения ИИ выключена. - Для удаления страницы из поиска взят
noindex, а неDisallow. - После правок выждано 2-14 дней (срок Яндекса), а не одна ночь.
Хотите проверить, как поиск видит вашу страницу? Введите URL - покажем диагноз и список правок.
Проверить свой сайтИсточники
- Справка Google Search: «Introduction to robots.txt», «Create and submit a robots.txt file», полезные правила robots.txt.
- Справка Google: список основных краулеров (Googlebot, Google-Extended, GoogleOther) и обзор краулеров Google.
- Справка Google Search: AI-функции в поиске (AI Overviews и AI Mode).
- Документация OpenAI для разработчиков: боты OpenAI (GPTBot, OAI-SearchBot, ChatGPT-User).
- Справка Яндекса: «Robots.txt», «Запрет индексирования», «Проверка робота Яндекса».
- Документация Cloudflare: классы ботов (Search / Agent / Training), блокировка ИИ-ботов, настройка полного режима через неймсерверы.
- Блог Cloudflare: материал о вариантах политики по ИИ-ботам и изменении умолчаний.