AGINE Academy
10 августа 2026 г. · 9 мин чтения · Команда AGINE

robots.txt для нейросетей: каких роботов нельзя закрывать

Каких роботов нейросетей нельзя закрывать в robots.txt, чем OAI-SearchBot отличается от GPTBot и как проверить свой файл за минуту.

Закрывать в robots.txt можно только тех роботов, которые собирают тексты для обучения моделей: GPTBot у OpenAI, ClaudeBot у Anthropic, Google-Extended у Google. Роботов, которые приводят людей, закрывать нельзя: OAI-SearchBot отвечает за показ сайта в поиске внутри ChatGPT, Claude-SearchBot за ответы Claude, PerplexityBot за Perplexity, YandexBot за индекс Яндекса, из которого собираются ответы Алисы и Нейро.

Имена похожи, поэтому их путают. Инструкции в интернете обычно предлагают «закрыть сайт от нейросетей» одним списком из десятка строк, туда попадают обе группы, и сайт пропадает из ответов целиком. Никакие новые статьи это не чинят: робот, который показывает страницу человеку, просто не заходит.

Проверить свой файл можно за минуту. Открой в браузере адрес твой-сайт.ру/robots.txt и поищи глазами строку Disallow: /. Стоит она под User-agent: * и без исключений, закрыт весь сайт для всех сразу. Перечислены рядом OAI-SearchBot, Claude-SearchBot, PerplexityBot или YandexBot, закрыты ровно те, кто приводит клиентов.

Какие роботы нейросетей ходят по сайтам?

Робот это программа, которая обходит сайты и читает страницы. У каждой компании их несколько, и приходят они за разным.

РоботЧейЗачем приходитЗакрывать
OAI-SearchBotOpenAIпоказывает сайт в поиске ChatGPTнельзя
Claude-SearchBotAnthropicпоказывает сайт в ответах Claudeнельзя
PerplexityBotPerplexityпоказывает и ставит ссылку в Perplexityнельзя
YandexBotЯндексиндексирует сайт для поиска, из этого индекса Алиса и Нейро берут ответынельзя
GPTBotOpenAIучит моделирешаешь сам
ClaudeBotAnthropicучит моделирешаешь сам
Google-ExtendedGoogleучит Geminiрешаешь сам
ChatGPT-User, Claude-User, Perplexity-Userвсе троезаходят в момент, когда человек прислал ссылку в чатнельзя
OAI-AdsBotOpenAIпроверяет страницы, поданные как реклама в ChatGPTесли не рекламируешься, всё равно

Данные из справок самих компаний на 10 августа 2026: у OpenAI четыре робота, у Anthropic три, у Perplexity два.

Список названий устаревает быстрее, чем инструкции по их настройке, и это видно в бою. 10 августа 2026 мы скачали robots.txt у 46 крупных российских сайтов: медиа, розница, доски объявлений, банки, SaaS. Файл отдал 31 сайт, остальные ответили ошибкой или редиректом. Из этих 31 роботов нейросетей упоминают поимённо шесть. GPTBot назван у шести сайтов, OAI-SearchBot и PerplexityBot у четырёх, Claude-SearchBot у одного. Зато Claude-Web и anthropic-ai, которых в нынешней документации Anthropic нет вообще, встречаются по три раза каждый. Мёртвые имена копируют втрое чаще, чем живого показывающего робота Claude.

Самый показательный файл в этой выборке у крупного строительного ритейлера. Пятнадцать AI-агентов перечислены поимённо и разрешены, включая тот самый Claude-Web. Claude-SearchBot в список не попал, поэтому он читает общую группу User-agent: *, а там Disallow: / с белым списком из десятка разделов. Роботу Claude достаётся витрина вместо сайта, и такого решения никто не принимал.

Отдельно про третью строку с пользовательскими роботами. ChatGPT-User и Perplexity-User по документации своих компаний могут robots.txt не соблюдать: запрос пришёл от живого человека, а не от планового обхода. OpenAI пишет «robots.txt rules may not apply», Perplexity прямее: «generally ignores robots.txt rules». Anthropic про все три своих робота пишет, что они соблюдают директивы robots.txt. Закрыв эту группу, ты получишь не защиту, а сломанный сценарий «клиент кинул ссылку на тебя в чат и попросил разобраться».

Что сломается, если закрыть не тех?

Разберём по последствиям, а не по названиям.

Закрыл обучающего робота (GPTBot, ClaudeBot, Google-Extended). Твои тексты не пойдут в обучение будущих моделей. На показ в поиске и в ответах это не влияет. Google в справке пишет прямо: Google-Extended не влияет на попадание сайта в поиск Google и не используется как сигнал ранжирования. Это решение владельца, а не поломка.

Закрыл показывающего робота (OAI-SearchBot, Claude-SearchBot, PerplexityBot, YandexBot). Сайт перестаёт появляться в ответах. Нейросеть не покажет то, чего не прочитала, и сослаться ей не на что. В списке ссылок страница живёт даже на дальних позициях и понемногу собирает переходы. В ответ нейросети попадают считаные источники, и брать оттуда нечего, если робот не заходил.

**Закрыл всех подряд строкой User-agent: * / Disallow: /.** Самый частый вариант. Так выглядит robots.txt на тестовой копии сайта, пока его делают. Дальше сайт выкатывают вместе с этим файлом, и он годами живёт в бою.

Есть и менее очевидная ловушка. И Google, и Яндекс читают только одну группу правил: самую точную для конкретного робота, остальные при этом не применяются. У Google это сформулировано так: «Only one group is valid for a particular crawler». У Яндекса правило то же. Поэтому файл вида

```text User-agent: Googlebot Allow: /

User-agent: * Disallow: / ```

означает не «открыто для Google и чуть-чуть для остальных», а «открыто только для Google, все нейросети за дверью». Такой файл часто ставят, когда хотят «пускать только поисковик».

Как выглядит рабочий robots.txt?

Это обычный текстовый файл в корне сайта. Открывается по адресу https://твой-сайт.ру/robots.txt, доступен всем, никакого пароля не нужно. Он должен лежать именно в корне: файл по адресу сайт.ру/папка/robots.txt роботы не читают. Правила действуют только на тот хост, протокол и порт, где лежит файл, поэтому у поддомена shop.сайт.ру файл свой, отдельный.

Рабочий вариант для большинства бизнесов выглядит коротко:

```text User-agent: * Allow: /

Sitemap: https://твой-сайт.ру/sitemap.xml ```

Первые две строки означают «всем роботам всё можно». Третья указывает карту сайта, список всех адресов, чтобы роботы не искали страницы наугад.

Если ты решил не отдавать тексты на обучение, но остаться в ответах, добавляются отдельные группы:

```text User-agent: * Allow: /

User-agent: GPTBot Disallow: /

User-agent: ClaudeBot Disallow: /

User-agent: Google-Extended Disallow: /

Sitemap: https://твой-сайт.ру/sitemap.xml ```

Здесь закрыты только обучающие роботы. OAI-SearchBot, Claude-SearchBot, PerplexityBot и YandexBot попадают под общее разрешение и продолжают показывать сайт.

Технические границы по справке Google: файл читается до 500 кибибайт, всё после обрезается; содержимое кэшируется примерно на сутки, так что правка подействует не мгновенно.

Как проверить свой файл за минуту?

  1. Открой твой-сайт.ру/robots.txt в браузере. Пустая страница или ошибка 404 означают, что файла нет. Само по себе это не авария: нет файла, значит запретов нет, роботы ходят свободно. Но и карту сайта им никто не подсказал.
  2. Найди в тексте Disallow: /. Именно слеш без продолжения закрывает сайт целиком. Строки вроде Disallow: /admin закрывают только раздел, это нормально.
  3. Пробегись по именам из таблицы выше. Любой робот из первой группы в запретах, это надо чинить сегодня.
  4. Проверь, что есть строка Sitemap:.

Хочешь машинную проверку, а не глазами: в Google Search Console есть отчёт robots.txt (Настройки → robots.txt). Он показывает, какие файлы Google скачал, когда и с какими ошибками, и хранит историю запросов за последние 30 дней; у ресурса уровня «Домен» в отчёт попадают файлы двадцати главных хостов. У Яндекса в Вебмастере есть «Анализ robots.txt», где можно подставить конкретный адрес и увидеть, разрешён он или запрещён.

Изменения подействуют не сразу. Google в справке пишет, что обход новой страницы занимает от нескольких дней до нескольких недель, и просить переобход по одному адресу несколько раз бесполезно.

Один файл отвечает только на один вопрос. Полный список того, что мешает нейросетям увидеть сайт, разобран отдельно: как за пять минут проверить, видят ли твой сайт нейросети.

Почему файл чистый, а роботов всё равно не пускают?

Второе по частоте место, где теряется видимость, это защита от ботов на стороне CDN или хостинга. Она живёт отдельно от robots.txt: файл открыт настежь, а робот получает 403 и уходит.

У Cloudflare для этого есть раздел AI Crawl Control, он доступен на всех тарифах, включая бесплатный. 1 июля 2026 Cloudflare заменил единый переключатель «блокировать AI-ботов» на три категории: Search (индексируют контент, чтобы потом отвечать на вопросы, и в обмен присылают переходы), Agent (работают в реальном времени по запросу человека), Training (забирают контент на обучение модели).

С 15 сентября 2026 у новых доменов, которые подключаются к Cloudflare, включаются новые умолчания: Training и Agent блокируются на страницах с рекламой, Search остаётся разрешённым. Отказаться от новых умолчаний можно в любой момент до 15 сентября. Тем, кто раньше нажимал «Block AI bots», важна ещё одна деталь: многоцелевые краулеры, которые одновременно и Search, и Training, тоже попадают под блокировку обучения.

Третья причина не связана с роботами вовсе: сайт целиком рисуется скриптами, и в исходном коде страницы текста нет. Робот заходит и видит пустую страницу. Проверяется просмотром исходного кода, подробный разбор в статье про проверку сайта.

И оговорка про сам механизм. robots.txt управляет обходом, а не показом. Google предупреждает, что закрытый в robots.txt адрес всё равно может попасть в индекс, если на него ссылаются с других сайтов, только без сниппета. Чтобы убрать страницу из поиска, нужен метатег noindex или пароль, а не запрет обхода.

Что сделать до 15 сентября?

Открой свой robots.txt и посмотри на него один раз. Обычно строка запрета появилась при запуске сайта, её поставил подрядчик или конструктор, и с тех пор её никто не читал.

Если сайт стоит за Cloudflare, зайди в AI Crawl Control и посмотри, что там выставлено сейчас. 15 сентября умолчания меняются, и знать свои настройки заранее дешевле, чем разбираться потом.

Правка занимает пять минут. Без неё статьи, разметка и карта сайта работают вхолостую: их некому прочитать.

Разбор с готовыми промтами (проверка сайта по семи пунктам и правки по её итогам) есть в блоке «Эхо» в Академии, три урока открыты бесплатно: https://academy.agineai.com/block/b12-eho

Частые вопросы

Каких роботов нейросетей нельзя закрывать в robots.txt?

OAI-SearchBot (поиск внутри ChatGPT), Claude-SearchBot (ответы Claude), PerplexityBot (Perplexity) и YandexBot (индекс Яндекса, откуда ответы берут Алиса и Нейро). Это роботы, которые показывают сайт людям. Закрывать без последствий можно только обучающих: GPTBot, ClaudeBot, Google-Extended.

Я закрыл GPTBot. Пропаду ли я из ответов ChatGPT?

Нет. GPTBot собирает тексты для обучения моделей, а за показ сайта в поиске внутри ChatGPT отвечает другой робот, OAI-SearchBot. Пропадёшь, только если закроешь именно его. То же и у остальных: обучение это ClaudeBot и Google-Extended, показ это Claude-SearchBot и PerplexityBot.

Где лежит robots.txt и как его открыть?

В корне сайта. Открывается в браузере по адресу твой-сайт.ру/robots.txt, пароль не нужен, файл виден всем. Именно в корне: по адресу вида сайт.ру/папка/robots.txt роботы его не читают. У поддомена (например shop.сайт.ру) файл свой, отдельный.

У меня вообще нет файла robots.txt. Это плохо?

Не авария. Нет файла, значит нет запретов, и роботы ходят по сайту свободно. Минус один: им никто не подсказал адрес карты сайта, и страницы приходится искать по ссылкам. Файл из трёх строк с разрешением и строкой Sitemap решает вопрос.

Через сколько подействует правка в robots.txt?

Не мгновенно. Google по своей справке держит содержимое файла в кэше примерно сутки, а обход новой страницы занимает от нескольких дней до нескольких недель. Просить переобход одного и того же адреса несколько раз бесполезно, быстрее не станет.

robots.txt чистый, а сайт всё равно не видят. Где ещё смотреть?

В защите от ботов на стороне CDN. У Cloudflare это раздел AI Crawl Control, доступный на всех тарифах: настройки там живут отдельно от robots.txt. С 15 сентября 2026 у новых доменов Cloudflare включает новые умолчания, где Training и Agent блокируются на страницах с рекламой, а Search остаётся разрешённым; отказаться можно до этой даты. Вторая частая причина: сайт рисуется скриптами и в исходном коде страницы текста нет.

Можно ли через robots.txt убрать страницу из поиска?

Нет. robots.txt управляет обходом, а не показом. Google отдельно предупреждает, что закрытый в robots.txt адрес всё равно может попасть в индекс, если на него ссылаются с других сайтов. Для удаления из поиска нужен метатег noindex, пароль или удаление страницы.

Начать бесплатный урокСмотреть всю программуВсе статьи