AGINE Academy
10 августа 2026 г. · 7 мин чтения · Команда AGINE

Как за пять минут проверить, видят ли твой сайт нейросети

Промт для Claude Desktop проверяет сайт по семи пунктам за пять минут: доступ роботов ChatGPT и Claude, карта сайта, разметка, текст без JavaScript.

Проверка занимает три-пять минут и делается одним промтом в Claude Desktop, во вкладке Code. Ты подставляешь адрес своего сайта, Клод сам выполняет команды и присылает отчёт по семи пунктам: доступ для роботов, карта сайта, файл llms.txt, разметка для машин, виден ли текст без JavaScript, заголовки с описаниями и техническая часть. На сайте при этом ничего не меняется: промт только читает то, что и так открыто всем.

Главное, что ты узнаешь за эти пять минут, лежит в первом пункте. В файле robots.txt может стоять одна строка, которая закрывает сайт от роботов, показывающих страницы в ответах ChatGPT, Claude и Perplexity и в поиске Яндекса. Владелец сайта про эту строку обычно не знает, потому что её поставил подрядчик или шаблон конструктора. Последствие простое: тебя не покажут нигде, сколько бы статей ты ни написал.

Промт ниже рабочий и приведён целиком. Скопируй его, замени адрес в строке САЙТ и отправь. Дальше в статье разбор, как читать то, что придёт в ответ, и какие числа в отчёте считать нормой.

Почему проверять надо во вкладке Code, а не в обычном чате?

Потому что вкладка Code выполняет команды на твоём компьютере и возвращает факты, а чат в лучшем случае рассуждает.

Разница видна на одном примере. Спроси в чате «открыт ли мой сайт для роботов» и получишь абзац со словом «вероятно». Вкладка Code скачает твой robots.txt командой curl, откроет его и процитирует строки, которые там реально написаны.

По той же причине в промте отдельно оговорено считать длину заголовков через python3. Русская буква весит два байта, побайтовый подсчёт завысит длину примерно вдвое, и ты пойдёшь переписывать нормальные заголовки. Эту строку из промта вырезать не надо.

Что именно проверяет промт?

Семь пунктов, человеческим языком.

  1. Доступ для роботов. robots.txt это текстовый файл в корне сайта, где перечислено, кому из роботов какие страницы можно читать. Промт смотрит, есть ли файл вообще, не закрыт ли сайт целиком и как в нём прописаны роботы поисковиков и нейросетей.
  2. Карта сайта. sitemap.xml это список всех адресов сайта, чтобы робот не искал страницы наугад. Считается число адресов и есть ли у страниц даты изменения.
  3. Визитка для нейросетей. Файлы llms.txt и llms-full.txt: короткое описание, что за продукт и кому он нужен, в удобном для чтения моделью виде. Если файлов нет, это не поломка, их нет у большинства сайтов.
  4. Разметка для машин. Schema.org это невидимые человеку подписи в коде страницы: «это организация», «это статья», «это цена». Минимум для главной: Organization и WebSite. Для страницы статьи: Article или BlogPosting плюс BreadcrumbList.
  5. Текст без JavaScript. Промт вырезает скрипты и показывает первые 350 знаков того, что осталось. Пусто, значит страница рисуется скриптами, и часть роботов увидит пустоту вместо текста.
  6. Заголовки и описания. title, description, canonical, og-теги и ровно один h1 на главной и на трёх-пяти внутренних страницах.
  7. Техническое. HTTPS, ведёт ли http-версия на https, за сколько отвечает сайт, есть ли meta viewport и отдаёт ли несуществующий адрес код 404, а не 200.

Какой промт вставлять?

Открой Claude Desktop, вкладку Code. Вставь текст целиком и замени адрес в строке САЙТ. Больше менять нечего.

```text Проверь сайт на готовность к поиску и к цитированию нейросетями.

САЙТ: https://вставь-свой-адрес.ру

Ничего не меняй. Каждый вывод подтверждай реальной командой, не пиши "вероятно". Не вышло, так и скажи: "проверить не смог, причина такая-то".

ДЛИНА: title и description считай в символах через python3, не через wc -c и не через ${#переменная}. Русская буква весит два байта, побайтовый подсчёт завысит длину.

1. ДОСТУП ДЛЯ РОБОТОВ curl -s АДРЕС/robots.txt Есть ли файл, не закрыт ли сайт целиком, есть ли ссылка на карту сайта. Дальше роботы нейросетей:

ГРУППА А, показывают сайт в ответах, закрывать нельзя: OAI-SearchBot, Claude-SearchBot, PerplexityBot, YandexBot ГРУППА Б, учатся на контенте, решение владельца: GPTBot, ClaudeBot, Google-Extended ГРУППА В, приходят по запросу человека: ChatGPT-User, Claude-User, Perplexity-User ChatGPT-User и Perplexity-User могут robots.txt игнорировать, Claude-User правила соблюдает. Ещё OAI-AdsBot проверяет страницы для рекламы в ChatGPT.

Скажи прямо: закрыт ли кто-то из группы А (это авария); роботы прописаны поимённо или по общему разрешению.

2. КАРТА САЙТА curl -s АДРЕС/sitemap.xml | grep -c "<loc>" Сколько адресов, у всех ли есть дата изменения, есть ли hreflang при нескольких языках.

3. ВИЗИТКА ДЛЯ НЕЙРОСЕТЕЙ llms.txt и llms-full.txt. Если есть, покажи первые 15 строк: понятно ли, что за продукт и кому он нужен.

4. РАЗМЕТКА ДЛЯ МАШИН curl -s АДРЕС | grep -oE '"@type":"[^"]*"' | sort | uniq -c Главная и страница статьи. Минимум: Organization, WebSite. Желательно: Course или Product с Offer, FAQPage. На статье: Article или BlogPosting и BreadcrumbList.

5. ТЕКСТ БЕЗ JAVASCRIPT Вырежи script и style, убери теги, покажи первые 350 знаков текста. Пусто, значит сайт рисуется скриптами и роботы увидят пустоту.

6. ЗАГОЛОВКИ И ОПИСАНИЯ Главная и 3-5 внутренних: title до 60 символов, description до 160, canonical, og:title, og:description, og:image, ровно один h1. Длину считай через python3.

7. ТЕХНИЧЕСКОЕ HTTPS, ведёт ли http на https, за сколько отвечает сайт (curl -s -o /dev/null -w "%{time_total}" АДРЕС), есть ли meta viewport, отдаёт ли несуществующий адрес код 404, а не 200.

ОТЧЁТ Первая строка: сколько пунктов из семи в порядке и что чинить первым. По каждому: вердикт, находка с цифрами, зачем нужно одной фразой, что сделать. В конце правки по важности, сначала то, из-за чего сайт не видят. Язык простой, как для владельца бизнеса, без терминов. Не хвали. Не смог проверить, так и напиши. ```

Команды набирать не нужно, Клод выполняет их сам. Своего сайта пока нет, возьми чужой из своей ниши: смысл упражнения не теряется, а читать отчёт научишься на живом примере.

Какие три строки в отчёте читать первыми?

Отчёт длинный, а решение принимается по трём местам.

Пункт 1, группа А. Роботы, которые показывают тебя в ответах и в поиске: OAI-SearchBot, Claude-SearchBot, PerplexityBot, YandexBot. Закрыт хоть один, остальное в отчёте подождёт. Закрытые GPTBot, ClaudeBot и Google-Extended сюда не относятся: они собирают тексты для обучения моделей, и закрывают их осознанно. Кто есть кто, что именно ломается и как выглядит рабочий файл, разобрано отдельно: https://academy.agineai.com/blog/robots-txt-dlya-neyrosetey

Пункт 5, первые 350 знаков. Пусто, значит страницу собирают скрипты уже в браузере, и часть роботов увидит пустое место вместо твоего текста. За вечер это не чинится, но знать надо до того, как писать новые статьи.

Пункт 7, код несуществующего адреса. Должен быть 404. Приходит 200, значит сайт отвечает «страница есть» на любой мусор, который прилетает по кривым ссылкам, и поисковик исправно тащит этот мусор в индекс.

Имена роботов в промте сверены со справками OpenAI, Anthropic и Perplexity 10 августа 2026. Их периодически переименовывают молча, так что раз в квартал список стоит перечитывать.

Какие числа в отчёте считать нормой?

  • title до 60 символов, description до 160. Это практический ориентир, при котором строка обычно помещается в выдаче целиком. Официального лимита в символах Google не публикует: строку обрезают по ширине в пикселях, и на телефоне она обрежется раньше, чем на большом экране.
  • h1 ровно один на страницу. Ноль или три это повод переписать шаблон.
  • Карта сайта до 50 000 адресов и до 50 МБ без сжатия. Это пределы из справки Google по файлам Sitemap: файл больше надо разбивать на несколько. Отдельно Google пишет, что при примерно 500 страницах и меньше карта вообще не обязательна, если страницы связаны ссылками внутри сайта. Для ориентира: у нас на academy.agineai.com в карте 184 адреса вместе с блогом.
  • Прочерк на llms.txt. Норма, не ошибка.
  • Hreflang. Нужен, только если у сайта два языка и больше.

Что делать с отчётом на следующий день?

Чинить всё сразу не нужно. Отчёт это карта: он показывает, где именно робот спотыкается. Порядок такой.

Сначала группа А в robots.txt, потому что без неё остальное не имеет значения. Потом пустой текст без JavaScript, если пункт 5 показал пустоту. Потом заголовки и описания. Потом карта сайта и разметка. Техническая мелочь в конце.

Правки делай на локальной копии сайта, а не на живом. Локальная копия это тот же сайт, запущенный у тебя на компьютере, обычно по адресу localhost:3000. Пока правки живут там, посетители видят прежнюю версию, а выкатываешь ты сам, когда посмотришь результат своими глазами. Если сайт собран на конструкторе вроде Тильды или Викса, файлов тебе не отдадут: заголовки, описания, robots.txt и карту правь прямо в разделе SEO в настройках, остальные пункты отчёта там недоступны, и это нормально.

Когда после правок появится результат?

Быстрого результата не будет, и честные сроки такие.

Google в справке пишет, что обход новой или обновлённой страницы занимает от нескольких дней до нескольких недель. Там же прямо сказано, что повторные запросы на переобход по одному и тому же адресу не заставят робота прийти быстрее, а квота на отправку при этом тратится. По Яндексу точного срока в справке нет: страница появляется в поиске после очередного обхода, а данные в Вебмастере обновляются с задержкой в несколько дней.

Первые упоминания в ответах нейросетей появляются примерно через полтора-два месяца регулярных публикаций. Это наш опыт по Академии, а не документ, поэтому относись к сроку как к ориентиру.

Через месяц прогони тот же промт ещё раз и сравни два отчёта. Видно сразу: что робот уже увидел, а что ты починил не там, где ломалось.

Подробный разбор с готовыми промтами есть в блоке «Эхо» в Академии, три урока открыты бесплатно: https://academy.agineai.com/block/b12-eho

Частые вопросы

Проверка что-то меняет на сайте или может его сломать?

Нет. Промт только скачивает и читает файлы, которые и так открыты любому посетителю: robots.txt, sitemap.xml, код страниц. В самом тексте промта Клоду прямо запрещено что-либо менять. Запускать можно на живом сайте и в рабочее время.

У меня сайт на конструкторе, есть смысл проверять?

Да, отчёт придёт полный. Чинить получится не всё: в Тильде, Виксе или Битриксе тебе доступны заголовки, описания, robots.txt и карта сайта, они правятся в разделе SEO в настройках. Разметку Schema.org и способ отрисовки страницы там не меняют, и это нормально.

В пятом пункте пусто, текста без JavaScript нет. Насколько это плохо?

Плохо, но за вечер не чинится. Пустота означает, что страница собирается скриптами уже в браузере. Поисковые роботы с этим обычно справляются, часть роботов нейросетей нет. Решение это серверный рендеринг: покажи отчёт разработчику или Клоду во вкладке Code и спроси, можно ли его включить на твоём движке.

Обязательно ли делать llms.txt?

Нет. Стандарт неофициальный, читать этот файл никто не обязан, и у большинства сайтов его нет. Прочерк в отчёте не ошибка. Сделать файл дёшево, поэтому его часто заводят, но начинать надо не с него, а с первого пункта отчёта.

Клод пишет «проверить не смог». Что это значит?

Чаще всего сайт закрыт от прямых запросов защитой от ботов на стороне хостинга: вместо страницы приходит заглушка с проверкой. Это уже результат проверки, а не её сбой: тем же способом на сайт ходят роботы нейросетей. Попроси Клода показать код ответа и первые строки того, что пришло, и дальше смотри настройки защиты в панели хостинга, а не robots.txt.

Как часто повторять проверку?

После каждой заметной переделки сайта и раз в квартал просто так. Строки в robots.txt и разметка ломаются молча, чаще всего при переезде на новый шаблон или смене подрядчика, и заметить это без проверки нечем.

Сколько стоит такая проверка?

Нисколько сверх подписки на Claude. Промт использует только curl и python3, они уже стоят в macOS и Linux. Платные сервисы для этой проверки не нужны.

Начать бесплатный урокСмотреть всю программуВсе статьи