Доступность сайта: краулер нейросети приходит один раз

Доступность сайта — это доля времени, когда сервер отвечает роботу и человеку кодом 200, а не ошибкой, капчей или таймаутом. Для классического поиска короткое падение почти безобидно: робот вернётся через сутки и переиндексирует страницу. Для нейросетей всё жёстче — краулер ChatGPT, Perplexity или Алисы приходит в момент конкретного запроса пользователя, и если сайт в это окно недоступен, в ответе окажется конкурент. HTTPS, срок жизни сертификата, коды ответов и настройки антибот-защиты работают здесь не как «факторы ранжирования», а как условие входа. Ниже — как измерить аптайм, где чаще всего ломается доступ именно для AI-краулеров и что чинить первым.

Алексей Малков
Алексей Малков
Основатель GEOAudit.org • GEO/SEO-стратег
150+ аудитов • 12 лет в digital • 100+ отзывов на фрилансе
Аптайм и коды ответов HTTPS и сертификаты Технический GEO-аудит
Профиль автора →

Доступность сайта — это доля времени, когда сервер отвечает кодом 200

Доступность сайта считают арифметически: берут период наблюдения, вычитают минуты, когда сервер не отвечал или отвечал ошибкой, и переводят остаток в проценты. То же самое в англоязычной документации называют uptime, а в разговоре администраторов — аптайм. Ключевая деталь, которую упускают почти все: «отвечал» здесь означает код ответа сервера, а не картинку на экране. Страница, которая прекрасно открывается у вас в браузере, но отдаёт роботу 403 или страницу проверки на человека, в отчёте мониторинга выглядит идеально — а для нейросети в этот момент сайта нет.

Поэтому в техническом аудите мы всегда разводим две величины: доступность для людей и доступность для роботов. Первую показывает внешний мониторинг, вторую видно только в логах сервера — по тому, с каким кодом ушёл GPTBot, PerplexityBot, ClaudeBot или YandexBot. Расхождение между этими двумя числами и есть та зона, где сайт теряет цитаты, не теряя ни одного посетителя.

АптаймПростой за 30-дневный месяцПростой за годЧто это значит на практике
99%7 ч 12 миноколо 3,6 сутокУровень дешёвого шаред-хостинга: сайт заметно «моргает», часть обходов теряется гарантированно
99,5%3 ч 36 миноколо 1,8 сутокТипичное состояние сайта без мониторинга: падения замечают по звонку клиента
99,9%43 миноколо 8,8 часаРабочая норма для коммерческого сайта, реально достижимая на нормальном VPS
99,95%21 мин 36 соколо 4,4 часаТребует мониторинга с коротким интервалом и регламента реакции
99,99%4 мин 19 соколо 52 минутРезервирование и автоматическое переключение; для контентного сайта избыточно

Таблица выше — чистый расчёт, а не чья-то статистика: в 30-дневном месяце 43 200 минут, в году — 525 600. Смотреть на неё стоит не как на рейтинг хостингов, а как на перевод маркетинговых «трёх девяток» в минуты, за которые сайт молчит.

43 минуты
Столько простоя в месяц укладывается в аптайм 99,9%. Для классического поиска это ничто. Для сайта, который должен ответить краулеру нейросети в момент вопроса пользователя, это 43 минуты, когда вместо вас называют кого-то другого.
Источник: расчёт от 43 200 минут в 30-дневном месяце

Обновлено: август 2026 — пересобрали раздел про коды ответов: добавили строку про 429 и rate limit, которого в прошлой редакции не было, и развели два значения термина «доступность сайта» (аптайм и доступная среда) в отдельный раздел, потому что этот вопрос стал приходить от клиентов чаще технических.

Краулер нейросети приходит в момент вопроса и второй попытки не делает

Классический поисковый робот живёт по расписанию. Он ходит по сайту регулярно, держит копию страницы в индексе и, если сегодня получил ошибку, вернётся завтра. Падение на сорок минут в такой схеме почти ничего не стоит: в выдаче остаётся сохранённая версия, переобход случится сам.

Нейросети работают иначе. Ответ Алисы, ChatGPT или Perplexity собирается из двух частей: того, что модель усвоила при обучении, и живого обхода страниц в момент конкретного запроса. Второй режим мы называем окном обхода — это короткий интервал, когда робот пришёл именно за вашей страницей, потому что кто-то прямо сейчас задал вопрос по вашей теме. Если в окно обхода сервер отдал ошибку, таймаут или проверку на робота, страница не «переиндексируется завтра»: ответ пользователю уже собран, и в нём другой источник. Как устроена эта сборка по шагам, разобрано в материале как работают нейроответы. У Google под это отведены два разных интерфейса: сводка AI Overviews над обычной выдачей и диалоговый режим AI Mode на базе Gemini, куда пользователь заходит отдельной вкладкой и задаёт уточняющие вопросы.

Почему одно падение стоит дороже, чем кажется

У классического поиска ошибка обхода — отложенная проблема: контент вернётся в выдачу после переобхода. У генеративного ответа ошибка обхода — потерянный ответ: он сформирован один раз, для одного человека, и переписан не будет. Чем уже ниша, тем дороже каждое такое окно: по редкому B2B-запросу нейросеть обращается к десятку источников, и выпасть из этого десятка проще, чем из топ-10 выдачи.

Есть и вторая, менее очевидная сторона. Регулярные отказы влияют не только на конкретный ответ: источник, который часто не отвечает, реже попадает в подборку в принципе. Технические сигналы работают на общий уровень доверия к домену наравне с экспертностью и упоминаниями — про этот механизм есть отдельный разбор, как нейросети выбирают источники.

HTTPS для сайта — условие входа, а не прибавка к позициям

Вокруг HTTPS до сих пор живёт мифология уровня «переехали на https, ждём рост позиций». Роста не будет: шифрование давно стало гигиенической нормой, а не преимуществом. Зато его отсутствие или поломка отсекают сайт целиком. Браузеры маркируют http-страницы как небезопасные, часть клиентских библиотек, которыми ходят краулеры, обрывает соединение при ошибке TLS, а форма заявки на незащищённой странице — это ещё и вопрос к персональным данным.

Практически всё, что ломается в HTTPS для сайта, укладывается в шесть пунктов. Мы проверяем их в таком порядке.

  • Срок действия сертификата. Сертификаты Let's Encrypt выдаются на 90 дней и продлеваются автоматически. Автопродление ломается тихо: сайт живёт три месяца, а потом в случайную ночь перестаёт открываться у всех сразу.
  • Полная цепочка сертификатов. Самый коварный случай: сервер отдаёт только конечный сертификат, без промежуточного. Браузеры такую цепочку часто достраивают сами, а простой HTTP-клиент — нет. Сайт «работает у всех», но на запрос робота отвечает ошибкой TLS.
  • Совпадение имени. Сертификат выписан на домен без www, а сайт открывается с www (или наоборот) — половина обращений упирается в предупреждение.
  • Смешанный контент. Картинки, шрифты и скрипты, подтянутые по http внутри https-страницы. Браузер их блокирует, страница едет, а робот получает документ, в котором не хватает кусков.
  • Редирект в один шаг. http://site.ru должен вести на https://site.ru одним 301-м, а не цепочкой из трёх переходов через www и слеш. Каждое лишнее звено — шанс потерять робота на таймауте.
  • Единый протокол во внутренних сигналах. Canonical, карта сайта, микроразметка и внутренние ссылки должны указывать на https-версию. Разнобой здесь превращается в две версии сайта в глазах робота.

Истёкший сертификат — это не «мелочь на пару часов»

Пока сертификат просрочен, сайт недоступен не выборочно, а полностью: и для людей, и для роботов, и для внешних сервисов, которые тянут с него данные. Это единственная поломка из списка, которая одномоментно обнуляет доступность сайта на всех фронтах. Поставьте оповещение о сроке действия хотя бы за 14 дней и проверьте, что оно приходит человеку, а не в почтовый ящик, который никто не открывает.

Для робота «сайт работает» — это код 200, а не то, что видно на экране

Дальше начинается зона, где статистика аптайма врёт особенно охотно. Мониторинг проверяет сайт из своей точки, своим клиентом и со своим user-agent. Краулер нейросети приходит с другого адреса, другим клиентом и представляется иначе — и получает совсем другой ответ. Ниже коды, которые мы чаще всего встречаем в логах, и что каждый из них означает для попадания в нейроответ.

Код ответаЧто за ним обычно стоитЧто это значит для нейроответаЧто делать
200 с пустым теломКаркас страницы без текста: контент дорисовывается скриптамиФормально доступен, фактически цитировать нечегоОтдавать значимый текст в исходном HTML
301 / 302Переезд, склейка www, слеш в концеТерпимо при одном шаге; цепочка из трёх и более съедает бюджет обходаСократить до одного перехода, обновить внутренние ссылки
403Файрвол, антибот-защита, блокировка по стране или user-agentПолная невидимость: робот не получил ни байта контентаВнести краулеры в исключения, проверить гео-фильтры
429Ограничение частоты запросов сработало на роботаЧасть страниц обходится, часть выпадает без системыПоднять лимит для известных ботов, отдавать заголовок Retry-After
503 + Retry-AfterПлановые технические работы, оформленные корректноНаименее болезненный вариант простоя: робот понимает, когда вернутьсяИспользовать именно этот код на время работ, а не заглушку с кодом 200
500 / 502 / 504Ошибка приложения, упавший бэкенд, таймаут шлюзаСтраница выпадает из выдачи и из подборки источниковМониторинг с оповещением, разбор по логам приложения
Таймаут без кодаСервер думает дольше, чем робот готов ждатьЭквивалент падения, но не виден в отчётах мониторингаСократить время ответа сервера, включить кэширование

Отдельно про 503. Это единственный честный способ пережить техработы: код прямо говорит «сервис временно недоступен», а заголовок Retry-After подсказывает, когда возвращаться. Замена его на страницу «идут работы, зайдите позже» с кодом 200 — классическая ошибка: робот получает успешный ответ и записывает содержимое страницы как актуальное. Дальше вы месяц объясняете, почему нейросеть на вопрос о ваших услугах отвечает «сайт на техобслуживании», хотя на сайте давно всё работает.

Соседний сюжет — скорость ответа. Формально это не про доступность, но таймаут выглядит для робота ровно как падение. Нормы времени ответа и способы измерения разобраны отдельно: проверка сайта на скорость.

Чаще всего сайт доступен всем, кроме роботов

Это главный вывод, который мы вынесли из технических аудитов: полностью лежащие сайты — редкость, избирательная недоступность — норма. Владелец видит зелёный статус в панели хостинга, менеджеры принимают заявки, а в логах ровными рядами лежат 403-и на всех AI-краулеров подряд. Вот откуда они берутся.

  • Антибот-защита и файрвол. Cloudflare, встроенный WAF хостинга, модуль защиты от парсинга. Правило «блокировать всё, что не похоже на браузер» отсекает GPTBot и PerplexityBot первыми — они и не притворяются браузерами.
  • Проверка на человека. JS-испытание или капча на входе. Человек кликает и проходит, робот получает страницу проверки с кодом 200 — и записывает её как содержимое вашего сайта.
  • Гео-блокировки. Многие российские сайты после серии атак закрывают доступ с зарубежных адресов. Логика понятная, побочный эффект — тоже: краулеры OpenAI, Perplexity и Anthropic ходят с зарубежных диапазонов, и для них ваш сайт просто не существует.
  • Ограничение частоты запросов. Лимит, настроенный «на всякий случай», при обходе большого каталога срабатывает на середине и отдаёт 429.
  • Запреты в robots.txt. Отдельная дисциплина: кого пускать, кого нет, и чем директива для GPTBot отличается от директивы для Googlebot, разобрано в материале про robots.txt и AI-краулеров.
  • Блокировка по региону в CDN. Кэш настроен на одну страну, запрос из другой уходит на исходный сервер и упирается в тот же файрвол.
  • Незакрытый тестовый контур. Обратная ошибка: staging-версия открыта и доступна, робот индексирует её вместо боевой. Формально доступность стопроцентная, фактически цитируют черновик.
За 150+ аудитов у меня сложилась почти железная последовательность: если бренд не появляется в ответах нейросетей, первым делом мы смотрим не контент, а логи. Регулярно находим там визиты GPTBot, которые закончились кодом 403: робот приходил, упирался в защиту и уходил ни с чем. Самое неприятное в этой находке — что её невозможно увидеть снаружи. Сайт открывается, мониторинг рисует зелёный статус, аптайм в отчёте прекрасный, а бренд невидим.
Алексей Малков
Алексей Малков
Основатель GEOAudit.org

Важная оговорка: закрывать краулеры — законное решение. Есть проекты, которым не нужен ни ChatGPT, ни Perplexity, и лишняя нагрузка им ни к чему. Плохо не решение, а то, что чаще всего оно и не было решением: сработала настройка по умолчанию, о которой в компании никто не знает.

Как за неделю измерить доступность сайта для роботов

Проверка не требует ни разработчика, ни платных сервисов — нужен доступ к логам сервера и полчаса времени. Порядок такой.

  1. Внешний мониторинг с коротким интервалом. Проверка раз в минуту из нескольких географических точек. Интервал в полчаса ловит только длинные падения, а короткие — те самые, что попадают в окно обхода, — проходят мимо отчёта.
  2. Запрос от имени робота. curl -sI -A "GPTBot" https://site.ru/stranica вернёт заголовки ровно в том виде, в каком их получает краулер. Повторите для PerplexityBot, ClaudeBot и YandexBot. Интересует первая строка — код ответа.
  3. Тот же запрос с зарубежного адреса. Если под рукой нет VPS за границей, попросите коллегу или используйте любой онлайн-сервис проверки доступности из разных стран. Это единственный способ поймать гео-блокировку.
  4. Логи за месяц по user-agent. Фильтр по GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, YandexBot. Смотреть на две вещи: приходил ли робот вообще и с каким кодом ушёл. Ноль визитов — тоже результат, и он говорит о запретах, а не о везении.
  5. Сертификат целиком. Срок действия, совпадение имени домена, полнота цепочки. Проверять нужно именно цепочку — браузер её достраивает и потому ничего не покажет.
  6. Поведение под нагрузкой. Посмотрите коды ответов в час пик и во время выгрузки прайса или бэкапа. Стабильный сайт, который отдаёт 502 каждый вторник в три ночи, — это тоже дыра в аптайме, просто вы в это время спите.

Как отличить проблему доступа от проблемы контента

Если робот получает код 200 и полный HTML, а бренд всё равно не появляется в ответах, дело не в доступности сайта — техническая часть отработала. Дальше вопрос к содержанию: есть ли на странице формулировка, которую вообще можно процитировать, и подтверждается ли она чем-то за пределами домена. Смежная развилка — контент, который есть на экране, но отсутствует в исходном коде: это разбирается в материале про JavaScript и AI-краулеров.

Все шесть проверок вместе с логами и кодами ответов входят в первый блок нашего технического аудита и попадают в AI Visibility Score отдельной группой: пока страница физически недоступна роботу, улучшать её по смыслу бесполезно. Более широкий список технических дефектов, которые ломают обход, собран в материале проверка сайта на ошибки. Следующий слой после доступа — машиночитаемость: факты о компании, услуге и авторе выносятся в разметку JSON-LD отдельным блоком, чтобы модель не восстанавливала их из вёрстки по догадке.

📈
Кейс
GEO-аудит B2B-производства
+180% трафика

«Доступность сайта» означает две разные вещи, и путают их постоянно

Запрос «доступность сайта» приводит на страницы двух совершенно разных дисциплин. Первая — та, о которой весь материал выше: аптайм, коды ответов, uptime-мониторинг. Вторая — доступность в смысле доступной среды: возможность пользоваться сайтом людям с нарушениями зрения, слуха и моторики. У неё свои стандарты: международный WCAG от консорциума W3C и российский ГОСТ на требования к доступности интернет-ресурсов для инвалидов. Для государственных и образовательных сайтов это обязательное требование, а не пожелание.

Вопрос, который нам задают и на который в статьях по теме ответа обычно нет: помогает ли соответствие WCAG попасть в ответы нейросетей? Честный ответ — напрямую нет. Ни одна платформа не заявляла, что учитывает соответствие стандартам доступной среды при выборе источника. Но пересечение всё же есть, и оно техническое: и скринридер, и парсер AI-краулера читают одну и ту же машинную структуру документа.

  • Семантические заголовки. Иерархия h1–h3 вместо жирного текста нужна и скринридеру, и модели, которая режет страницу на смысловые блоки.
  • Текстовые альтернативы. Атрибут alt у изображений — единственный способ передать смысл картинки тому, кто её не видит. Робот в этом смысле ничем не отличается от незрячего пользователя.
  • Контент, читаемый без скриптов. Требование доступной среды и требование машиночитаемости здесь совпадают дословно.
  • Подписи к таблицам и полям форм. Понятная разметка вместо визуальных подсказок — то, что позволяет извлечь из таблицы данные, а не набор чисел.

Вывод простой: делать аудит доступной среды ради цитируемости в нейросетях не нужно, это отдельная задача с отдельной мотивацией. Но если он у вас уже сделан, значительная часть требований к машиночитаемости закрыта попутно.

Когда за аптайм не стоит доплачивать и что не сработает

Доступность легко превратить в дорогую игрушку. Мы регулярно отговариваем клиентов от вложений в неё — вот пять ситуаций, когда деньги лучше потратить на что-то другое.

  • У вас уже 99,9% и нет всплесков нагрузки. Разница между 99,9% и 99,99% для контентного сайта — это резервирование и дежурство, то есть постоянные расходы ради 39 сэкономленных минут в месяц.
  • Сайт закрыт от посторонних. Личный кабинет, внутренний портал, панель управления: роботы туда не ходят и не должны.
  • Про вас нигде не спрашивают. Нейросеть не назовёт бренд, вокруг которого нет ни запросов, ни упоминаний. Идеальный аптайм не создаёт причину вас процитировать — он только убирает препятствие.
  • Трафик приходит не из поиска. Если продажи идут из рекламы и рекомендаций, доступность важна для конверсии, но переносить её в список задач по видимости смысла мало.
  • Некому дежурить. Мониторинг, который присылает оповещения в чат, где их никто не читает, не улучшает доступность сайта ни на минуту. Сначала регламент реакции, потом инструменты.

И то, что не сработает точно. Переезд на HTTPS не поднимет позиции сам по себе — он снимает ограничение, а не добавляет вес. Дорогой хостинг не спасёт от 403, если блокирует не хостинг, а ваш файрвол. Статус-страница на том же сервере бесполезна: когда падает сервер, падает и она. Наконец, глухая блокировка всех ботов подряд ради экономии трафика — это не защита, а решение не участвовать в генеративном поиске, и принимать его стоит осознанно.

Если непонятно, к какой группе относится ваш сайт, начните с бесплатной диагностики (0 ₽): мы покажем, с какими кодами уходят краулеры нейросетей и кого называют вместо вас. Полная проверка доступа, аптайма, скорости и разметки по 42 пунктам — это технический GEO-аудит, от 40 000 ₽.

FAQ

Что такое доступность сайта простыми словами?

Это доля времени, когда сервер отвечает на запрос кодом 200 и отдаёт содержимое страницы. Считается по формуле: время работы разделить на общее время наблюдения. Важно, что доступность измеряется для конкретного клиента: сайт может быть доступен браузеру человека и одновременно недоступен краулеру нейросети, который получает 403 от антибот-защиты.

Какой аптайм считается нормальным для коммерческого сайта?

Рабочая норма — 99,9%, это около 43 минут простоя за 30-дневный месяц. Уровень 99,99% требует резервирования и дежурной смены, и для контентного сайта такие расходы редко окупаются. Гораздо важнее числа в отчёте другое: не приходятся ли эти минуты на регулярное событие вроде ночной выгрузки прайса, и не отдаёт ли сайт ошибку избирательно — только роботам.

Влияет ли HTTPS для сайта на попадание в ответы нейросетей?

Само по себе шифрование преимущества не даёт — это гигиеническая норма, а не фактор ранжирования. А вот сломанный HTTPS отсекает сайт целиком: при истёкшем сертификате или неполной цепочке робот получает ошибку TLS и уходит ни с чем. Проверять нужно четыре вещи: срок действия, совпадение имени домена, полноту цепочки и отсутствие смешанного контента.

Почему AI-краулер получает 403, если сайт открывается в браузере?

Потому что блокирует не сервер, а слой защиты: файрвол, антибот-модуль, ограничение по стране или по user-agent. Краулеры OpenAI, Perplexity и Anthropic не притворяются браузерами и ходят с зарубежных адресов, поэтому под правило «блокировать всё, что не похоже на человека» попадают первыми. Увидеть это снаружи невозможно — нужно смотреть логи сервера по user-agent.

Как проверить доступность сайта для AI-краулеров бесплатно?

Запросите свою страницу командой curl -sI -A "GPTBot" https://site.ru/stranica и посмотрите на код в первой строке ответа, затем повторите для PerplexityBot и YandexBot. Дополните это выгрузкой логов за месяц с фильтром по тем же именам: интересует и факт визитов, и код ответа. Полностью бесплатно это же покажет наша диагностика (0 ₽).

Как правильно закрыть сайт на технические работы?

Отдавать код 503 с заголовком Retry-After и указанием ожидаемого срока. Так робот понимает, что недоступность временная, и вернётся позже, не выбрасывая страницы из подборки источников. Заглушка «идут работы» с кодом 200 — худший вариант: робот запишет её текст как актуальное содержимое сайта.

Проверим, доступен ли ваш сайт для роботов нейросетей

Бесплатная диагностика (0 ₽) покажет, с какими кодами уходят краулеры ChatGPT, Perplexity и Алисы и кого называют вместо вас. Полная проверка доступа, аптайма, скорости и разметки — технический GEO-аудит от 40 000 ₽.

Бесплатная GEO-диагностика Заказать полный GEO-аудит