Индексация сайта в 2026: поисковые боты, AI-краулеры и как ими управлять

До 2023 года индексация означала одно: попасть в базы Яндекса и Google. В 2026 контуров два. Сайт сканируют не только поисковые роботы, но и AI-краулеры — GPTBot, ClaudeBot, PerplexityBot, — а поверх поискового индекса Яндекса строит ответы Алиса. По нашему baseline-замеру (2 496 коммерческих запросов, проверка Алисы и Google AI Overviews по каждому) Алиса даёт ответ на 57% запросов, AI Overviews — на 77%. Страница, которой нет в индексе, не существует ни для выдачи, ни для нейросетей.

Правила двух контуров различаются, и на этом теряют видимость даже крупные сайты: четверть мирового топ-1000 сегодня закрыта для GPTBot, причём часто — незаметно для владельцев, вместе с анти-бот защитой CDN или «защитным» шаблоном robots.txt. Ниже — как проверить оба контура за 10 минут, чем AI-краулеры отличаются от поисковых ботов и какие советы из старых статей в 2026 уже вредят.

Алексей Малков
Алексей Малков
Основатель GEOAudit.org • GEO/SEO-стратег
150+ аудитов • 12 лет в digital • 100+ отзывов на фрилансе
Индексация robots.txt AI-краулеры
Профиль автора →

Кто индексирует ваш сайт в 2026: таблица ботов

Первый контур — классические поисковые роботы: наполняют индекс выдачи. Второй — AI-краулеры: собирают контент для обучения моделей и для ответов в реальном времени. Важная деталь: у Алисы и AI Overviews отдельного «AI-индекса» нет — они строятся поверх индексов Яндекса и Google. Любая ошибка классической индексации автоматически режет и AI-видимость в этих системах.

БотЧейЗачем пускатьКак управлять
GooglebotПоиск Google, база AI OverviewsВыдача Google + AI-ответыrobots.txt, meta robots, GSC
YandexBotПоиск Яндекса, база АлисыВыдача Яндекса + ответы Алисыrobots.txt, Вебмастер
GPTBotOpenAIОбучение моделей GPT — знания о вас «внутри» ChatGPTUser-agent: GPTBot в robots.txt
OAI-SearchBot / ChatGPT-UserOpenAIПоиск и просмотр страниц в ChatGPT в реальном времениотдельные User-agent в robots.txt
ClaudeBotAnthropicОбучение и ответы ClaudeUser-agent: ClaudeBot
PerplexityBotPerplexityОтветы с цитированием источниковUser-agent: PerplexityBot
Google-ExtendedGoogleОбучение Gemini; на индексацию Поиска не влияетUser-agent: Google-Extended
AmazonbotAmazonОтветы AlexaUser-agent: Amazonbot
CCBotCommon CrawlОткрытые датасеты — на них учатся многие моделиблокировать, если не хотите в открытые датасеты

Практическое правило для B2B: пускать поисковых ботов и AI-краулеры «ответного» контура (OAI-SearchBot, ChatGPT-User, PerplexityBot); решение по обучающим (GPTBot, ClaudeBot, Google-Extended) принимать осознанно — для бизнеса, который хочет упоминаний в нейросетях, блокировка почти всегда ошибка. Готовые конфигурации по каждому боту — в разборе robots.txt для AI-краулеров.

Что такое индексация сайта — в одном абзаце

Индексация сайта — попадание его страниц в базу поисковой системы; только из этой базы страницы попадают в выдачу и в AI-ответы. Не путайте с ранжированием: индексация — «страница известна системе», ранжирование — «на каком она месте». Пока страницы нет в индексе, обсуждать позиции, сниппеты и цитируемость в Алисе бессмысленно.

Чек-лист: проверка индексации за 10 минут

Шаги 1-8 и 10 укладываются в 10 минут; шаг 9 требует доступа к логам — обычно это задача разработчику на 15 минут. Шаги 1-7 — классический контур, 8-10 — AI.

  1. (1 мин) site:вашдомен.ru в Яндексе и Google. Смотрите порядок цифр, а не точное число (оператор показывает оценку). Если страниц в разы меньше, чем на сайте, — сразу к шагам 5-6.
  2. (2 мин) Яндекс Вебмастер → «Индексирование» → «Страницы в поиске» → исключённые: у каждой страницы указана причина (дубль, малоценная, редирект).
  3. (2 мин) Google Search Console → отчёт «Индексирование страниц»: причины «Просканировано, но не проиндексировано», «Обнаружено, не просканировано», «Страница с переадресацией».
  4. (1 мин) Ключевая коммерческая страница: «Проверка страницы» в Вебмастере и URL Inspection в GSC. Проверять только главную — ошибка: главная в индексе почти всегда, проблемы живут в каталоге и блоге.
  5. (1 мин) вашдомен.ru/robots.txt: нет ли Disallow: / (классика после переезда с тестовой среды) и кого из AI-ботов вы блокируете — возможно, неосознанно, вместе с шаблоном CMS.
  6. (1 мин) Исходный код проблемных страниц: <meta name="robots" content="noindex"> и HTTP-заголовок X-Robots-Tag (DevTools → Network). Второй — самая незаметная из причин: в HTML его не видно.
  7. (1 мин) вашдомен.ru/sitemap.xml: файл открывается, в нём нет 404 и закрытых страниц, он указан в robots.txt и загружен в обе панели.
  8. (1 мин) AI-контур: откройте страницу с отключённым JavaScript (DevTools → Ctrl+Shift+P → «Disable JavaScript»). То, что исчезло, для AI-краулеров не существует.
  9. (логи, задача разработчику) Логи сервера за месяц по User-Agent: есть ли визиты GPTBot, ClaudeBot, PerplexityBot. Ноль визитов при открытом robots.txt — повод проверить файрвол и анти-бот защиту CDN.
  10. (1 мин) Спросите ChatGPT (с поиском) и Алису о вашем продукте и компании. Это финальный тест обоих контуров сразу: консоли для AI-индекса не существует, ответ нейросети — единственная «выдача», которую можно проверить напрямую.

Не хотите проверять оба контура вручную?

Бесплатная GEO-диагностика покажет, видит ли AI-краулер ваш сайт и упоминают ли вас нейросети — за 24 часа.

Проверить сайт

Чем AI-краулеры отличаются от поисковых ботов

Это граница между SEO и GEO: классическая индексация — зона SEO (видимость в выдаче), доступность AI-краулерам — зона GEO (видимость в ответах нейросетей). Правила ниже относятся ко второму контуру.

1. Они не исполняют JavaScript. По исследованию Vercel/Merj на реальном трафике краулеров ни один крупный AI-бот не рендерит JS: GPTBot скачивает JS-файлы примерно в 11,5% запросов, ClaudeBot — в 23,8%, но не исполняет их. Googlebot ваш React-каталог отрендерит и проиндексирует, а GPTBot и PerplexityBot увидят пустой контейнер. Это главная причина ситуации «в Google есть, в ChatGPT нет». Решение — SSR или пререндеринг ключевых страниц.

2. У них нет консоли. Для Яндекса и Google есть Вебмастер и Search Console; «Search Console для ChatGPT» не существует. Проверка AI-контура — только косвенная: логи сервера по User-Agent и прямые вопросы к ассистентам (шаги 9-10 чек-листа).

3. Обучение и ответы — разные боты. GPTBot собирает данные для обучения моделей, OAI-SearchBot и ChatGPT-User приходят за страницей в момент, когда пользователь задал вопрос. Блокируя «все AI-боты» одной директивой, вы отключаете не только попадание в обучающие данные, но и цитирование в реальном времени — то есть весь канал. Google-Extended — обратный случай: его блокировка не влияет на индексацию Поиска, только на обучение Gemini.

4. Им помогает llms.txt. Файл-указатель для нейросетей: какие страницы главные и о чём сайт. Он не заменяет ни robots.txt, ни sitemap — это ориентир, а не директива. Как его составить — в руководстве по llms.txt.

«Прежде чем нейросеть вас порекомендует, её краулер должен вас прочитать. Половина проблем AI-видимости, которые я разбираю, — это не контент, а доступность: JS-рендеринг, robots.txt, анти-бот защита»
Павел Ким
Технический GEO-инженер GEOAudit.org • 150+ техаудитов

Почему страницы выпадают из индекса: симптом → причина

СимптомВероятная причинаГде подтвердить
Выпал целый разделDisallow в robots.txt, noindex в шаблоне раздела, «малоценные» дублиВебмастер: причина исключения
Страницы «Обнаружены, не просканированы» неделямислабая перелинковка, исчерпан краулинговый бюджет, медленный серверGSC, логи
«Просканировано, не проиндексировано»тонкий контент, дубль без canonicalконтент-аудит раздела
Страница пропадает и возвращаетсянестабильные 5xx, таймауты хостинга«Проверка ответа сервера» в Вебмастере
Новые страницы не находятся месяцстраница-сирота: нет внутренних ссылок, нет в sitemapкраулер (Screaming Frog), отчёт по ссылкам
В Яндексе есть, в Google нет (или наоборот)разные правила для ботов в robots.txt, санкции одной системысравнение отчётов панелей

Правило диагностики: сначала техника (robots, noindex, ответ сервера), потом контент. Переписывать тексты при закрытом robots.txt — самая дорогая из бесполезных работ.

Как ускорить индексацию: что работает и где не работает

Ориентиры по срокам: по исследованию IndexCheckr на 16 млн страниц средний срок индексации в Google — 27,4 дня, за первую неделю индексируется только 14% страниц. Молодой сайт ждёт первую индексацию в среднем ~18 дней, трастовый — ~3 дня. В Яндексе переобход отрабатывает до 14 дней. Планируйте запуски контента с этим лагом.

СпособРаботаетОграничение
sitemap.xml + загрузка в панелиДа, базане спасает страницу-сироту; карта с 404 подрывает доверие робота
Переобход в ВебмастереДа, для точечных страницдневной лимит; до 14 дней
Запрос индексирования в GSCДа, точечнолимит запросов; не гарантия включения
IndexNowДа — Яндекс, BingGoogle не поддерживает
Обход по счётчикам МетрикиДа, для Яндексатребует привязки Метрики к Вебмастеру
Внутренние ссылки с трастовых страницДа, системнонужна реальная структура, а не «ссылки ради ссылок»
Внешняя ссылка с посещаемого ресурсаДа, особенно для новых сайтовразовые «прогоны» по каталогам не работают
Обновление даты без изменения контентаНетробот сверяет содержимое, не дату

Ошибки управления индексацией в 2026

  1. Блокировать GPTBot по чужому сценарию. Доля топ-1000 сайтов, закрытых для GPTBot, выросла с 5% в 2023 до 25% к 2026 — но это в основном медиа, чья сделка «остаться в Google, не отдать контент в обучение» осмысленна: они продают сам контент. Если вы продаёте товары или услуги, у вас обратная задача — чтобы нейросети о вас знали и вас рекомендовали. Копировать robots.txt издателей — отключить себе канал.
  2. Следовать старым статьям. Директива Host отменена Яндексом ещё в 2018, Crawl-delay игнорируется с 2019 (скорость задаётся в Вебмастере), тег <noindex> — архаика. Эти советы до сих пор в топе выдачи.
  3. Верить, что Disallow удаляет страницу из выдачи. Закрытая в robots.txt страница может остаться в выдаче со сниппетом «Владелец предпочёл скрыть содержимое». Для удаления нужен noindex (при открытом доступе робота) или инструмент удаления в панелях.
  4. Проверять только оператором site: и только главную. Обе цифры обманчивы: оператор даёт оценку, главная индексируется почти всегда. Реальная картина — в отчётах панелей по разделам.
  5. Не замечать анти-бот защиту CDN. Правило «challenge всем незнакомым ботам» в CDN-сервисах молча режет GPTBot и PerplexityBot даже при разрешающем robots.txt. Проверяется только по логам (шаг 9 чек-листа).

FAQ

Сайт есть в Google, но ChatGPT о нём не знает. Почему?

Три типовые причины в порядке частоты: контент рендерится JavaScript (AI-краулеры его не исполняют), GPTBot заблокирован в robots.txt или файрволом, домен молодой и ещё не попал в обучающие данные модели. Диагностика — шаги 5, 8, 9 чек-листа.

Блокировка GPTBot повлияет на позиции в Google или Яндексе?

Нет. GPTBot не связан с поисковыми индексами. Но вы исчезнете из знаний моделей OpenAI, а если заблокировали заодно OAI-SearchBot и ChatGPT-User — и из ответов ChatGPT с поиском.

Алиса индексирует сайт отдельно от Яндекса?

Нет. Алиса строит ответы поверх поискового индекса Яндекса. Отдельного «краулера Алисы» не существует: если страница выпала из индекса Яндекса, она недоступна и Алисе. Поэтому классическая техоптимизация под Яндекс — обязательное условие видимости в Алисе.

Достаточно ли llms.txt, чтобы нейросети «увидели» сайт?

Нет. llms.txt — ориентир, а не механизм индексации. Если контент закрыт для AI-ботов или спрятан за JavaScript, файл не поможет. Порядок приоритетов: доступность краулеров → серверный рендеринг → разметка → llms.txt.

Сколько страниц можно отправить на переобход вручную?

У Яндекса — индивидуальный дневной лимит (виден в Вебмастере, зависит от сайта), у Google URL Inspection — порядка десятка запросов в сутки. Поэтому ручная отправка — инструмент для приоритетных и исправленных страниц; системно индексацию решают sitemap, перелинковка и стабильный сервер.

Проверим оба контура за вас

Технический аудит с AI-слоем — 42 пункта: классическая индексация, Core Web Vitals, доступность GPTBot и Алисы, llms.txt, Schema.org. Чек-лист для разработчиков, 5-7 дней, от 40 000 ₽.

Заказать технический аудит Бесплатный экспресс-аудит

Автор: Павел Ким, технический GEO-инженер. Рецензент: Алексей Малков, основатель GEOAudit.org, 150+ аудитов.

Заказать GEO-аудит или связаться с нами можно через форму на сайте, по email info@geoaudit.org или в Telegram @geoaudit — отвечаем в течение двух часов в рабочие дни.