Индексация сайта в 2026: поисковые боты, AI-краулеры и как ими управлять
До 2023 года индексация означала одно: попасть в базы Яндекса и Google. В 2026 контуров два. Сайт сканируют не только поисковые роботы, но и AI-краулеры — GPTBot, ClaudeBot, PerplexityBot, — а поверх поискового индекса Яндекса строит ответы Алиса. По нашему baseline-замеру (2 496 коммерческих запросов, проверка Алисы и Google AI Overviews по каждому) Алиса даёт ответ на 57% запросов, AI Overviews — на 77%. Страница, которой нет в индексе, не существует ни для выдачи, ни для нейросетей.
Правила двух контуров различаются, и на этом теряют видимость даже крупные сайты: четверть мирового топ-1000 сегодня закрыта для GPTBot, причём часто — незаметно для владельцев, вместе с анти-бот защитой CDN или «защитным» шаблоном robots.txt. Ниже — как проверить оба контура за 10 минут, чем AI-краулеры отличаются от поисковых ботов и какие советы из старых статей в 2026 уже вредят.
Кто индексирует ваш сайт в 2026: таблица ботов
Первый контур — классические поисковые роботы: наполняют индекс выдачи. Второй — AI-краулеры: собирают контент для обучения моделей и для ответов в реальном времени. Важная деталь: у Алисы и AI Overviews отдельного «AI-индекса» нет — они строятся поверх индексов Яндекса и Google. Любая ошибка классической индексации автоматически режет и AI-видимость в этих системах.
| Бот | Чей | Зачем пускать | Как управлять |
|---|---|---|---|
| Googlebot | Поиск Google, база AI Overviews | Выдача Google + AI-ответы | robots.txt, meta robots, GSC |
| YandexBot | Поиск Яндекса, база Алисы | Выдача Яндекса + ответы Алисы | robots.txt, Вебмастер |
| GPTBot | OpenAI | Обучение моделей GPT — знания о вас «внутри» ChatGPT | User-agent: GPTBot в robots.txt |
| OAI-SearchBot / ChatGPT-User | OpenAI | Поиск и просмотр страниц в ChatGPT в реальном времени | отдельные User-agent в robots.txt |
| ClaudeBot | Anthropic | Обучение и ответы Claude | User-agent: ClaudeBot |
| PerplexityBot | Perplexity | Ответы с цитированием источников | User-agent: PerplexityBot |
| Google-Extended | Обучение Gemini; на индексацию Поиска не влияет | User-agent: Google-Extended | |
| Amazonbot | Amazon | Ответы Alexa | User-agent: Amazonbot |
| CCBot | Common Crawl | Открытые датасеты — на них учатся многие модели | блокировать, если не хотите в открытые датасеты |
Практическое правило для B2B: пускать поисковых ботов и AI-краулеры «ответного» контура (OAI-SearchBot, ChatGPT-User, PerplexityBot); решение по обучающим (GPTBot, ClaudeBot, Google-Extended) принимать осознанно — для бизнеса, который хочет упоминаний в нейросетях, блокировка почти всегда ошибка. Готовые конфигурации по каждому боту — в разборе robots.txt для AI-краулеров.
Что такое индексация сайта — в одном абзаце
Индексация сайта — попадание его страниц в базу поисковой системы; только из этой базы страницы попадают в выдачу и в AI-ответы. Не путайте с ранжированием: индексация — «страница известна системе», ранжирование — «на каком она месте». Пока страницы нет в индексе, обсуждать позиции, сниппеты и цитируемость в Алисе бессмысленно.
Чек-лист: проверка индексации за 10 минут
Шаги 1-8 и 10 укладываются в 10 минут; шаг 9 требует доступа к логам — обычно это задача разработчику на 15 минут. Шаги 1-7 — классический контур, 8-10 — AI.
- (1 мин)
site:вашдомен.ruв Яндексе и Google. Смотрите порядок цифр, а не точное число (оператор показывает оценку). Если страниц в разы меньше, чем на сайте, — сразу к шагам 5-6. - (2 мин) Яндекс Вебмастер → «Индексирование» → «Страницы в поиске» → исключённые: у каждой страницы указана причина (дубль, малоценная, редирект).
- (2 мин) Google Search Console → отчёт «Индексирование страниц»: причины «Просканировано, но не проиндексировано», «Обнаружено, не просканировано», «Страница с переадресацией».
- (1 мин) Ключевая коммерческая страница: «Проверка страницы» в Вебмастере и URL Inspection в GSC. Проверять только главную — ошибка: главная в индексе почти всегда, проблемы живут в каталоге и блоге.
- (1 мин)
вашдомен.ru/robots.txt: нет лиDisallow: /(классика после переезда с тестовой среды) и кого из AI-ботов вы блокируете — возможно, неосознанно, вместе с шаблоном CMS. - (1 мин) Исходный код проблемных страниц:
<meta name="robots" content="noindex">и HTTP-заголовокX-Robots-Tag(DevTools → Network). Второй — самая незаметная из причин: в HTML его не видно. - (1 мин)
вашдомен.ru/sitemap.xml: файл открывается, в нём нет 404 и закрытых страниц, он указан в robots.txt и загружен в обе панели. - (1 мин) AI-контур: откройте страницу с отключённым JavaScript (DevTools → Ctrl+Shift+P → «Disable JavaScript»). То, что исчезло, для AI-краулеров не существует.
- (логи, задача разработчику) Логи сервера за месяц по User-Agent: есть ли визиты GPTBot, ClaudeBot, PerplexityBot. Ноль визитов при открытом robots.txt — повод проверить файрвол и анти-бот защиту CDN.
- (1 мин) Спросите ChatGPT (с поиском) и Алису о вашем продукте и компании. Это финальный тест обоих контуров сразу: консоли для AI-индекса не существует, ответ нейросети — единственная «выдача», которую можно проверить напрямую.
Чем AI-краулеры отличаются от поисковых ботов
Это граница между SEO и GEO: классическая индексация — зона SEO (видимость в выдаче), доступность AI-краулерам — зона GEO (видимость в ответах нейросетей). Правила ниже относятся ко второму контуру.
1. Они не исполняют JavaScript. По исследованию Vercel/Merj на реальном трафике краулеров ни один крупный AI-бот не рендерит JS: GPTBot скачивает JS-файлы примерно в 11,5% запросов, ClaudeBot — в 23,8%, но не исполняет их. Googlebot ваш React-каталог отрендерит и проиндексирует, а GPTBot и PerplexityBot увидят пустой контейнер. Это главная причина ситуации «в Google есть, в ChatGPT нет». Решение — SSR или пререндеринг ключевых страниц.
2. У них нет консоли. Для Яндекса и Google есть Вебмастер и Search Console; «Search Console для ChatGPT» не существует. Проверка AI-контура — только косвенная: логи сервера по User-Agent и прямые вопросы к ассистентам (шаги 9-10 чек-листа).
3. Обучение и ответы — разные боты. GPTBot собирает данные для обучения моделей, OAI-SearchBot и ChatGPT-User приходят за страницей в момент, когда пользователь задал вопрос. Блокируя «все AI-боты» одной директивой, вы отключаете не только попадание в обучающие данные, но и цитирование в реальном времени — то есть весь канал. Google-Extended — обратный случай: его блокировка не влияет на индексацию Поиска, только на обучение Gemini.
4. Им помогает llms.txt. Файл-указатель для нейросетей: какие страницы главные и о чём сайт. Он не заменяет ни robots.txt, ни sitemap — это ориентир, а не директива. Как его составить — в руководстве по llms.txt.
«Прежде чем нейросеть вас порекомендует, её краулер должен вас прочитать. Половина проблем AI-видимости, которые я разбираю, — это не контент, а доступность: JS-рендеринг, robots.txt, анти-бот защита»
Почему страницы выпадают из индекса: симптом → причина
| Симптом | Вероятная причина | Где подтвердить |
|---|---|---|
| Выпал целый раздел | Disallow в robots.txt, noindex в шаблоне раздела, «малоценные» дубли | Вебмастер: причина исключения |
| Страницы «Обнаружены, не просканированы» неделями | слабая перелинковка, исчерпан краулинговый бюджет, медленный сервер | GSC, логи |
| «Просканировано, не проиндексировано» | тонкий контент, дубль без canonical | контент-аудит раздела |
| Страница пропадает и возвращается | нестабильные 5xx, таймауты хостинга | «Проверка ответа сервера» в Вебмастере |
| Новые страницы не находятся месяц | страница-сирота: нет внутренних ссылок, нет в sitemap | краулер (Screaming Frog), отчёт по ссылкам |
| В Яндексе есть, в Google нет (или наоборот) | разные правила для ботов в robots.txt, санкции одной системы | сравнение отчётов панелей |
Правило диагностики: сначала техника (robots, noindex, ответ сервера), потом контент. Переписывать тексты при закрытом robots.txt — самая дорогая из бесполезных работ.
Как ускорить индексацию: что работает и где не работает
Ориентиры по срокам: по исследованию IndexCheckr на 16 млн страниц средний срок индексации в Google — 27,4 дня, за первую неделю индексируется только 14% страниц. Молодой сайт ждёт первую индексацию в среднем ~18 дней, трастовый — ~3 дня. В Яндексе переобход отрабатывает до 14 дней. Планируйте запуски контента с этим лагом.
| Способ | Работает | Ограничение |
|---|---|---|
| sitemap.xml + загрузка в панели | Да, база | не спасает страницу-сироту; карта с 404 подрывает доверие робота |
| Переобход в Вебмастере | Да, для точечных страниц | дневной лимит; до 14 дней |
| Запрос индексирования в GSC | Да, точечно | лимит запросов; не гарантия включения |
| IndexNow | Да — Яндекс, Bing | Google не поддерживает |
| Обход по счётчикам Метрики | Да, для Яндекса | требует привязки Метрики к Вебмастеру |
| Внутренние ссылки с трастовых страниц | Да, системно | нужна реальная структура, а не «ссылки ради ссылок» |
| Внешняя ссылка с посещаемого ресурса | Да, особенно для новых сайтов | разовые «прогоны» по каталогам не работают |
| Обновление даты без изменения контента | Нет | робот сверяет содержимое, не дату |
Ошибки управления индексацией в 2026
- Блокировать GPTBot по чужому сценарию. Доля топ-1000 сайтов, закрытых для GPTBot, выросла с 5% в 2023 до 25% к 2026 — но это в основном медиа, чья сделка «остаться в Google, не отдать контент в обучение» осмысленна: они продают сам контент. Если вы продаёте товары или услуги, у вас обратная задача — чтобы нейросети о вас знали и вас рекомендовали. Копировать robots.txt издателей — отключить себе канал.
- Следовать старым статьям. Директива Host отменена Яндексом ещё в 2018, Crawl-delay игнорируется с 2019 (скорость задаётся в Вебмастере), тег
<noindex>— архаика. Эти советы до сих пор в топе выдачи. - Верить, что Disallow удаляет страницу из выдачи. Закрытая в robots.txt страница может остаться в выдаче со сниппетом «Владелец предпочёл скрыть содержимое». Для удаления нужен noindex (при открытом доступе робота) или инструмент удаления в панелях.
- Проверять только оператором site: и только главную. Обе цифры обманчивы: оператор даёт оценку, главная индексируется почти всегда. Реальная картина — в отчётах панелей по разделам.
- Не замечать анти-бот защиту CDN. Правило «challenge всем незнакомым ботам» в CDN-сервисах молча режет GPTBot и PerplexityBot даже при разрешающем robots.txt. Проверяется только по логам (шаг 9 чек-листа).
FAQ
Сайт есть в Google, но ChatGPT о нём не знает. Почему?
Три типовые причины в порядке частоты: контент рендерится JavaScript (AI-краулеры его не исполняют), GPTBot заблокирован в robots.txt или файрволом, домен молодой и ещё не попал в обучающие данные модели. Диагностика — шаги 5, 8, 9 чек-листа.
Блокировка GPTBot повлияет на позиции в Google или Яндексе?
Нет. GPTBot не связан с поисковыми индексами. Но вы исчезнете из знаний моделей OpenAI, а если заблокировали заодно OAI-SearchBot и ChatGPT-User — и из ответов ChatGPT с поиском.
Алиса индексирует сайт отдельно от Яндекса?
Нет. Алиса строит ответы поверх поискового индекса Яндекса. Отдельного «краулера Алисы» не существует: если страница выпала из индекса Яндекса, она недоступна и Алисе. Поэтому классическая техоптимизация под Яндекс — обязательное условие видимости в Алисе.
Достаточно ли llms.txt, чтобы нейросети «увидели» сайт?
Нет. llms.txt — ориентир, а не механизм индексации. Если контент закрыт для AI-ботов или спрятан за JavaScript, файл не поможет. Порядок приоритетов: доступность краулеров → серверный рендеринг → разметка → llms.txt.
Сколько страниц можно отправить на переобход вручную?
У Яндекса — индивидуальный дневной лимит (виден в Вебмастере, зависит от сайта), у Google URL Inspection — порядка десятка запросов в сутки. Поэтому ручная отправка — инструмент для приоритетных и исправленных страниц; системно индексацию решают sitemap, перелинковка и стабильный сервер.
Автор: Павел Ким, технический GEO-инженер. Рецензент: Алексей Малков, основатель GEOAudit.org, 150+ аудитов.
Заказать GEO-аудит или связаться с нами можно через форму на сайте, по email info@geoaudit.org или в Telegram @geoaudit — отвечаем в течение двух часов в рабочие дни.