robots.txt и AI-краулеры: GPTBot, Google-Extended и другие
AI-краулеры — это новое поколение ботов, которые сканируют сайты для обучения и обновления нейросетей. GPTBot от OpenAI, Google-Extended, Amazonbot, CCBot — каждый из них влияет на видимость вашего бренда в AI-ответах. Настройка robots.txt определяет, какие AI-системы смогут использовать ваш контент.
1. Полный список AI-краулеров 2026: User-Agent, назначение и компании
В 2026 году более десятка AI-компаний отправляют своих ботов сканировать интернет. Каждый бот имеет свой User-Agent, и через robots.txt вы можете управлять доступом каждого из них независимо.
| Краулер | Компания | Для чего | User-Agent |
|---|---|---|---|
| GPTBot | OpenAI | Обучение и Browse ChatGPT | GPTBot |
| ChatGPT-User | OpenAI | Плагины и Browse в реальном времени | ChatGPT-User |
| Google-Extended | Обучение Gemini/Bard | Google-Extended | |
| Amazonbot | Amazon | Alexa и AI-сервисы | Amazonbot |
| CCBot | Common Crawl | Открытый датасет для LLM | CCBot |
| anthropic-ai | Anthropic | Обучение Claude | anthropic-ai |
| PerplexityBot | Perplexity | Поиск и ответы | PerplexityBot |
| Bytespider | ByteDance | TikTok AI-сервисы | Bytespider |
2. Стратегия: кого пускать
Блокировка всех AI-краулеров — стратегическая ошибка для бизнеса, который хочет быть видимым в нейросетях. Если GPTBot не может сканировать ваш сайт, ChatGPT не сможет рекомендовать ваш бренд в ответах с Browse.
Рекомендуемый подход — селективный доступ: разрешаете ботам тех AI-платформ, где вы хотите быть видимыми, и блокируете остальных. Для большинства российских компаний оптимальная конфигурация:
- Разрешить: GPTBot, ChatGPT-User, Google-Extended, PerplexityBot, anthropic-ai
- По желанию: Amazonbot (если работаете с западным рынком)
- Блокировать: CCBot (если не хотите попадать в открытые датасеты), Bytespider
3. Шаблоны конфигурации robots.txt для AI-видимости сайта
Базовая конфигурация для максимальной AI-видимости с защитой приватных разделов:
# AI-краулеры — разрешить
User-agent: GPTBot
Allow: /
Disallow: /admin/
Disallow: /personal/
User-agent: ChatGPT-User
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: anthropic-ai
Allow: /
# Блокировать нежелательных
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
4. Баланс доступа и защиты контента
Некоторые владельцы сайтов опасаются, что AI-краулеры «украдут» контент. Этот страх обоснован частично: да, ваш контент используется для обучения моделей. Но блокировка приводит к невидимости бренда в AI-ответах — а это прямые потери клиентов.
Компромиссный подход: открывайте для AI-краулеров публичные маркетинговые страницы (услуги, блог, кейсы) и закрывайте внутренние разделы (личный кабинет, API-документация, платный контент).
5. robots.txt + llms.txt: комплексная техническая GEO-оптимизация
robots.txt управляет доступом ботов, а llms.txt — описывает сайт для AI на человеко-машиночитаемом языке. Эти два файла дополняют друг друга и должны настраиваться в связке.
В llms.txt вы указываете ключевые страницы, услуги, экспертов — это помогает AI-краулерам эффективнее сканировать сайт и правильно интерпретировать контент. Подробное руководство по llms.txt — в отдельной статье.
6. Директивы для разных AI-ботов: нюансы, которые часто путают
Не все AI-краулеры устроены одинаково, и это важно для правильной настройки robots.txt.
- GPTBot vs ChatGPT-User. GPTBot собирает данные для обучения будущих версий модели — сканирует сайт периодически и большими партиями. ChatGPT-User активируется в реальном времени, когда пользователь просит ChatGPT открыть конкретную страницу (функция Browse). Заблокировав только GPTBot, вы не остановите ChatGPT-User — сайт по-прежнему можно будет процитировать «вживую», но он не попадёт в обучающую выборку следующей версии модели.
- Google-Extended не блокирует Googlebot. Это частая путаница:
Disallowдля User-agentGoogle-Extendedне влияет на индексацию в классическом поиске Google — она управляется отдельно через User-agentGooglebot. Google-Extended отвечает только за использование контента для обучения Gemini и AI Overviews. - ClaudeBot и anthropic-ai — разные боты.
anthropic-ai— устаревший User-agent, использовавшийся для сбора обучающих данных.ClaudeBot— более новый краулер, который в том числе выполняет запросы в реальном времени, когда Claude пользуется инструментом веб-поиска. Для максимальной AI-видимости имеет смысл разрешать оба. - PerplexityBot работает как гибрид. В отличие от GPTBot, который только обучает модель с фиксированной точкой отсечения знаний, PerplexityBot индексирует страницы и использует их для формирования живых ответов со ссылками на источник — похоже на поисковый краулер, а не только на «сборщик датасета».
- YandexBot — это не AI-краулер, а классический поисковый робот Яндекса. У ЯндексGPT и Алисы пока нет отдельного публичного AI-User-Agent: ответы Алисы формируются в первую очередь из данных Яндекс Карт, Яндекс Бизнеса и обычного поискового индекса (см. «Как попасть в ответы Алисы»). Блокировка YandexBot — это решение из области SEO, но она косвенно обедняет и данные, доступные Алисе. Не путайте эту задачу с GEO-настройкой под GPTBot и Google-Extended — это разные механики.
- Crawl-delay поддерживается не всеми. Директива
Crawl-delay(не входит в официальный стандарт robots.txt, но распознаётся частью краулеров) позволяет ограничить частоту запросов бота без полной блокировки — полезно для крупных сайтов, если AI-краулеры создают заметную нагрузку на сервер.
7. Три готовых сценария robots.txt: от максимальной видимости до полной блокировки
Помимо базовой конфигурации из раздела 3 (максимальная видимость с закрытыми служебными разделами), есть два альтернативных сценария — в зависимости от того, чего хочет бизнес.
Сценарий Б: разрешить live-ответы, запретить обучение моделей. Подходит, если вы хотите, чтобы ChatGPT и Claude могли процитировать сайт «по запросу», но не хотите, чтобы контент попадал в обучающие датасеты будущих версий моделей:
# Разрешить real-time доступ
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Запретить использование для обучения моделей
User-agent: GPTBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
Сценарий В: полная блокировка всех AI-краулеров. Технически возможен, но для B2B-бизнеса, который хочет попадать в рекомендации ChatGPT, Алисы и Perplexity, — это стратегическая ошибка: сайт постепенно перестанет упоминаться в AI-ответах, а его место займут конкуренты, которые остались открытыми:
User-agent: GPTBot
Disallow: /
User-agent: ChatGPT-User
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Bytespider
Disallow: /
Приводим этот сценарий не как рекомендацию, а как точку сравнения: именно так выглядит robots.txt большинства сайтов, которые «не видны» нейросетям при GEO-аудите.
8. Частые ошибки при настройке robots.txt для AI-краулеров
По опыту 150+ аудитов, при настройке robots.txt под AI-краулеры компании регулярно повторяют одни и те же ошибки:
- Путают Google-Extended с Googlebot. Блокируют Google-Extended в надежде «не потерять» контент из обычного поиска Google — хотя это разные User-agent с разными задачами (см. раздел 6).
- Ставят
Disallow: /для всех ботов «на всякий случай». Часто это наследие настроек трёх-пятилетней давности, когда AI-краулеров ещё не существовало, аUser-agent: *с полным запретом ставили для защиты от парсеров и агрегаторов. Такая настройка сегодня автоматически блокирует и GPTBot, и PerplexityBot, и ClaudeBot. - Не проверяют файл после деплоя. Пропущенная пустая строка между блоками User-agent, опечатка в названии бота (например,
GPTbotвместоGPTBot— User-agent чувствителен к регистру) — и вся настройка не работает, хотя выглядит корректно на первый взгляд. - Настраивают robots.txt в отрыве от llms.txt. Разрешают доступ AI-ботам, но не создают llms.txt — в итоге краулер технически может сканировать сайт, но не получает структурированного описания компании, услуг и экспертизы.
- Не мониторят логи после настройки. Внесли изменения — и забыли. Без проверки логов сервера невозможно узнать, действительно ли боты приходят и как часто.
Мониторинг AI-краулеров в логах сервера
Настройка robots.txt — это только половина задачи. Чтобы убедиться, что GPTBot, ChatGPT-User, Google-Extended и PerplexityBot действительно посещают сайт, анализируйте access-логи сервера по полю User-Agent — через grep, панель хостинга или инструменты вроде GoAccess. Обращайте внимание на частоту визитов, какие именно страницы сканируются и не появляются ли всплески нагрузки от одного бота. Для большинства B2B-сайтов достаточно проверять логи раз в квартал — этого хватает, чтобы вовремя заметить, что бот перестал заходить (например, после случайной блокировки при обновлении сайта) или, наоборот, резко увеличил частоту сканирования.
Итог: robots.txt — фундамент, а не деталь GEO-настройки
robots.txt — самый простой и при этом самый недооценённый файл в GEO-оптимизации. Неправильная строка в нём способна полностью закрыть сайт от GPTBot, PerplexityBot или ClaudeBot — и тогда даже отличный контент, продуманная Schema.org-разметка и грамотный llms.txt не помогут: нейросети попросту не смогут добраться до страниц. Проверка robots.txt — один из первых шагов, которые мы делаем в рамках технического GEO-аудита: смотрим, каким ботам открыт доступ, сверяем это с llms.txt и Schema.org, и даём конкретные правки конфигурации.
Если не уверены, что ваш robots.txt настроен верно — начните с бесплатной GEO-диагностики: за 0 ₽ покажем, какие AI-краулеры сейчас заблокированы на вашем сайте и что это стоит вам в упущенных упоминаниях. Для более глубокой проверки — технический GEO-аудит (40 000 ₽): полный разбор robots.txt, llms.txt, Schema.org и скорости сайта для AI-краулеров.
FAQ: robots.txt и AI-краулеры
Какие AI-краулеры существуют в 2026 году?
Основные AI-краулеры: GPTBot и ChatGPT-User (OpenAI), Google-Extended (Google/Gemini), PerplexityBot (Perplexity), anthropic-ai (Anthropic/Claude), Amazonbot (Amazon/Alexa), CCBot (Common Crawl), Bytespider (ByteDance/TikTok).
Стоит ли блокировать GPTBot в robots.txt?
Для бизнеса, который хочет быть видимым в AI — нет. Блокировка GPTBot означает, что ChatGPT не сможет получать актуальную информацию с вашего сайта в режиме Browse, и бренд постепенно исчезнет из AI-ответов.
Что такое Google-Extended и зачем он нужен?
Google-Extended — User-Agent для обучения Gemini/Bard. Разрешая доступ Google-Extended, вы позволяете Google использовать ваш контент для AI-модели Gemini, что повышает шансы на цитирование в Google AI Overviews.
Как настроить robots.txt для разных AI-ботов?
Используйте отдельные блоки User-agent для каждого бота. Рекомендуется разрешить GPTBot, ChatGPT-User, Google-Extended, PerplexityBot, anthropic-ai. Блокировать CCBot и Bytespider, если не хотите попадать в открытые датасеты.
Как мониторить AI-краулеры в логах сервера?
Анализируйте access-логи сервера по User-Agent. Ищите GPTBot, ChatGPT-User, Google-Extended, PerplexityBot. Это покажет, какие AI-боты сканируют ваш сайт, как часто и какие страницы. Рекомендуем проверять раз в квартал.
Заказать GEO-аудит или связаться с нами можно через форму на сайте, по email info@geoaudit.org или в Telegram @geoaudit — отвечаем в течение двух часов в рабочие дни.