Техническое GEO 22 марта 2026 ~15 мин чтения

robots.txt и AI-краулеры: GPTBot, Google-Extended и другие

AI-краулеры — это новое поколение ботов, которые сканируют сайты для обучения и обновления нейросетей. GPTBot от OpenAI, Google-Extended, Amazonbot, CCBot — каждый из них влияет на видимость вашего бренда в AI-ответах. Настройка robots.txt определяет, какие AI-системы смогут использовать ваш контент.

Алексей Малков
Алексей Малков
Основатель GEOAudit.org • GEO/SEO-стратег
150+ аудитов • 12 лет в digital • 100+ отзывов на фрилансе
Профиль автора →

1. Полный список AI-краулеров 2026: User-Agent, назначение и компании

В 2026 году более десятка AI-компаний отправляют своих ботов сканировать интернет. Каждый бот имеет свой User-Agent, и через robots.txt вы можете управлять доступом каждого из них независимо.

КраулерКомпанияДля чегоUser-Agent
GPTBotOpenAIОбучение и Browse ChatGPTGPTBot
ChatGPT-UserOpenAIПлагины и Browse в реальном времениChatGPT-User
Google-ExtendedGoogleОбучение Gemini/BardGoogle-Extended
AmazonbotAmazonAlexa и AI-сервисыAmazonbot
CCBotCommon CrawlОткрытый датасет для LLMCCBot
anthropic-aiAnthropicОбучение Claudeanthropic-ai
PerplexityBotPerplexityПоиск и ответыPerplexityBot
BytespiderByteDanceTikTok AI-сервисыBytespider

2. Стратегия: кого пускать

Блокировка всех AI-краулеров — стратегическая ошибка для бизнеса, который хочет быть видимым в нейросетях. Если GPTBot не может сканировать ваш сайт, ChatGPT не сможет рекомендовать ваш бренд в ответах с Browse.

Рекомендуемый подход — селективный доступ: разрешаете ботам тех AI-платформ, где вы хотите быть видимыми, и блокируете остальных. Для большинства российских компаний оптимальная конфигурация:

  • Разрешить: GPTBot, ChatGPT-User, Google-Extended, PerplexityBot, anthropic-ai
  • По желанию: Amazonbot (если работаете с западным рынком)
  • Блокировать: CCBot (если не хотите попадать в открытые датасеты), Bytespider

3. Шаблоны конфигурации robots.txt для AI-видимости сайта

Базовая конфигурация для максимальной AI-видимости с защитой приватных разделов:

# AI-краулеры — разрешить
User-agent: GPTBot
Allow: /
Disallow: /admin/
Disallow: /personal/

User-agent: ChatGPT-User
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: anthropic-ai
Allow: /

# Блокировать нежелательных
User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

Проверим настройку AI-доступа вашего сайта

Технический GEO-аудит: robots.txt, llms.txt, Schema.org, скорость для AI

Бесплатная GEO-диагностика

4. Баланс доступа и защиты контента

Некоторые владельцы сайтов опасаются, что AI-краулеры «украдут» контент. Этот страх обоснован частично: да, ваш контент используется для обучения моделей. Но блокировка приводит к невидимости бренда в AI-ответах — а это прямые потери клиентов.

Компромиссный подход: открывайте для AI-краулеров публичные маркетинговые страницы (услуги, блог, кейсы) и закрывайте внутренние разделы (личный кабинет, API-документация, платный контент).

5. robots.txt + llms.txt: комплексная техническая GEO-оптимизация

robots.txt управляет доступом ботов, а llms.txt — описывает сайт для AI на человеко-машиночитаемом языке. Эти два файла дополняют друг друга и должны настраиваться в связке.

В llms.txt вы указываете ключевые страницы, услуги, экспертов — это помогает AI-краулерам эффективнее сканировать сайт и правильно интерпретировать контент. Подробное руководство по llms.txt — в отдельной статье.

6. Директивы для разных AI-ботов: нюансы, которые часто путают

Не все AI-краулеры устроены одинаково, и это важно для правильной настройки robots.txt.

  • GPTBot vs ChatGPT-User. GPTBot собирает данные для обучения будущих версий модели — сканирует сайт периодически и большими партиями. ChatGPT-User активируется в реальном времени, когда пользователь просит ChatGPT открыть конкретную страницу (функция Browse). Заблокировав только GPTBot, вы не остановите ChatGPT-User — сайт по-прежнему можно будет процитировать «вживую», но он не попадёт в обучающую выборку следующей версии модели.
  • Google-Extended не блокирует Googlebot. Это частая путаница: Disallow для User-agent Google-Extended не влияет на индексацию в классическом поиске Google — она управляется отдельно через User-agent Googlebot. Google-Extended отвечает только за использование контента для обучения Gemini и AI Overviews.
  • ClaudeBot и anthropic-ai — разные боты. anthropic-ai — устаревший User-agent, использовавшийся для сбора обучающих данных. ClaudeBot — более новый краулер, который в том числе выполняет запросы в реальном времени, когда Claude пользуется инструментом веб-поиска. Для максимальной AI-видимости имеет смысл разрешать оба.
  • PerplexityBot работает как гибрид. В отличие от GPTBot, который только обучает модель с фиксированной точкой отсечения знаний, PerplexityBot индексирует страницы и использует их для формирования живых ответов со ссылками на источник — похоже на поисковый краулер, а не только на «сборщик датасета».
  • YandexBot — это не AI-краулер, а классический поисковый робот Яндекса. У ЯндексGPT и Алисы пока нет отдельного публичного AI-User-Agent: ответы Алисы формируются в первую очередь из данных Яндекс Карт, Яндекс Бизнеса и обычного поискового индекса (см. «Как попасть в ответы Алисы»). Блокировка YandexBot — это решение из области SEO, но она косвенно обедняет и данные, доступные Алисе. Не путайте эту задачу с GEO-настройкой под GPTBot и Google-Extended — это разные механики.
  • Crawl-delay поддерживается не всеми. Директива Crawl-delay (не входит в официальный стандарт robots.txt, но распознаётся частью краулеров) позволяет ограничить частоту запросов бота без полной блокировки — полезно для крупных сайтов, если AI-краулеры создают заметную нагрузку на сервер.

7. Три готовых сценария robots.txt: от максимальной видимости до полной блокировки

Помимо базовой конфигурации из раздела 3 (максимальная видимость с закрытыми служебными разделами), есть два альтернативных сценария — в зависимости от того, чего хочет бизнес.

Сценарий Б: разрешить live-ответы, запретить обучение моделей. Подходит, если вы хотите, чтобы ChatGPT и Claude могли процитировать сайт «по запросу», но не хотите, чтобы контент попадал в обучающие датасеты будущих версий моделей:

# Разрешить real-time доступ
User-agent: ChatGPT-User
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

# Запретить использование для обучения моделей
User-agent: GPTBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

Сценарий В: полная блокировка всех AI-краулеров. Технически возможен, но для B2B-бизнеса, который хочет попадать в рекомендации ChatGPT, Алисы и Perplexity, — это стратегическая ошибка: сайт постепенно перестанет упоминаться в AI-ответах, а его место займут конкуренты, которые остались открытыми:

User-agent: GPTBot
Disallow: /

User-agent: ChatGPT-User
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Amazonbot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Bytespider
Disallow: /

Приводим этот сценарий не как рекомендацию, а как точку сравнения: именно так выглядит robots.txt большинства сайтов, которые «не видны» нейросетям при GEO-аудите.

8. Частые ошибки при настройке robots.txt для AI-краулеров

По опыту 150+ аудитов, при настройке robots.txt под AI-краулеры компании регулярно повторяют одни и те же ошибки:

  1. Путают Google-Extended с Googlebot. Блокируют Google-Extended в надежде «не потерять» контент из обычного поиска Google — хотя это разные User-agent с разными задачами (см. раздел 6).
  2. Ставят Disallow: / для всех ботов «на всякий случай». Часто это наследие настроек трёх-пятилетней давности, когда AI-краулеров ещё не существовало, а User-agent: * с полным запретом ставили для защиты от парсеров и агрегаторов. Такая настройка сегодня автоматически блокирует и GPTBot, и PerplexityBot, и ClaudeBot.
  3. Не проверяют файл после деплоя. Пропущенная пустая строка между блоками User-agent, опечатка в названии бота (например, GPTbot вместо GPTBot — User-agent чувствителен к регистру) — и вся настройка не работает, хотя выглядит корректно на первый взгляд.
  4. Настраивают robots.txt в отрыве от llms.txt. Разрешают доступ AI-ботам, но не создают llms.txt — в итоге краулер технически может сканировать сайт, но не получает структурированного описания компании, услуг и экспертизы.
  5. Не мониторят логи после настройки. Внесли изменения — и забыли. Без проверки логов сервера невозможно узнать, действительно ли боты приходят и как часто.

Мониторинг AI-краулеров в логах сервера

Настройка robots.txt — это только половина задачи. Чтобы убедиться, что GPTBot, ChatGPT-User, Google-Extended и PerplexityBot действительно посещают сайт, анализируйте access-логи сервера по полю User-Agent — через grep, панель хостинга или инструменты вроде GoAccess. Обращайте внимание на частоту визитов, какие именно страницы сканируются и не появляются ли всплески нагрузки от одного бота. Для большинства B2B-сайтов достаточно проверять логи раз в квартал — этого хватает, чтобы вовремя заметить, что бот перестал заходить (например, после случайной блокировки при обновлении сайта) или, наоборот, резко увеличил частоту сканирования.

Итог: robots.txt — фундамент, а не деталь GEO-настройки

robots.txt — самый простой и при этом самый недооценённый файл в GEO-оптимизации. Неправильная строка в нём способна полностью закрыть сайт от GPTBot, PerplexityBot или ClaudeBot — и тогда даже отличный контент, продуманная Schema.org-разметка и грамотный llms.txt не помогут: нейросети попросту не смогут добраться до страниц. Проверка robots.txt — один из первых шагов, которые мы делаем в рамках технического GEO-аудита: смотрим, каким ботам открыт доступ, сверяем это с llms.txt и Schema.org, и даём конкретные правки конфигурации.

Если не уверены, что ваш robots.txt настроен верно — начните с бесплатной GEO-диагностики: за 0 ₽ покажем, какие AI-краулеры сейчас заблокированы на вашем сайте и что это стоит вам в упущенных упоминаниях. Для более глубокой проверки — технический GEO-аудит (40 000 ₽): полный разбор robots.txt, llms.txt, Schema.org и скорости сайта для AI-краулеров.

FAQ: robots.txt и AI-краулеры

Какие AI-краулеры существуют в 2026 году?

Основные AI-краулеры: GPTBot и ChatGPT-User (OpenAI), Google-Extended (Google/Gemini), PerplexityBot (Perplexity), anthropic-ai (Anthropic/Claude), Amazonbot (Amazon/Alexa), CCBot (Common Crawl), Bytespider (ByteDance/TikTok).

Стоит ли блокировать GPTBot в robots.txt?

Для бизнеса, который хочет быть видимым в AI — нет. Блокировка GPTBot означает, что ChatGPT не сможет получать актуальную информацию с вашего сайта в режиме Browse, и бренд постепенно исчезнет из AI-ответов.

Что такое Google-Extended и зачем он нужен?

Google-Extended — User-Agent для обучения Gemini/Bard. Разрешая доступ Google-Extended, вы позволяете Google использовать ваш контент для AI-модели Gemini, что повышает шансы на цитирование в Google AI Overviews.

Как настроить robots.txt для разных AI-ботов?

Используйте отдельные блоки User-agent для каждого бота. Рекомендуется разрешить GPTBot, ChatGPT-User, Google-Extended, PerplexityBot, anthropic-ai. Блокировать CCBot и Bytespider, если не хотите попадать в открытые датасеты.

Как мониторить AI-краулеры в логах сервера?

Анализируйте access-логи сервера по User-Agent. Ищите GPTBot, ChatGPT-User, Google-Extended, PerplexityBot. Это покажет, какие AI-боты сканируют ваш сайт, как часто и какие страницы. Рекомендуем проверять раз в квартал.

Заказать GEO-аудит или связаться с нами можно через форму на сайте, по email info@geoaudit.org или в Telegram @geoaudit — отвечаем в течение двух часов в рабочие дни.