Какой ИИ читает сайты и что он там видит
Читать сайты умеют почти все крупные нейросети, но делают это четырьмя разными способами: через поисковый индекс, через собственный краулер, заходом по ссылке в момент запроса и просто по памяти обучения. От того, какой способ сработал, зависит, что модель увидит: свежий текст, версию годичной давности или один заголовок из выдачи. Запрос «нейросеть анализ сайта» обычно означает второе и третье — человек хочет, чтобы модель открыла адрес и разобрала страницу. Ниже — какой ИИ анализирует сайты каким способом, что попадает в текст, который доходит до модели, и что не попадает никогда: картинки, вкладки по клику, видео без расшифровки.
У нейросети четыре разных способа добраться до сайта
За фразой «ИИ прочитал сайт» прячутся четыре разных механизма, и от того, какой сработал, зависит буквально всё: увидит модель вчерашние правки или версию годичной давности, дойдёт ли до текста вообще или ограничится заголовком из выдачи. Разница между этими механизмами больше, чем разница между самими моделями.
| Способ доступа | Что его запускает | Кто приходит на сайт | Что получает модель | Где обрывается |
|---|---|---|---|---|
| Ответ поверх поискового индекса (Алиса и Нейро у Яндекса, AI Overviews у Google) | Запрос пользователя в поиске | Обычный поисковый робот, заранее | Фрагменты страниц, уже лежащие в индексе | Страницы нет в индексе — нет и в ответе |
| Собственный краулер платформы | Плановый обход впрок, без привязки к запросу | Бот платформы: GPTBot, ClaudeBot, PerplexityBot и другие, чьи имена операторы публикуют в документации | Текст страницы на момент обхода | Бот закрыт в robots.txt или получил ошибку |
| Заход по ссылке в момент запроса | Пользователь дал адрес или чат сам решил сходить в веб | Отдельный бот платформы: ChatGPT-User, Claude-User, Perplexity-User | То, что сервер отдал здесь и сейчас | Авторизация, капча, защита от ботов, тяжёлые скрипты |
| Память модели | Ничего: модель отвечает из обучающих данных | Никто, обращения к сайту нет | Слепок веба на дату отсечки обучения | Всё, что вы поменяли после этой даты |
Имена ботов операторы нейросетей публикуют открыто, и термины оттуда удобно держать рядом с русскими: web crawler — это бот планового обхода, он забирает website целиком и заранее; user-agent с суффиксом User приходит на один конкретный адрес и только тогда, когда его об этом попросили.
Первые три способа — это чтение, четвёртый — воспоминание. Модель, отвечающая по памяти, никуда не заходила: она пересказывает то, что попало в обучающие данные, и свежих правок там нет по определению. Отсюда знакомая сцена: компания переписала описания услуг полгода назад, а нейросеть уверенно называет старые. Как ответ собирается по шагам, разобрано в материале о том, как работают нейроответы, а что при этом происходит с обходом и индексацией сайта — в отдельной статье.
Вывод из таблицы прикладной: чтобы искусственный интеллект прочитал сайт, к нему должен быть открыт хотя бы один канал. Закрыли краулеры — остались индекс и память. Сайта нет в индексе и краулеры закрыты — не осталось ничего, и никакой промпт этого не починит.
Модель получает не страницу, а её текстовый слепок
Ни одна нейросеть не смотрит на сайт так, как смотрит человек. Под капотом это нейронная сеть, натренированная предсказывать текст по тексту, и никакого зрения у неё нет. Между вашей страницей и моделью стоит извлечение текста: HTML разбирают, теги выкидывают, оставляют содержимое — заголовки, абзацы, пункты списков, ячейки таблиц, подписи alt, тексты ссылок. Получившийся набор строк мы в аудитах называем слепком страницы. Это и есть то, что реально доходит до модели, и именно его стоит держать в голове, когда вы просите её проанализировать адрес.
У слепка три свойства, о которых редко думают. Первое: порядок в нём такой, как в коде, а не как на экране — блок с ценами, визуально поднятый наверх стилями, но лежащий в разметке внизу, модель прочитает последним. Второе: оформление не участвует. Жирный шрифт, цвет, размер, положение в сетке исчезают, и важность передаётся только словами и уровнем заголовка. Третье: всё, что не текст, из слепка выпадает.
| Что на странице | Попадает в слепок | Что с этим делать |
|---|---|---|
| Заголовки, абзацы, списки в HTML | Да, полностью | Основной носитель смысла, всё главное держать здесь |
| Таблица в HTML | Да, но структура упрощается до строк | Ключевой вывод дублировать обычным предложением под таблицей |
| Свёрнутый блок: аккордеон, details, скрытый стилями текст | Да, если текст есть в коде страницы | Сворачивать FAQ не страшно, содержимое читается |
| Вкладка или блок, который подгружается после клика | Нет | Отдавать текст сразу при загрузке страницы |
| Текст внутри картинки или инфографики | Нет | Тот же смысл продублировать текстом рядом плюс осмысленный alt |
| Подпись alt у изображения | Да | Писать по делу, а не набором ключей |
| Разметка Schema.org в JSON-LD | Поисковые системы читают явно, AI-краулеры чаще берут только видимый текст | Держать синхронной с текстом, но не заменять ею текст |
| Видео и аудио без расшифровки | Нет | Класть текстовую расшифровку на ту же страницу |
| Контент за формой, авторизацией или капчей | Нет | Публичную часть выносить в открытый доступ |
| Меню, футер, сквозные баннеры | Да, и разбавляют смысл | Не ломать, но не рассчитывать, что они что-то объясняют |
Строка про свёрнутые блоки — та, из-за которой спорят чаще всего. Если текст ответа лежит в HTML и просто скрыт стилями, он в слепке есть. Если же по клику уходит запрос на сервер и текст приезжает только после него, в слепке останется пустая вкладка. Что ещё модель делает с этим текстом сама, а что придётся считать руками, разобрано в материале нейросеть для анализа сайта.
Быстрая проверка своими руками
Откройте страницу и сохраните её как обычный текст либо посмотрите исходный код и мысленно вычеркните всё, что не буквы. Оставшееся — и есть слепок. Если в нём не находится ответ на вопрос, ради которого страница написана, ни одна нейросеть его там тоже не найдёт.
Ни один способ доступа не показывает текст внутри картинки
Здесь важно разделить два сюжета. Если вы сами загрузите скриншот в чат, мультимодальная модель текст с картинки прочитает — это её штатная работа. Но краулер, который обходит сайты впрок, изображения не распознаёт: в слепок попадает только имя файла и alt. Поэтому схема процесса, прайс картинкой и цитата клиента, набранная поверх фотографии, для нейросети не существуют.
- Инфографика и схемы. Красиво человеку, пусто модели. Рядом нужен абзац, пересказывающий тот же смысл словами.
- Цены и характеристики в PDF или картинке. Самая частая потеря на сайтах производителей: весь конкретный материал лежит в файле, а на странице остаются общие слова.
- Вкладки и калькуляторы, которые оживают по клику. Содержимое приезжает скриптом, робот его не дожидается.
- Видео и вебинары. Экспертиза есть, текста нет. Расшифровка решает вопрос за один вечер.
- Отзывы из внешнего виджета. Подгружаются с чужого домена и в слепок вашей страницы не попадают.
- Всё, что за формой. Прайс по заявке, доступ по регистрации, закрытая база знаний — для модели этих страниц нет.
Отдельная история — контент, который появляется только после выполнения скриптов. Поисковые роботы Яндекса и Google умеют обрабатывать JavaScript, и в индекс страница попадает уже собранной, хотя и не мгновенно. У AI-краулеров такой гарантии нет: операторы её не обещают, и в наших проверках именно этот слой ломается чаще остального. Что при этом происходит с текстом и как это чинить, подробно разобрано в статье про JavaScript и AI-краулеры.
Проверьте одно место прямо сейчас
Главная страница и страница ключевой услуги. Если убрать оттуда картинки и всё, что подгружается скриптами, останется ли текст, по которому понятно, чем вы занимаетесь, для кого и на каких условиях? В аудитах мы начинаем именно с этих двух страниц, и примерно на них же чаще всего обнаруживается, что смысл живёт в баннерах.
Страницу целиком не читает никто
Вопрос, которого почти нет в статьях конкурентов: сколько текста вообще доходит до модели. Ответ: не весь, и ограничений тут три. При извлечении длинные страницы обрезают. У модели есть предел объёма, который она может держать в работе за раз, и в этот предел кроме вашей страницы попадают ещё несколько источников. А из поискового индекса берётся не документ целиком, а подходящий под запрос фрагмент.
Практическое следствие одно и оно жёсткое: если ответ на вопрос стоит в конце длинной страницы, шансы, что его прочитают, ниже, чем у ответа из первых абзацев. Поэтому мы просим авторов ставить прямой ответ в начало раздела, а разбор и оговорки — после. Как устроен абзац, который нейросети вытаскивают в ответ охотнее всего, разобрано в материале про цитируемые фрагменты.
Как узнать, докуда модель дочитала
Дайте чату ссылку и попросите пересказать последний раздел страницы своими словами, назвав его заголовок. Если модель пересказывает начало или отвечает общими словами — до конца она не дошла, и всё, что там лежит, в её ответе не участвует. Приём работает и как проверка того, читала ли она страницу вообще.
Один и тот же сайт разные ИИ видят по-разному
Алиса и Нейро отвечают поверх индекса Яндекса: отдельного «нейробота», который ходил бы по вебу специально ради них, у Яндекса нет, а значит, всё упирается в обычную индексацию. ChatGPT сочетает собственный обход впрок с заходом по ссылке в момент разговора. Perplexity держит свой краулер и почти всегда показывает список источников, по которым собран ответ. Gemini опирается на инфраструктуру Google, у которой рендеринг страниц встроен в основной процесс. Grok сильнее прочих завязан на ленту X и свежие публикации.
Из этого следует вещь, которую в отчётах регулярно нарушают: вывод по одной платформе не переносится на остальные. Сайт может быть отлично прочитан Perplexity и при этом отсутствовать в ответах Алисы просто потому, что нужные страницы не в индексе Яндекса. Поэтому замер делается по нескольким системам сразу, а разница между ними — сама по себе диагноз: она показывает, на каком именно канале доступа рвётся связь.
За 150+ аудитов самая частая картина такая: страница выглядит наполненной, а в слепке остаются заголовок, пункты меню и подпись формы. Весь смысл лежит в баннерах, схемах и вкладках, которые подгружаются кликом. Владелец при этом уверен, что на сайте всё написано, и формально он прав — написано. Просто не в том слое, который читает нейросеть.
Как проверить, что ИИ доходит до вашего сайта
Шесть проверок, которые делаются за один вечер и не требуют платных сервисов. Порядок имеет значение: каждая следующая имеет смысл, только если предыдущая прошла.
- Логи сервера. Отфильтруйте обращения по именам ботов из документации операторов — GPTBot, ClaudeBot, PerplexityBot, ChatGPT-User и остальные. Это единственный способ узнать наверняка, приходил ли кто-то к вам по вебу и с каким ответом ушёл.
- Файл robots.txt. Посмотрите, не закрыт ли нужный бот и не стоит ли общий запрет, о котором давно забыли. Кого пускать, а кого нет, разбираем в материале про robots.txt и AI-краулеров.
- Коды ответа. Робот, получивший 403 или таймаут, вернётся нескоро. Блокировки по региону и агрессивная защита от ботов срезают доступ незаметно для владельца.
- Слепок страницы. Отключите в браузере скрипты и посмотрите, что осталось. То, что исчезло, для краулера тоже не существует.
- Файл llms.txt. Не обязателен и не заменяет доступности сайта, но помогает подсветить главные страницы. Что в нём писать, собрано в руководстве по llms.txt.
- Повторный замер. Ответы моделей нестабильны, вывод по одному прогону — это шум. Мы фиксируем дату каждого замера и сравниваем между собой, иначе динамику увидеть нечем.
Первые три пункта отвечают на вопрос «пускаем ли мы ИИ», четвёртый — «что он у нас находит», последние два — «меняется ли что-то со временем». Разводить их полезно: в аудитах мы регулярно видим сайты, где доступ открыт, а находить на страницах нечего, и обратную ситуацию, когда контент отличный, но робот получает ошибку и уходит.
Когда просить нейросеть прочитать сайт бессмысленно
Пять ситуаций, в которых чтение страницы моделью не даст ничего полезного. Знать их лучше заранее, чем после оплаченного отчёта.
- Вам нужны цифры. Трафик, позиции, частотность, доля рынка — этого модель не знает и достроит по правдоподобию. Числа берутся из счётчика, панелей вебмастера и сервисов съёма позиций, а модель годится максимум для их интерпретации.
- Сайт закрыт целиком. Внутренний портал, личный кабинет, платный доступ. Читать нечего, и задача превращается в другую: работать через внешние площадки и упоминания.
- Сайта нет в индексе. Новый домен без истории обхода — нейросетям попросту нечего процитировать. Сначала базовая индексация, потом работа над попаданием в ответы.
- Медицина, право, финансы без вычитки. Модель ошибается в фактах ровным уверенным тоном, а отвечать перед пациентом или клиентом будете вы. Профильный специалист читает такие тексты обязательно.
- Вы ждёте от чтения страницы ответа про AI-видимость. Разбор вашей страницы и то, называют ли вас в нейросетях в ответ на запросы клиентов, — два разных замера. Второй делается прогоном запросов по платформам, а не вопросом «оцени мой сайт».
И про порядок работ. GEO не заменяет SEO и не идёт вместо него: попадание бренда в ответ нейросети надстраивается над позициями в обычной выдаче, потому что ответ чаще всего собирается из страниц, которые и так стоят наверху. Если сайт не виден в Яндексе и Google по своему кластеру, начинать с GEO рано.
Что чинить в первую очередь
Порядок действий, который мы ставим в план работ, когда выясняется, что слепок страницы пуст или неполон.
- Вернуть смысл в текст. Всё, что сейчас живёт в картинках, схемах и PDF, продублировать словами на странице. Это самая дешёвая правка с самым заметным эффектом.
- Отдавать содержимое сразу. Вкладки, аккордеоны и списки характеристик должны быть в HTML при загрузке, а не приезжать после клика.
- Поднять ответ выше. Прямой ответ в первых абзацах раздела, детали ниже. До конца длинной страницы модель может не дойти.
- Открыть доступ тем, кого ждёте. Проверить robots.txt, коды ответа и защиту от ботов. Решение, кого пускать, принимается осознанно, а не по умолчанию из старого конфига.
- Свести разметку с текстом. Разметка Schema.org помогает поисковым системам, но не заменяет содержимое: если в JSON-LD написано одно, а на странице другое, выигрывает страница.
- Замерить повторно. Через две-три недели повторить прогон запросов и сравнить с предыдущим замером по дате.
Что изменилось в этой статье
Обновлено: август 2026 — переписали таблицу способов доступа: раньше обход впрок и заход по ссылке в момент запроса шли одной строкой. Разделили их потому, что боты у этих задач разные, закрываются в robots.txt по отдельности, и владельцы сайтов регулярно перекрывают один канал, считая, что закрыли оба.
Если хочется не разбираться самому, а получить готовый список правок по сайту, этим занимается технический GEO-аудит — от 40 000 ₽: доступность для AI-краулеров, рендеринг, разметка и то, что остаётся в слепке каждой ключевой страницы. Начать можно и с бесплатной проверки: диагностика AI-видимости показывает, по каким вашим запросам нейросети уже дают ответ и чьи названия в нём звучат.
FAQ
Какой ИИ умеет читать сайты по ссылке?
По прямой ссылке страницу открывают ChatGPT, Perplexity, Claude и Gemini — у каждого для этого есть отдельный бот, имя которого оператор публикует в документации. Алиса и Нейро работают иначе: они отвечают поверх индекса Яндекса, поэтому важно не то, дадите ли вы ссылку, а проиндексирована ли страница. Возможность сходить по адресу не гарантирует, что модель дошла до текста: авторизация, капча и тяжёлые скрипты обрывают заход.
Видит ли нейросеть текст, который написан на картинке?
Зависит от способа доступа. Если вы сами загружаете изображение или скриншот в чат, мультимодальная модель текст с него прочитает. Если по сайту идёт краулер, картинки он не распознаёт — в текст, который доходит до модели, попадает только подпись alt и имя файла. Поэтому прайс, схему процесса и характеристики картинкой нужно дублировать текстом на самой странице.
Читает ли ИИ сайт, если контент подгружается скриптами?
Поисковые роботы Яндекса и Google умеют обрабатывать JavaScript, и такая страница попадает в индекс собранной, хотя и с задержкой. У AI-краулеров подобной гарантии нет, и в наших проверках содержимое, которое появляется только после выполнения скриптов или после клика по вкладке, до модели чаще всего не доходит. Надёжный вариант один: отдавать основной текст сразу в HTML при загрузке страницы.
Как узнать, заходил ли AI-бот на мой сайт?
Единственный точный способ — логи сервера. Отфильтруйте обращения по именам ботов из документации операторов (GPTBot, ClaudeBot, PerplexityBot, ChatGPT-User и другие) и посмотрите не только сам факт визита, но и код ответа: 403, 429 и таймауты означают, что бот приходил и ушёл ни с чем. Отчёты счётчиков для этого не годятся — их код у ботов не выполняется.
Нужно ли закрывать AI-ботов в robots.txt?
Это решение бизнеса, а не техническое умолчание. Закрытый краулер означает, что платформа не соберёт ваш контент — и не назовёт вас в ответе, если у неё нет других источников про вашу компанию. Медиа и владельцы платного контента часто закрывают доступ осознанно, а сервисным и производственным компаниям такой запрет обычно вредит. Разбор по каждому боту — в статье про robots.txt и AI-краулеров.
Сколько стоит проверить, как нейросети читают сайт?
Первичная диагностика — 0 ₽: смотрим, есть ли по вашим запросам нейроответы и попадаете ли вы в них. Экспресс-диагностика AI-видимости — от 25 000 ₽, технический GEO-аудит с проверкой доступа краулеров и рендеринга — от 40 000 ₽, полный GEO-аудит — от 60 000 ₽, комплексный SEO и AI-аудит — от 120 000 ₽, регулярное сопровождение — от 80 000 ₽ в месяц.