Классический поиск показывает ссылки — AI-поиск пересказывает содержание. Чтобы пересказать, модель должна сначала прочитать страницу: получить HTML, разобрать смысл и уложиться в отведённое время. Шесть пунктов ниже — это места, где чаще всего рвётся именно чтение, а не качество текста. Проверка идёт снаружи, как это делает краулер: без доступа к вашему серверу, аналитике и паролям.
1. llms.txt
Ищем файл /llms.txt в корне домена и проверяем, что он не пустой.
Это не HTML, а короткая выжимка о сайте специально для языковых моделей: кто вы, что делаете, куда идти за подробностями. Модель читает её вместо того, чтобы разбирать вёрстку.
Если не пройдено: Создайте llms.txt в корне домена: описание компании, ключевые разделы со ссылками, контакты. Формат — обычный markdown, ограничений по объёму нет.
2. robots.txt для AI-ботов
Смотрим, не закрыт ли доступ конкретным AI-краулерам: GPTBot, ClaudeBot, PerplexityBot, Google-Extended.
Эти боты уважают robots.txt. Одна строка Disallow в их группе — и сайт исчезает из ответов соответствующего сервиса целиком, независимо от качества контента.
Если не пройдено: Уберите Disallow: / из группы нужного User-agent. Если хотите пускать всех — достаточно, чтобы для этих ботов не было отдельных запрещающих правил.
3. schema.org / JSON-LD
Ищем на странице хотя бы один валидный блок <script type="application/ld+json">.
Разметка сообщает машине факты напрямую: это организация, это статья, это вопрос и ответ. Без неё модель вынуждена угадывать смысл из текста и ошибается чаще.
Если не пройдено: Добавьте базовую разметку Organization и WebPage, а на страницах с вопросами — FAQPage. Проверить результат можно валидатором schema.org.
4. Контент виден без JS
Забираем HTML как обычный краулер, без выполнения JavaScript, и считаем объём осмысленного текста — без меню, шапки и футера.
Часть AI-краулеров не исполняет JS вообще. Если текст появляется только после гидратации, для них страница выглядит пустой оболочкой.
Если не пройдено: Отдавайте основной текст с сервера: серверный рендеринг, статическая генерация или хотя бы базовое содержание в исходном HTML.
5. SEO-гигиена
Проверяем title, meta description, canonical и наличие /sitemap.xml.
Это общий фундамент для классического и для AI-поиска: по нему определяют тему страницы, каноничный адрес и границы сайта.
Если не пройдено: Title 10–60 символов, description 50–160, canonical на каждой странице, работающий sitemap.xml, отдающий 200.
6. Скорость ответа
Замеряем время главного запроса вместе с редиректами.
Краулер отводит на один сайт ограниченное время. Чем дольше отвечает страница, тем меньше страниц успевают прочитать — и тем реже сайт попадает в ответы.
Если не пройдено: Сократите цепочку редиректов до целевого адреса, включите кэширование и сжатие, уберите тяжёлые синхронные запросы из отдачи первого байта.