На Хабре вышла практическая заметка о том, как за 5 минут проверить, видят ли сайт боты ИИ. Завязка знакома многим владельцам площадок: в браузере страница отдаёт 200 OK, а ChatGPT, Claude и Perplexity на этот контент не ссылаются.
Автор предлагает не начинать с качества текста и SEO-разметки. Часто причина ниже: краулеры этих систем физически не получают ту же страницу, которую видит человек. Особенно это касается проектов на shared-хостинге или за CDN. Антибот-защита там бывает включена по умолчанию провайдером или панелью, а не осознанным решением редакции.
В лиде названы типичные фильтры: Cloudflare, WAF хостинга, модуль защиты от парсинга. Их можно не замечать годами. Обычным посетителям и поисковым ботам Google они не мешают, а новые краулеры вроде GPTBot или ClaudeBot попадают под раздачу первыми. Их либо ещё не занесли в белый список, либо режут по репутации IP-подсети или по самому User-Agent.
Практический смысл проверки через curl как раз в том, чтобы увидеть ответ сервера глазами бота, а не глазами Chrome. Если человеку отдаётся полный HTML, а «чужому» клиенту — заглушка, капча или пустая оболочка, никакая перелинковка это не вылечит. Сначала нужно понять, кто вообще допущен к тексту.
Чего обзор не делает. Он не повторяет команды из статьи и не обещает, что после одной проверки трафик из ИИ-поиска вырастет. В источнике нет цифр по охвату и нет гарантий со стороны моделей. Есть только диагноз: администратор может искренне не знать, что контент невидим для ИИ-систем.
Для площадки вроде Сводки это полезный санитарный чеклист. Мы сами хотим, чтобы краткие обзоры находили, но не ценой открытия сайта любому парсеру без правил. Правильный порядок — сначала понять, кого режет защита, потом решать, кого пускать. Полная инструкция остаётся у автора на Хабре.
Имеет смысл разделить три разных отказа. Первый — бота режет WAF, и человек об этом не знает. Второй — страница отдаётся, но это клиентский каркас без текста. Третий — текст есть, однако модель его не цитирует по своим внутренним причинам. Статья на Хабре закрывает в основном первый случай. Остальные два требуют уже других проверок, и их нельзя вывести из одного удачного curl.