Выжимаем максимум из краулингового бюджета: как читать логи сервера и отсекать лишних ботов
Большинство сеошников привыкли смотреть на сайт через призму Яндекс Вебмастера. Инструмент отличный, но там мы видим только ту картину, которую поисковик уже переварил и решил нам показать. Реальная жизнь сайта, его настоящая техническая изнанка, прячется под капотом — в логах Nginx или Apache.
Если ваш проект состоит из пары десятков страниц услуг, можете спать спокойно. Но если вы продвигаете интернет-магазин, доску объявлений или крупный портал с умными фильтрами, игнорировать логи — значит добровольно сливать краулинговый бюджет в никуда.

Куда уходит краулинговый бюджет?
Поисковые роботы не резиновые. У Яндекса и Google есть лимиты на обход каждого конкретного сайта, зависящие от его траста, скорости ответа сервера и качества контента. Если робот пришел к вам и потратил свой дневной лимит на сканирование бесконечных комбинаций сортировок, старых 404 ошибок и технических дублей, ваши новые высокомаржинальные товары просто не попадут в индекс.
Анализ логов сервера нужен SEO-специалисту для того, чтобы увидеть каждый реальный шаг бота. Вы точно узнаете:
- Как часто поисковик заходит на конкретные разделы сайта.
- Какие именно страницы он сканирует (спойлер: вы удивитесь, сколько мусора он обходит).
- С какими кодами ответа он сталкивается в моменте.
- Какие еще парсеры нагружают сервер, замедляя отдачу страниц полезным краулерам.
Чем открыть и проанализировать access.log
Для начала логи нужно добыть. Идем к системному администратору или хостеру и просим выгрузить файлы access.log за последние пару недель.
Открывать их обычным блокнотом — затея провальная, файл на нормальном проекте с трафиком весит гигабайты. Что использовать:
- Консоль и grep. Для любителей хардкора и Linux. Быстро отфильтровать строки по юзер-агенту
YandexBotможно одной командой, выгрузив результат в отдельный легкий файлик. - Screaming Frog Log File Analyser. Отличный десктопный софт. Закидываете в него гигабайты логов, и он переваривает их в понятные дашборды по кодам ответа, директориям и ботам.
- Kibana / Grafana / Яндекс Метрика (раздел логов). Если у вас крупный проект, логи наверняка уже куда-то собираются и парсятся. Попросите у разрабов доступы к дашбордам, это избавит вас от ручной возни с файлами.
Что искать в логах: чек-лист для специалиста
Получив данные, не нужно смотреть на них как Нео на матрицу. Мы ищем конкретные аномалии, которые сжирают наш бюджет.
1. Сканирование мусорных параметров
Часто роботы намертво зависают в каталогах, перебирая все возможные сортировки (?sort=price, ?order=desc), utm-метки и комбинации фильтров. Если вы видите, что бот тысячами обходит такие урлы, пора браться за robots.txt. Раньше в Яндексе отлично работала директива Clean-param, но сейчас она начала уходить в прошлое, поэтому рубим мусор напрямую через директиву Disallow.
2. Цепочки редиректов и битые ссылки
Вебмастер покажет вам 404 ошибку, когда страница уже выпала из поиска. Логи покажут, как робот прямо сейчас стучится в закрытую дверь. Если бот регулярно тратит лимиты на урлы с кодом 404 или 410, нужно найти, откуда на них стоят внутренние ссылки (здесь поможет обычный парсинг сайта тем же Frog’ом), и вычистить их. То же самое касается 301 редиректов — краулер должен получать 200 OK при переходе по внутренним ссылкам, а не прыгать по бесконечным перенаправлениям.
3. Бесполезные и агрессивные боты
Кроме Яндекса и Google ваш сайт сканируют сотни других скриптов: AhrefsBot, MJ12bot, DotBot, различные нейросетевые скраперы, собирающие даты для обучения, и банальные парсеры конкурентов. Они не приносят вам трафика, но генерируют огромную нагрузку на базу данных. В итоге, когда приходит полезный поисковый бот, сайт отвечает медленно, и краулинговый бюджет режется уже из-за таймаутов. Решение простое: безжалостно банить бесполезных ботов на уровне конфигурации Nginx, отдавая им 403 Forbidden.
4. Сканирование технических файлов
Иногда по логам видно, что бот маниакально выкачивает тяжелые системные JSON-ответы API, старые PDF-инструкции, которые вообще не нужны в поиске, или шрифты. Проанализируйте, нужно ли поисковику содержимое этих файлов для правильного рендеринга страницы. Если нет — закрывайте доступ.
Анализ логов выводит SEO на другой технический уровень. Вы перестаете гадать на кофейной гуще, почему новые страницы не индексируются, и начинаете управлять тем, как поисковик видит ваш проект. Настройте регулярный мониторинг хотя бы раз в квартал, закройте дыры в краулинговом бюджете, и новые карточки товаров будут залетать в топ гораздо быстрее.
