Хватит искать 404 руками: настраиваем автопоиск битых ссылок в Screaming Frog

Битые ссылки — это тихий, но максимально эффективный убийца краулингового бюджета и конверсии. Пока вы ждете, когда Вебмастер соизволит обновить отчеты и показать свежие 404 или 500 ошибки, пользователи уже уходят к конкурентам, а поисковые боты впустую сливают лимиты обхода на мертвые страницы.

Поиск битых ссылок на сайте давно пора ставить на поток. И нет, это не предложение каждый раз открывать софт, вбивать урл и ждать завершения парсинга. Мы будем автоматизировать эту рутину через старую добрую «лягушку» — Screaming Frog SEO Spider.

Подготовка: что именно мы ищем и почему это важно

Сам по себе поиск 404 ошибок на сайте сводится к сканированию всех внутренних ссылок и проверке статус-кодов сервера. Если проект состоит из пары сотен страниц, прогнать его можно за время перекура. Но если в работе e-commerce на десятки тысяч товаров, крупный портал или агрегатор, ручной запуск превращается в боль. Товары удаляются, категории переименовываются, редиректы слетают — битые ссылки плодятся ежедневно.

Наша цель — сделать так, чтобы программа сама просыпалась по расписанию, парсила сайт, собирала отвалившиеся URL и аккуратно складывала их в готовый отчет.

Настраиваем идеальный профиль сканирования

Прежде чем лезть в планировщик задач, нужно создать и сохранить конфигурацию. Если пустить краулер гулять по дефолтным настройкам, он соберет гигабайты мусора и будет парсить проект сутками.

  • Идем в верхнее меню: Configuration > Crawl Config.
  • На вкладке Crawl отключаем парсинг картинок, CSS и JavaScript. Если нас интересуют только битые HTML-документы, это ускорит процесс сканирования в разы.
  • На вкладке Limits устанавливаем разумные ограничения. Если сайт огромный, можно ограничить глубину сканирования (Limit Crawl Depth) или количество URL, чтобы случайно не положить сервер своими же запросами.
  • Обязательно загляните в раздел Advanced и проверьте галки «Respect Noindex» и «Respect Canonical», чтобы краулер не тратил время на технические дубликаты.
  • Сохраняем наш пресет: Configuration > Profiles > Save As. Называем файл понятно, скажем, auto_404_check.seospiderconfig.

Включаем планировщик задач (Scheduling)

В десктопной версии Screaming Frog встроен отличный функционал для работы по расписанию. Единственное условие — компьютер или сервер, на котором крутится софт, должен быть включен в назначенное время.

  • Открываем File > Scheduling.
  • Нажимаем «Add» и задаем имя таску (например, «Еженедельный срез 4xx и 5xx»).
  • В разделе Start Options настраиваем триггер. Оптимально ставить парсинг на ночь с воскресенья на понедельник, чтобы к началу рабочей недели у вас уже были свежие данные.
  • В Crawl Seed вписываем стартовый URL проекта и в поле Crawl Config подтягиваем тот самый пресет, который мы сохранили шагом ранее.

Куда складывать отчеты по 404 и 500 ошибкам?

Вся суть автоматизации в том, чтобы вообще не открывать интерфейс Screaming Frog для анализа результатов. Настроим автоматический экспорт нужных данных. Нам важен не просто факт наличия битого урла, а то, где именно на сайте стоит эта кривая ссылка (Inlinks), чтобы можно было пойти и исправить ее.

  • В том же окне настройки расписания переходим на вкладку Export.
  • В блоке Bulk Export ищем раздел Response Codes.
  • Отмечаем галочками нужные отчеты: Client Error (4xx) Inlinks и Server Error (5xx) Inlinks.
  • Указываем папку для сохранения файлов.

Лайфхак: если указать директорию Google Drive или Яндекс Диск, отчеты будут сразу улетать в облако и синхронизироваться с вашей рабочей станцией или с аккаунтами проджект-менеджеров.

Для любителей хардкора и владельцев выделенных серверов под SEO-задачи: лягушка отлично работает в headless режиме через командную строку (CLI). Вы можете повесить запуск парсинга с нужным конфигом и параметрами экспорта прямо в Cron на Linux-сервере. Команда будет выглядеть примерно так:

ScreamingFrogSEOSpiderCli --crawl https://site.com --config "path/to/config.seospiderconfig" --export-tabs "Client Error (4xx) Inlinks" --headless

В итоге вы получаете полностью автономную систему мониторинга. В понедельник утром вы просто открываете расшаренную папку, забираете готовый эксель с проблемными донорами и битыми акцепторами, и сразу отправляете это в таск-трекер на доработку. Меньше рутинного клацанья по кнопкам, чище ссылочный граф сайта и никакого слива бюджета на обход несуществующих страниц.

Звёзд: 1Звёзд: 2Звёзд: 3Звёзд: 4Звёзд: 5 (Пока оценок нет)
Загрузка...
logo