Хватит искать 404 руками: настраиваем автопоиск битых ссылок в Screaming Frog
Битые ссылки — это тихий, но максимально эффективный убийца краулингового бюджета и конверсии. Пока вы ждете, когда Вебмастер соизволит обновить отчеты и показать свежие 404 или 500 ошибки, пользователи уже уходят к конкурентам, а поисковые боты впустую сливают лимиты обхода на мертвые страницы.
Поиск битых ссылок на сайте давно пора ставить на поток. И нет, это не предложение каждый раз открывать софт, вбивать урл и ждать завершения парсинга. Мы будем автоматизировать эту рутину через старую добрую «лягушку» — Screaming Frog SEO Spider.

Подготовка: что именно мы ищем и почему это важно
Сам по себе поиск 404 ошибок на сайте сводится к сканированию всех внутренних ссылок и проверке статус-кодов сервера. Если проект состоит из пары сотен страниц, прогнать его можно за время перекура. Но если в работе e-commerce на десятки тысяч товаров, крупный портал или агрегатор, ручной запуск превращается в боль. Товары удаляются, категории переименовываются, редиректы слетают — битые ссылки плодятся ежедневно.
Наша цель — сделать так, чтобы программа сама просыпалась по расписанию, парсила сайт, собирала отвалившиеся URL и аккуратно складывала их в готовый отчет.
Настраиваем идеальный профиль сканирования
Прежде чем лезть в планировщик задач, нужно создать и сохранить конфигурацию. Если пустить краулер гулять по дефолтным настройкам, он соберет гигабайты мусора и будет парсить проект сутками.
- Идем в верхнее меню: Configuration > Crawl Config.
- На вкладке Crawl отключаем парсинг картинок, CSS и JavaScript. Если нас интересуют только битые HTML-документы, это ускорит процесс сканирования в разы.
- На вкладке Limits устанавливаем разумные ограничения. Если сайт огромный, можно ограничить глубину сканирования (Limit Crawl Depth) или количество URL, чтобы случайно не положить сервер своими же запросами.
- Обязательно загляните в раздел Advanced и проверьте галки «Respect Noindex» и «Respect Canonical», чтобы краулер не тратил время на технические дубликаты.
- Сохраняем наш пресет: Configuration > Profiles > Save As. Называем файл понятно, скажем,
auto_404_check.seospiderconfig.

Включаем планировщик задач (Scheduling)
В десктопной версии Screaming Frog встроен отличный функционал для работы по расписанию. Единственное условие — компьютер или сервер, на котором крутится софт, должен быть включен в назначенное время.
- Открываем File > Scheduling.
- Нажимаем «Add» и задаем имя таску (например, «Еженедельный срез 4xx и 5xx»).
- В разделе Start Options настраиваем триггер. Оптимально ставить парсинг на ночь с воскресенья на понедельник, чтобы к началу рабочей недели у вас уже были свежие данные.
- В Crawl Seed вписываем стартовый URL проекта и в поле Crawl Config подтягиваем тот самый пресет, который мы сохранили шагом ранее.

Куда складывать отчеты по 404 и 500 ошибкам?
Вся суть автоматизации в том, чтобы вообще не открывать интерфейс Screaming Frog для анализа результатов. Настроим автоматический экспорт нужных данных. Нам важен не просто факт наличия битого урла, а то, где именно на сайте стоит эта кривая ссылка (Inlinks), чтобы можно было пойти и исправить ее.
- В том же окне настройки расписания переходим на вкладку Export.
- В блоке Bulk Export ищем раздел Response Codes.
- Отмечаем галочками нужные отчеты: Client Error (4xx) Inlinks и Server Error (5xx) Inlinks.
- Указываем папку для сохранения файлов.
Лайфхак: если указать директорию Google Drive или Яндекс Диск, отчеты будут сразу улетать в облако и синхронизироваться с вашей рабочей станцией или с аккаунтами проджект-менеджеров.
Для любителей хардкора и владельцев выделенных серверов под SEO-задачи: лягушка отлично работает в headless режиме через командную строку (CLI). Вы можете повесить запуск парсинга с нужным конфигом и параметрами экспорта прямо в Cron на Linux-сервере. Команда будет выглядеть примерно так:
ScreamingFrogSEOSpiderCli --crawl https://site.com --config "path/to/config.seospiderconfig" --export-tabs "Client Error (4xx) Inlinks" --headless
В итоге вы получаете полностью автономную систему мониторинга. В понедельник утром вы просто открываете расшаренную папку, забираете готовый эксель с проблемными донорами и битыми акцепторами, и сразу отправляете это в таск-трекер на доработку. Меньше рутинного клацанья по кнопкам, чище ссылочный граф сайта и никакого слива бюджета на обход несуществующих страниц.
