Короткий ответ. Большинству сайтов не нужна отдельная оптимизация краулингового бюджета. Она становится приоритетом, когда проект содержит десятки тысяч быстро меняющихся страниц или способен создавать сотни тысяч и миллионы дублей, параметров и технических URL.

Что такое краулинговый бюджет простыми словами

Это не фиксированное число страниц «на день». Google определяет crawl budget как набор URL, которые система может и хочет обойти.

На него влияют две составляющие: crawl capacity limit — сколько запросов выдержит сервер без перегрузки, и crawl demand — насколько Google считает повторный обход нужным с учётом размера сайта, обновлений, качества и популярности страниц.

Обход не равен индексированию

Google может загрузить страницу и всё равно не включить её в индекс. Поэтому crawl budget нельзя измерять количеством проиндексированных URL.

Кому действительно стоит о нём думать

Актуальная справка Google адресует рекомендации прежде всего трём группам:

  • сайтам примерно с 1 млн+ уникальных страниц, которые меняются раз в неделю;
  • проектам примерно с 10 тыс.+ страниц, если значительная часть обновляется ежедневно;
  • сайтам, где большая доля URL имеет статус «Обнаружена — пока не проиндексирована».

Google подчёркивает: это ориентиры, а не точные пороги. Если новые страницы обходятся в день публикации, отдельная оптимизация бюджета обычно не нужна.

СитуацияПриоритет?
Сайт услуг, 500 страницОбычно нет
Магазин, 5 тыс. товаровОбычно нет, если нет миллионов параметров
50 тыс. URL, товары меняются ежедневноПроверить
Миллионы URL фильтровДа
Новые страницы обходятся в тот же деньОбычно нет
Тысячи обнаруженных, но не проиндексированных URLДиагностировать
Много 5xx или 429Да, возможна проблема ёмкости

Почему небольшой сайт обычно страдает не от бюджета

На сайте с 500–5000 полезных страниц медленная индексация чаще объясняется слабым или дублирующимся контентом, плохой перелинковкой, ошибочным canonical, robots.txt, некорректным Sitemap, отсутствием внутренних ссылок или серверными ошибками.

Статусы «Просканирована — пока не проиндексирована» и «Обнаружена — пока не проиндексирована» сами по себе не доказывают нехватку бюджета. Сначала проверьте качество страницы и возможность добраться до неё по ссылкам.

Когда проблема действительно похожа на crawl budget

  • новые важные URL неделями не обходятся;
  • изменения больших разделов долго не замечаются;
  • робот преимущественно запрашивает параметры, сортировки и дубли;
  • известных роботу адресов в разы больше полезных страниц;
  • фильтры создают миллионы комбинаций;
  • есть бесконечные пространства URL, soft 404 и цепочки редиректов;
  • сервер отвечает медленно, отдаёт 5xx, 429 или таймауты.

Ключевой термин Google — perceived inventory: весь известный системе запас URL. Именно лишними адресами владелец сайта может управлять эффективнее всего.

Откуда берётся мусорный расход обхода

Фасетная навигация и параметры

/catalog/?color=red&brand=x&sort=price&page=3

Одна категория способна породить тысячи сочетаний цветов, брендов, сортировок, количества товаров, меток и идентификаторов сессии.

Дубли, ошибки и бесконечные пространства

Слеш и адрес без слеша, HTTP и HTTPS, разные пути к одному документу, soft 404, длинные редиректы, календари, внутренний поиск и автоматически создаваемые URL расширяют очередь обхода.

10 000
полезных страниц
→
2 млн
URL создаёт CMS
→
Обход уходит
на параметры

Как понять, куда реально ходит робот

Начинайте не с абстрактного показателя, а с данных:

  • Google Search Console → Crawl Stats — объём запросов, ответы сервера и типы файлов;
  • Яндекс Вебмастер → Статистика обхода — посещённые URL, коды ответа и динамика;
  • серверные логи — основной источник детального анализа на крупных проектах;
  • сопоставление запросов роботов с эталонным списком целевых URL.

Практическая диагностика

  1. Посчитайте реально полезные страницы.
  2. Оцените, сколько URL способен генерировать сайт.
  3. Выясните по логам, какие шаблоны чаще обходят роботы.
  4. Проверьте скорость обхода новых важных страниц.
  5. Найдите 5xx, 429, цепочки редиректов и soft 404.
  6. Только после этого решайте, нужна ли работа с crawl budget.
Новые URL обходятся нормально?
Да → crawl budget не приоритет. Нет → дальше.
Сайт большой или URL сильно раздуваются?
Нет → ищите проблемы качества и индексации. Да → дальше.
Анализируйте Crawl Stats и server logs
Ищите ненужный обход и ограничения сервера.

Что делать, если бюджет расходуется неэффективно

  1. Сократить генерацию ненужных URL и устранить дубли.
  2. Настроить фильтры, сортировки и параметры.
  3. Возвращать 404/410 для окончательно удалённых страниц.
  4. Устранить soft 404 и длинные цепочки редиректов.
  5. Настроить robots.txt там, где обход действительно не нужен.
  6. Поддерживать актуальный sitemap.xml.
  7. Улучшить внутреннюю перелинковку.
  8. Исправить медленные ответы, 5xx и 429.

Освободившийся после блокировки ресурс не обязательно автоматически перейдёт на нужные страницы. Google делает это только тогда, когда сайт уже упирался в crawl capacity limit.

Для каталогов эта работа обычно входит в техническую часть SEO-продвижения интернет-магазина: вместе проверяются фильтры, пагинация, дубли и фактическая индексация.

Почему noindex не экономит обход

Чтобы увидеть noindex, Google сначала должен загрузить URL. Если техническая масса вообще не должна обходиться, сам по себе noindex не решает задачу. Но robots.txt нельзя применять механически для удаления уже известных URL из индекса — это отдельная задача.

Как влияет скорость сервера

При росте задержки, 5xx и 429 Google снижает доступную ёмкость обхода. Быстрый стабильный сервер помогает эффективнее использовать её, но ускорение не заставит Google индексировать некачественные страницы.

Как работает Яндекс

Не переносите терминологию Google один в один. Яндекс сам определяет, какие страницы и как часто обходить. В Вебмастере доступны статистика и отдельная настройка скорости; по умолчанию рекомендуется автоматическая оптимизация.

Директива Crawl-delay не учитывается Яндексом с 22 февраля 2018 года. Частоту регулируют через Вебмастер. Изменение числа запросов по дням само по себе не доказывает проблему с индексацией или ранжированием.

«Краулинговый бюджет — одна из тех тем, которые иногда заставляют оптимизировать проблему, которой на сайте вообще нет. Если у проекта несколько тысяч нормальных URL и новые страницы спокойно находят роботы, я бы сначала занимался структурой, контентом и индексируемостью. Бюджет становится интересен, когда сайт способен генерировать сотни тысяч или миллионы адресов и робот начинает тратить ресурсы не туда».
Константин Шипилов

Константин Шипилов

SEO-специалист, руководитель Шипилов SEO

Что не делать

  • оптимизировать бюджет на сайте из сотен страниц только из-за технического термина;
  • считать число запросов Googlebot самостоятельным KPI;
  • закрывать половину сайта ради «перераспределения»;
  • считать, что noindex прекращает обход;
  • использовать Crawl-delay для Google или Яндекса;
  • решать проблемы слабых страниц только ускорением обхода;
  • считать статус «Обнаружена — пока не проиндексирована» доказанной нехваткой бюджета;
  • анализировать крупный каталог без серверных логов.

Частые вопросы

Есть ли фиксированный краулинговый бюджет?

Нет. Он меняется вместе с возможностями сервера и потребностью поисковика в обходе.

Нужно ли беспокоиться сайту на 1000 страниц?

Обычно нет, если важные страницы обходятся без заметной задержки.

Влияет ли crawl budget на позиции?

Частота обхода сама по себе не является фактором ранжирования.

Поможет ли ускорение сайта?

Может повысить доступную ёмкость обхода, но не заменяет качество и индексируемость.

Экономит ли noindex бюджет?

Нет: робот сначала загружает страницу, а затем читает noindex.

Нужно ли закрывать фильтры?

Только технические комбинации; индексируемые SEO-посадочные должны оставаться открытыми.

Помогает ли Sitemap?

Он сообщает о важных URL и обновлениях, но не устраняет мусорную генерацию.

Можно ли увеличить обход Googlebot?

Гарантированного переключателя нет: Google учитывает здоровье сервера, спрос, качество и ценность страниц.

Как проверить обход?

Смотрите Crawl Stats, статистику Яндекс Вебмастера и серверные логи.

Источники

Технические рекомендации сверены с официальной документацией:

Читать также