Короткий ответ. Robots.txt управляет обходом URL, но не гарантирует их удаление из поиска. Для исключения доступной страницы нужен noindex, для дубля — canonical или редирект, для удалённой страницы — 404/410, а для закрытых данных — авторизация.
Что делает robots.txt — и чего он не делает
Файл robots.txt сообщает поисковым роботам, какие URL можно запрашивать, а какие — нет. Он помогает ограничивать лишний обход технических страниц и нагрузку на сервер.
Disallow не означает «удалить страницу из поиска». Если Google или Яндекс знают адрес по ссылкам, заблокированный URL всё равно может появиться в выдаче без содержимого страницы.
Robots.txt — не защита данных
Файл открыт всем. Конфиденциальный раздел закрывают авторизацией или паролем, а не перечисляют его адреса в robots.txt.
Какие страницы обычно имеет смысл закрывать
Единого списка для всех сайтов нет. Типичные кандидаты — URL, которые не нужны в поиске и создают много бесполезных обходов:
- административные и служебные разделы CMS;
- внутренний поиск;
- корзина и технические этапы оформления;
- личный кабинет;
- логи и другие служебные разделы;
- бесконечные комбинации параметров, сортировок и технических фильтров.
Для параметров, которые не меняют содержание, Яндекс рекомендует рассматривать Clean-param: директива объединяет сигналы параметрических дублей и снижает повторный обход. Это отдельный инструмент Яндекса, а не стандарт Google.
Какие страницы нельзя бездумно блокировать
Целевые страницы
Услуги, категории, карточки товаров, статьи, региональные страницы и подготовленные SEO-фильтры должны оставаться доступными, если вы хотите видеть их в поиске.
Страницы с noindex
Опасная связка выглядит так:
User-agent: *
Disallow: /page/
<meta name="robots" content="noindex">
Робот не может зайти на страницу и прочитать noindex. Google прямо предупреждает: такой URL может остаться в результатах. Яндекс даёт ту же практическую рекомендацию — не блокировать страницу, если робот должен увидеть запрет индексации.
URL с canonical
Если дубль закрыт в robots.txt, робот может не увидеть rel="canonical". Google отдельно не рекомендует использовать robots.txt для каноникализации. Подробнее — в материале о настройке canonical.
CSS, JavaScript и важные ресурсы
Не закрывайте ресурсы, необходимые для рендеринга и понимания страницы. Блокировка целой технической директории без проверки иногда ломает вид страницы для поискового робота.
Disallow, noindex, canonical или HTTP-код
| Ситуация | Robots.txt | Что использовать |
|---|---|---|
| Страница должна ранжироваться | Не блокировать | Открытый обход |
| Не нужна в поиске, но доступна людям | Не блокировать | noindex |
| Дубль основной страницы | Обычно не блокировать | canonical или 301 |
| Внутренний поиск | Обычно закрыть | Disallow |
| Корзина | Обычно закрыть | Disallow |
| Удалённая страница | Не решать через файл | 404 или 410 |
| Конфиденциальный раздел | Недостаточно | Авторизация |
| SEO-фильтр | Не блокировать | Индексируемая посадочная |
Да → не блокировать обход. Нет → дальше.
Да → noindex, canonical или HTTP-код по задаче.
Тогда можно рассматривать Disallow.
Robots.txt для интернет-магазина
/search/,/cart/,/checkout/— обычно закрывают;?sort=price— частый кандидат на ограничение;- UTM-метки не должны создавать отдельную стратегию индексирования;
/catalog/color-red/не закрывают, если это полноценная SEO-посадочная;- пагинацию не блокируют автоматически.
Фильтр оценивают не по виду URL, а по роли. Подготовленная посадочная со спросом, ассортиментом, метаданными, ссылками и self-canonical отличается от случайной комбинации параметров. См. также материал про SEO-фильтры и услугу продвижения интернет-магазинов.
Как работают Allow и Disallow
User-agent: *
Disallow: /catalog/filter/
Allow: /catalog/filter/red/
Так можно закрыть общий раздел и оставить исключение. Но совпадения правил у роботов имеют нюансы: сложный файл обязательно тестируют на реальных URL, а не собирают «на глаз».
Опасный вариант
User-agent: *
Disallow: /catalog/
Одной строкой закрыты категории, карточки и SEO-фильтры. Если проблема только в сортировках, правило слишком широкое.
Более безопасный вариант
User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?sort=
Sitemap: https://example.ru/sitemap.xml
Даже этот пример нельзя копировать без проверки структуры сайта, регистра, параметров и работы CMS.
Отдельные правила для Google и Яндекса
Секции User-agent: Googlebot, User-agent: Yandex и User-agent: * допустимы, но нужны только при реальном различии правил. Чем сложнее файл, тем выше риск конфликтов.
User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign
User-agent: *
Disallow: /search/
Sitemap: https://example.ru/sitemap.xml
Clean-param относится к Яндексу. Директива Sitemap — нормальный способ сообщить роботам адрес карты сайта. О составе самой карты — в статье как правильно настроить sitemap.xml.
Как проверить robots.txt после изменения
- Откройте
/robots.txtи проверьте ответ сервера. - Протестируйте критические URL по каждому шаблону.
- Убедитесь, что услуги, категории, товары и статьи доступны.
- Проверьте CSS, JavaScript и изображения, нужные для рендеринга.
- Найдите страницы с
noindex: робот должен иметь возможность их прочитать. - Проверьте дубли, где робот должен увидеть canonical.
- Проверьте файл и URL в Яндекс Вебмастере.
- Используйте проверку URL и отчёты индексирования Google Search Console.
- После релиза контролируйте обход и индексирование, а не только синтаксис.
У Яндекса файл должен находиться в корне сайта и корректно отдаваться сервером. Вебмастер позволяет проверить разрешение конкретного URL и посмотреть историю изменений.
«Самая частая ошибка с robots.txt — воспринимать его как список страниц, которые мы хотим удалить из поиска. На практике сначала нужно понять задачу: мы хотим запретить роботу обход, убрать страницу из индекса или показать поисковику, какая версия основная. Для этих задач используются разные инструменты».

Константин Шипилов
SEO-специалист, руководитель Шипилов SEO
Что не делать
- закрывать страницы только потому, что их не хотят видеть в выдаче;
- ставить Disallow и рассчитывать, что робот прочитает noindex;
- закрывать дубль и ждать, что робот увидит canonical;
- блокировать весь
/catalog/ради нескольких фильтров; - закрывать CSS и JavaScript целыми директориями без проверки;
- копировать типовой robots.txt с другого сайта;
- использовать файл для защиты приватных данных;
- перечислять сотни URL вместо исправления генерации дублей.
Частые вопросы
Можно ли удалить страницу из Google через robots.txt?
Нет. Disallow ограничивает обход, но известный по ссылкам URL может остаться в поиске.
Что лучше: Disallow или noindex?
Disallow — для ограничения обхода, noindex — для удаления доступной роботу страницы из поиска.
Можно ли одновременно использовать Disallow и noindex?
Не рассчитывайте на такую связку: заблокированный робот не увидит noindex.
Нужно ли закрывать страницы пагинации?
Не автоматически. Сначала проверьте архитектуру и доступность товаров или материалов по ссылкам.
Нужно ли закрывать фильтры?
Технические комбинации — часто да; полноценные SEO-посадочные — нет.
Нужно ли закрывать UTM-метки?
Не обязательно через Disallow. Для Яндекса подходит Clean-param; также проверьте canonical и внутренние ссылки.
Можно ли закрывать CSS и JavaScript?
Не закрывайте ресурсы, необходимые поисковику для нормального рендеринга.
Нужно ли указывать Sitemap в robots.txt?
Да, это стандартный способ сообщить поисковикам адрес карты сайта.
Что произойдёт, если robots.txt отсутствует?
Роботы обычно считают, что ограничений обхода нет. Важно, чтобы отсутствие файла не маскировалось ошибочной серверной конфигурацией.
Источники
Технические рекомендации сверены с официальной документацией:
- Google: запрет индексирования через noindex;
- Google: canonical и ограничения robots.txt;
- Google: удаление информации из поиска;
- Яндекс: использование robots.txt;
- Яндекс: директива Clean-param;
- Яндекс: анализ robots.txt.