Короткий ответ. Robots.txt управляет обходом URL, но не гарантирует их удаление из поиска. Для исключения доступной страницы нужен noindex, для дубля — canonical или редирект, для удалённой страницы — 404/410, а для закрытых данных — авторизация.

Что делает robots.txt — и чего он не делает

Файл robots.txt сообщает поисковым роботам, какие URL можно запрашивать, а какие — нет. Он помогает ограничивать лишний обход технических страниц и нагрузку на сервер.

Disallow не означает «удалить страницу из поиска». Если Google или Яндекс знают адрес по ссылкам, заблокированный URL всё равно может появиться в выдаче без содержимого страницы.

Robots.txt — не защита данных

Файл открыт всем. Конфиденциальный раздел закрывают авторизацией или паролем, а не перечисляют его адреса в robots.txt.

Какие страницы обычно имеет смысл закрывать

Единого списка для всех сайтов нет. Типичные кандидаты — URL, которые не нужны в поиске и создают много бесполезных обходов:

  • административные и служебные разделы CMS;
  • внутренний поиск;
  • корзина и технические этапы оформления;
  • личный кабинет;
  • логи и другие служебные разделы;
  • бесконечные комбинации параметров, сортировок и технических фильтров.

Для параметров, которые не меняют содержание, Яндекс рекомендует рассматривать Clean-param: директива объединяет сигналы параметрических дублей и снижает повторный обход. Это отдельный инструмент Яндекса, а не стандарт Google.

Какие страницы нельзя бездумно блокировать

Целевые страницы

Услуги, категории, карточки товаров, статьи, региональные страницы и подготовленные SEO-фильтры должны оставаться доступными, если вы хотите видеть их в поиске.

Страницы с noindex

Опасная связка выглядит так:

User-agent: *
Disallow: /page/
<meta name="robots" content="noindex">

Робот не может зайти на страницу и прочитать noindex. Google прямо предупреждает: такой URL может остаться в результатах. Яндекс даёт ту же практическую рекомендацию — не блокировать страницу, если робот должен увидеть запрет индексации.

URL с canonical

Если дубль закрыт в robots.txt, робот может не увидеть rel="canonical". Google отдельно не рекомендует использовать robots.txt для каноникализации. Подробнее — в материале о настройке canonical.

CSS, JavaScript и важные ресурсы

Не закрывайте ресурсы, необходимые для рендеринга и понимания страницы. Блокировка целой технической директории без проверки иногда ломает вид страницы для поискового робота.

Disallow, noindex, canonical или HTTP-код

СитуацияRobots.txtЧто использовать
Страница должна ранжироватьсяНе блокироватьОткрытый обход
Не нужна в поиске, но доступна людямНе блокироватьnoindex
Дубль основной страницыОбычно не блокироватьcanonical или 301
Внутренний поискОбычно закрытьDisallow
КорзинаОбычно закрытьDisallow
Удалённая страницаНе решать через файл404 или 410
Конфиденциальный разделНедостаточноАвторизация
SEO-фильтрНе блокироватьИндексируемая посадочная
1. URL нужен в поиске?
Да → не блокировать обход. Нет → дальше.
2. Робот должен увидеть страницу?
Да → noindex, canonical или HTTP-код по задаче.
3. Обход действительно не нужен?
Тогда можно рассматривать Disallow.

Robots.txt для интернет-магазина

  • /search/, /cart/, /checkout/ — обычно закрывают;
  • ?sort=price — частый кандидат на ограничение;
  • UTM-метки не должны создавать отдельную стратегию индексирования;
  • /catalog/color-red/ не закрывают, если это полноценная SEO-посадочная;
  • пагинацию не блокируют автоматически.

Фильтр оценивают не по виду URL, а по роли. Подготовленная посадочная со спросом, ассортиментом, метаданными, ссылками и self-canonical отличается от случайной комбинации параметров. См. также материал про SEO-фильтры и услугу продвижения интернет-магазинов.

Как работают Allow и Disallow

User-agent: *
Disallow: /catalog/filter/
Allow: /catalog/filter/red/

Так можно закрыть общий раздел и оставить исключение. Но совпадения правил у роботов имеют нюансы: сложный файл обязательно тестируют на реальных URL, а не собирают «на глаз».

Опасный вариант

User-agent: *
Disallow: /catalog/

Одной строкой закрыты категории, карточки и SEO-фильтры. Если проблема только в сортировках, правило слишком широкое.

Более безопасный вариант

User-agent: *
Disallow: /search/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?sort=

Sitemap: https://example.ru/sitemap.xml

Даже этот пример нельзя копировать без проверки структуры сайта, регистра, параметров и работы CMS.

Отдельные правила для Google и Яндекса

Секции User-agent: Googlebot, User-agent: Yandex и User-agent: * допустимы, но нужны только при реальном различии правил. Чем сложнее файл, тем выше риск конфликтов.

User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign

User-agent: *
Disallow: /search/

Sitemap: https://example.ru/sitemap.xml

Clean-param относится к Яндексу. Директива Sitemap — нормальный способ сообщить роботам адрес карты сайта. О составе самой карты — в статье как правильно настроить sitemap.xml.

Как проверить robots.txt после изменения

  1. Откройте /robots.txt и проверьте ответ сервера.
  2. Протестируйте критические URL по каждому шаблону.
  3. Убедитесь, что услуги, категории, товары и статьи доступны.
  4. Проверьте CSS, JavaScript и изображения, нужные для рендеринга.
  5. Найдите страницы с noindex: робот должен иметь возможность их прочитать.
  6. Проверьте дубли, где робот должен увидеть canonical.
  7. Проверьте файл и URL в Яндекс Вебмастере.
  8. Используйте проверку URL и отчёты индексирования Google Search Console.
  9. После релиза контролируйте обход и индексирование, а не только синтаксис.

У Яндекса файл должен находиться в корне сайта и корректно отдаваться сервером. Вебмастер позволяет проверить разрешение конкретного URL и посмотреть историю изменений.

«Самая частая ошибка с robots.txt — воспринимать его как список страниц, которые мы хотим удалить из поиска. На практике сначала нужно понять задачу: мы хотим запретить роботу обход, убрать страницу из индекса или показать поисковику, какая версия основная. Для этих задач используются разные инструменты».
Константин Шипилов

Константин Шипилов

SEO-специалист, руководитель Шипилов SEO

Что не делать

  • закрывать страницы только потому, что их не хотят видеть в выдаче;
  • ставить Disallow и рассчитывать, что робот прочитает noindex;
  • закрывать дубль и ждать, что робот увидит canonical;
  • блокировать весь /catalog/ ради нескольких фильтров;
  • закрывать CSS и JavaScript целыми директориями без проверки;
  • копировать типовой robots.txt с другого сайта;
  • использовать файл для защиты приватных данных;
  • перечислять сотни URL вместо исправления генерации дублей.

Частые вопросы

Можно ли удалить страницу из Google через robots.txt?

Нет. Disallow ограничивает обход, но известный по ссылкам URL может остаться в поиске.

Что лучше: Disallow или noindex?

Disallow — для ограничения обхода, noindex — для удаления доступной роботу страницы из поиска.

Можно ли одновременно использовать Disallow и noindex?

Не рассчитывайте на такую связку: заблокированный робот не увидит noindex.

Нужно ли закрывать страницы пагинации?

Не автоматически. Сначала проверьте архитектуру и доступность товаров или материалов по ссылкам.

Нужно ли закрывать фильтры?

Технические комбинации — часто да; полноценные SEO-посадочные — нет.

Нужно ли закрывать UTM-метки?

Не обязательно через Disallow. Для Яндекса подходит Clean-param; также проверьте canonical и внутренние ссылки.

Можно ли закрывать CSS и JavaScript?

Не закрывайте ресурсы, необходимые поисковику для нормального рендеринга.

Нужно ли указывать Sitemap в robots.txt?

Да, это стандартный способ сообщить поисковикам адрес карты сайта.

Что произойдёт, если robots.txt отсутствует?

Роботы обычно считают, что ограничений обхода нет. Важно, чтобы отсутствие файла не маскировалось ошибочной серверной конфигурацией.

Источники

Технические рекомендации сверены с официальной документацией:

Читать также