Короткий ответ. PDF и офисные документы могут быть отдельными результатами поиска. Оставляйте в индексе то, что человек действительно ищет как самостоятельный документ. Если файл только дополняет или дублирует HTML-страницу, управляйте его индексированием — иначе поисковик может показать PDF вместо нужной страницы сайта.

Какие документы поисковики индексируют

Google способен индексировать PDF и другие доступные ему текстовые документы. Яндекс указывает PDF, DOC/DOCX, XLS/XLSX, PPT/PPTX, ODT/ODS/ODP, RTF и TXT среди поддерживаемых форматов. Для Яндекса действует ограничение: документы больше 10 МБ в поиск не попадают.

Для PDF важен текстовый слой. Яндекс полностью обрабатывает PDF с текстом; в файле, состоящем только из изображений, полноценного текста для поиска нет, а обрабатываются лишь первые три страницы.

Когда PDF стоит оставлять в индексе

Главный вопрос: может ли пользователь захотеть найти именно этот документ, а не страницу, с которой его скачивают? Если да — PDF может быть полезным самостоятельным результатом.

  • инструкции к оборудованию и руководства;
  • техническая документация и спецификации;
  • исследования, нормативные материалы и официальные отчёты;
  • каталоги и презентации, которые содержат самостоятельную ценность;
  • актуальный прайс-лист, если его действительно ищут как документ.
ДокументИндексировать?Почему
Инструкция к оборудованиюЧасто даЕё ищут и используют отдельно от сайта.
Полезный технический PDFДаОн может отвечать на самостоятельный запрос.
Дубль статьи в PDFОбычно нетСоздаёт конкуренцию с HTML-версией.
PDF-версия коммерческой услугиОбычно нетОсновной результат лучше оставить HTML-странице.
Старый прайсНетОн устарел и может ввести посетителя в заблуждение.
Архивный официальный документПо ситуацииОценивайте историческую и поисковую ценность.

Когда PDF лучше не индексировать

Не каждый доступный файл нужен в поиске. Обычно нет смысла индексировать PDF, который полностью повторяет HTML-страницу, создан только для печати или скачивания, является старой версией прайса, внутренней презентацией, шаблоном договора или автоматически созданной копией.

Сам факт наличия файла на сайте не делает его посадочной страницей. Отдельный URL без навигации, понятного действия и адаптивного интерфейса часто проигрывает HTML-странице в работе с посетителем.

Главная проблема: PDF конкурирует с HTML-страницей

Представьте два URL с почти одинаковым содержанием: /services/seo-audit/ и /files/seo-audit.pdf. Поисковик может выбрать PDF как результат по тому же намерению пользователя. Но в PDF обычно нет нормальной навигации, формы обращения, связанных услуг и других элементов, которые помогают посетителю разобраться и оставить заявку.

Для услуг, категорий, товаров и других коммерческих страниц HTML почти всегда должен быть главным форматом. PDF здесь — дополнение, а не замена основной страницы.

Как закрыть PDF от индексации

У PDF нет HTML-раздела <head>, поэтому добавить внутрь файла обычный <meta name="robots" content="noindex"> нельзя. Для не-HTML ресурсов используется HTTP-заголовок X-Robots-Tag: noindex.

HTTP/1.1 200 OK   Content-Type: application/pdf   X-Robots-Tag: noindex

Такое правило можно задать для отдельного файла или для группы документов на уровне веб-сервера. Важно оставить файл доступным роботу: чтобы убрать уже известный PDF из поиска, поисковик должен получить документ и прочитать заголовок.

Почему robots.txt не решает эту задачу

Если сначала запретить доступ к PDF в robots.txt, робот может не увидеть X-Robots-Tag: noindex. Запрет обхода и запрет индексирования — разные задачи. Поэтому при удалении уже известного документа из поиска не блокируйте его в robots.txt до того, как робот обработает noindex.

Можно ли поставить canonical на PDF

Да. Для Google канонический адрес можно передать HTTP-заголовком Link. Это полезно, когда PDF и HTML содержат один материал, но в поиске должна остаться HTML-версия.

Link: <https://example.ru/page/>; rel="canonical"

Не ставьте canonical механически на каждый PDF. Самостоятельная инструкция или технический документ может и должен оставаться собственным результатом. Canonical нужен для реальных дублей, а не как универсальный запрет.

Что делать, если PDF уже ранжируется вместо страницы

  1. Сравните намерение запроса и содержание PDF с HTML-страницей.
  2. Решите, нужен ли этот документ пользователю именно в поиске.
  3. Если не нужен — отдайте для него X-Robots-Tag: noindex.
  4. Если PDF повторяет HTML — рассмотрите HTTP canonical на HTML-адрес.
  5. Усильте внутренние ссылки на HTML-страницу и уберите дублирующий PDF из Sitemap.
  6. Дождитесь повторного обхода и проверьте фактический результат в Google и Яндексе.

Старые версии документов

У каталогов и прайсов часто накапливаются версии вроде catalog-2024.pdf, catalog-2025.pdf и catalog-2026.pdf. Если посетителю нужна только актуальная версия, не держите десятки старых документов в индексе: обновите ссылки, закройте или удалите ненужные файлы. Исторически или юридически значимые версии можно сохранить отдельно — но с ясным обозначением статуса.

Как проверить индексирование документов

  1. Проверьте код ответа, доступность и корректный Content-Type.
  2. Посмотрите HTTP-заголовки: X-Robots-Tag и, при необходимости, Link: rel="canonical".
  3. Убедитесь, что файл не закрыт в robots.txt, когда робот должен увидеть noindex.
  4. Проверьте текстовый слой PDF и качество документа на мобильном устройстве.
  5. Сверьте внутренние ссылки, Sitemap и наличие HTML-дубля.
  6. Проверьте, какой URL фактически показывают Google и Яндекс.
Простое правило выбора

Пользователь ищет именно документ? → оставить в индексе.

Документ дублирует HTML? → HTML сделать главным, для PDF использовать noindex или canonical по ситуации.

Документ нужен пользователям, но не поиску? → X-Robots-Tag: noindex.

«PDF я бы не закрывал или открывал для поиска по одному признаку формата. Техническая инструкция может отлично отвечать на запрос и быть полезным результатом. А PDF-копия коммерческой страницы иногда только мешает, потому что поисковик начинает показывать документ вместо страницы, где человек может нормально изучить услугу и оставить заявку».
Константин Шипилов

Константин Шипилов

SEO-специалист, основатель Шипилов SEO

Что не делать

  • закрывать все PDF только потому, что это не HTML;
  • публиковать PDF-копию каждой страницы сайта и индексировать обе версии;
  • пытаться добавить meta robots внутрь PDF;
  • закрывать файл robots.txt и ждать, что поисковик прочитает его X-Robots-Tag;
  • оставлять старые прайсы и каталоги в индексе без необходимости;
  • использовать PDF вместо нормальной коммерческой посадочной страницы;
  • публиковать важные документы исключительно сканами без текстового слоя;
  • добавлять служебные и noindex PDF в Sitemap.

Частые вопросы

Индексирует ли Google PDF?

Да. Для запрета индексирования не-HTML файлов Google рекомендует HTTP-заголовок X-Robots-Tag.

Индексирует ли Яндекс PDF?

Да, а также ряд офисных и текстовых форматов. Документы больше 10 МБ в индекс не попадают.

Можно ли закрыть PDF через noindex?

Да: передайте X-Robots-Tag: noindex в HTTP-ответе файла.

Работает ли canonical для PDF?

Google поддерживает rel="canonical" в HTTP-заголовке Link для не-HTML документов.

Нужно ли добавлять PDF в Sitemap?

Только если это важный самостоятельный документ, который должен индексироваться.

Что лучше для SEO: HTML или PDF?

Для коммерческой страницы обычно HTML: в нём есть навигация, адаптивный интерфейс и понятные действия для посетителя.

Индексируется ли текст в сканированном PDF?

Текстовый слой индексируется; текст только внутри изображений обрабатывается иначе и не равнозначен обычному тексту документа.

Что делать, если PDF ранжируется вместо страницы?

Оценить его пользу, при необходимости закрыть X-Robots-Tag: noindex или указать HTML как каноническую версию через HTTP-заголовок.

Нужно ли индексировать прайс-листы?

Только актуальные и действительно полезные как самостоятельный документ; старые прайсы обычно лучше исключить из поиска.

Источники

Читать также