Метатег robots и заголовок X-Robots-Tag: руководство по управлению индексированием
Любой сайт — это сложная система страниц, файлов, ссылок и технических разделов. Чтобы SEO-продвижение работало эффективно, важно управлять тем, какие материалы поисковые системы могут индексировать, а какие лучше исключить из выдачи.
Иногда нужно скрыть от поиска служебные страницы, дубли, результаты фильтрации, документы или файлы. В других случаях важно разрешить индексацию страницы, но ограничить переход по ссылкам или управление сниппетом.
Для этих задач используют два основных инструмента: метатег robots и HTTP-заголовок X-Robots-Tag. Они помогают сообщить поисковым системам, как обрабатывать конкретную страницу или файл: добавлять в индекс, исключать из выдачи, переходить по ссылкам или не учитывать их.
При правильной настройке эти директивы помогают контролировать индексацию сайта и снижать риск появления технических страниц в поиске. Ошибки, наоборот, могут привести к потере трафика: например, если на важной категории или карточке товара случайно установлен noindex, страница может исчезнуть из результатов поиска.
Что такое метатег robots и как он работает
Метатег robots — это HTML-инструкция для поисковых роботов, которая сообщает, как обрабатывать конкретную страницу. Он размещается в коде страницы, обычно внутри блока <head>.
Пример:
<meta name="robots" content="noindex, follow">
В этом примере поисковая система получает две инструкции:
- noindex — не добавлять страницу в индекс;
- follow — разрешить переход по ссылкам на странице.
Метатег robots применяется именно к HTML-страницам. Он удобен, когда нужно управлять индексацией отдельных страниц сайта: карточек, категорий, служебных разделов, страниц фильтров, пагинации, результатов поиска по сайту.
Google указывает, что правило noindex можно задавать через meta-тег или через HTTP-заголовок, а для удаления страницы из поиска поисковый робот должен иметь возможность зайти на страницу и прочитать эту директиву.
Как поисковики обрабатывают meta robots
Когда поисковый робот заходит на страницу, он анализирует HTML-код и проверяет наличие метатега robots. Если указан noindex, страница не должна попадать в поисковый индекс. Если указан nofollow, поисковику передается инструкция не переходить по ссылкам на этой странице.
Основные варианты директив:
- index — разрешить индексацию страницы;
- noindex — запретить индексацию страницы;
- follow — разрешить переход по ссылкам;
- nofollow — не переходить по ссылкам на странице;
- none — сокращенная запись для noindex, nofollow.
Важно понимать: robots.txt, meta robots и X-Robots-Tag решают разные задачи.
robots.txt управляет доступом поискового робота к URL.
meta robots управляет индексацией HTML-страницы.
X-Robots-Tag управляет индексацией через HTTP-заголовок и подходит в том числе для файлов.
Если страница закрыта от обхода в robots.txt, поисковый робот может не увидеть метатег noindex, потому что не сможет зайти на страницу. Google прямо указывает, что в таком случае страница может продолжать появляться в поиске, например если на нее ведут ссылки с других сайтов.
Яндекс также указывает, что если страница запрещена в robots.txt, метатег или заголовок с директивой не применяются.
Метатег robots используют, чтобы:
- исключить страницу из поиска;
- оставить страницу доступной пользователям, но скрыть ее от индексации;
- управлять переходом поисковых роботов по ссылкам;
- закрыть служебные страницы;
- убрать из выдачи дублирующий или малоценный контент;
- ограничить индексацию страниц фильтров, сортировок и внутренних результатов поиска.
Для PDF, изображений, видео и других не-HTML-файлов метатег robots не подходит. Для таких ресурсов используют X-Robots-Tag. Google отдельно указывает, что для блокировки индексации не-HTML-ресурсов, например PDF, видео или изображений, нужно использовать HTTP-заголовок X-Robots-Tag.
Как управлять индексацией страницы через метатег robots
С помощью метатега robots можно разрешать или запрещать индексацию страницы, а также управлять обработкой ссылок.
|
Директива |
Что делает |
Когда применять |
Пример кода |
|
index, follow |
Разрешает индексацию страницы и переход по ссылкам |
Для важных страниц сайта: категорий, карточек товаров, услуг, статей |
<meta name="robots" content="index, follow"> |
|
noindex, follow |
Запрещает индексацию страницы, но разрешает переход по ссылкам |
Для страниц, которые не должны быть в поиске, но содержат важные внутренние ссылки |
<meta name="robots" content="noindex, follow"> |
|
noindex, nofollow |
Запрещает индексацию страницы и переход по ссылкам |
Для служебных страниц, закрытых разделов, страниц без SEO-ценности |
<meta name="robots" content="noindex, nofollow"> |
|
none |
То же самое, что noindex, nofollow |
Когда нужно коротко записать полный запрет |
<meta name="robots" content="none"> |
|
nofollow |
Разрешает индексацию страницы, но запрещает переход по ссылкам |
Если страница может индексироваться, но ссылки на ней не нужно учитывать |
<meta name="robots" content="nofollow"> |
|
noarchive |
Запрещает показывать сохраненную копию страницы |
Для страниц с часто меняющейся или чувствительной информацией |
<meta name="robots" content="noarchive"> |
|
nosnippet |
Запрещает показывать текстовый сниппет в выдаче |
Если не нужно, чтобы поисковик формировал фрагмент текста из страницы |
<meta name="robots" content="nosnippet"> |
Если метатег robots отсутствует, поисковые системы обычно считают, что страницу можно индексировать, а ссылки на ней можно обрабатывать.
То есть поведение по умолчанию соответствует: <meta name="robots" content="index, follow">
Чтобы проверить, какие правила установлены на странице, можно открыть исходный код страницы в браузере:
- Перейдите на нужную страницу.
- Нажмите правой кнопкой мыши.
- Выберите «Просмотреть код страницы».
- Используйте поиск по странице: Ctrl+F или Cmd+F.
- Найдите robots.
Также можно использовать SEO-сканеры: Screaming Frog, Netpeak Spider, Sitebulb и другие инструменты. Они позволяют массово проверить метатеги robots на всем сайте и быстро найти страницы с ошибочными директивами.
Как правильно использовать метатег robots и не навредить своему сайту
Метатег robots — точный инструмент управления индексацией. Его нужно использовать аккуратно, потому что одна неверная директива может убрать из поиска важные страницы.
Где должен находиться метатег
Корректный и безопасный вариант — размещать метатег robots внутри блока <head> HTML-документа.
Пример:
<head>
<meta name="robots" content="noindex, follow">
</head>
Не стоит добавлять его случайно в тело страницы или через нестабильные скрипты. Даже если отдельные поисковые системы могут обработать директиву в нетипичном месте, для SEO безопаснее использовать стандартное размещение в <head>.
Что будет, если поставить noindex на важной странице
Если на важной странице случайно установлен noindex, она может быть исключена из индекса.
Это критично для:
- главной страницы;
- категорий каталога;
- карточек товаров;
- страниц услуг;
- посадочных страниц;
- статей, которые привлекают органический трафик.
Например, если на страницу категории интернет-магазина случайно добавить:
<meta name="robots" content="noindex, nofollow">
поисковая система может перестать показывать эту категорию в выдаче. В результате сайт потеряет часть органического трафика и заявок.
Поэтому после любых технических доработок сайта важно проверять:
- главную страницу;
- основные категории;
- коммерческие страницы;
- страницы с высоким трафиком;
- шаблоны карточек товаров;
- шаблоны статей.
Можно ли закрыть страницу от индексации через robots.txt
Использовать robots.txt как основной способ запрета индексации страницы — ошибка.
robots.txt запрещает или разрешает обход URL, но не является надежным способом удалить страницу из поиска.
Например:
User-agent: *
Disallow: /private-page/
Такой запрет не дает роботу зайти на страницу. Но если страница уже была известна поисковой системе или на нее ведут внешние ссылки, URL может продолжать отображаться в результатах поиска без содержимого.
Google указывает: чтобы страница не появлялась в результатах поиска, нужно использовать noindex, защитить страницу авторизацией или удалить ее полностью. Блокировка через robots.txt не является надежным способом убрать URL из выдачи.
Правильный вариант для HTML-страницы: <meta name="robots" content="noindex, follow">
Но при этом страница должна быть доступна для обхода. Если она одновременно закрыта в robots.txt, поисковик может не увидеть директиву noindex.
Как настроить X-Robots-Tag
X-Robots-Tag — это HTTP-заголовок, который передается сервером вместе с ответом на запрос.
Он работает не в HTML-коде страницы, а на уровне серверного ответа.
Пример HTTP-заголовка:
X-Robots-Tag: noindex, nofollow
X-Robots-Tag используют, когда нужно управлять индексацией:
- PDF-файлов;
- изображений;
- видео;
- документов;
- архивов;
- динамически отдаваемых файлов;
- большого количества страниц или файлов по шаблону.
Главное преимущество X-Robots-Tag — возможность массово управлять индексацией ресурсов, в которые нельзя добавить HTML-метатег.
Например, в PDF-документ нельзя вставить обычный <meta name="robots">, поэтому для него используется HTTP-заголовок. Google поддерживает X-Robots-Tag и приводит его как способ управлять индексацией через HTTP-ответ.
Как запретить индексацию всех PDF на сайте
Если PDF-документы не должны появляться в поиске, можно настроить X-Robots-Tag на сервере.
Задача для разработчика может звучать так:
Закрыть от индексации все PDF-файлы с помощью HTTP-заголовка X-Robots-Tag: noindex, чтобы они не отображались в поисковых системах.
Пример для Apache:
<FilesMatch "\.pdf$">
Header set X-Robots-Tag "noindex, nofollow"
</FilesMatch>
Пример для Nginx:
location ~* \.pdf$ {
add_header X-Robots-Tag "noindex, nofollow";
}
После настройки необходимо проверить, что заголовок действительно отдается сервером.
Это можно сделать через:
- DevTools в браузере;
- curl;
- Screaming Frog;
- Netpeak Spider;
- онлайн-сервисы проверки HTTP-заголовков.
Пример проверки через curl:
curl -I https://site.ru/file.pdf
В ответе должен присутствовать заголовок:
X-Robots-Tag: noindex, nofollow
Когда использовать X-Robots-Tag, а когда meta robots
|
Задача |
Что использовать |
|
Закрыть HTML-страницу от индексации |
Meta robots |
|
Закрыть PDF, изображение, видео или документ |
X-Robots-Tag |
|
Массово запретить индексацию файлов одного типа |
X-Robots-Tag |
|
Управлять индексацией отдельных страниц |
Meta robots |
|
Настроить правила на уровне сервера |
X-Robots-Tag |
|
Быстро проверить директиву в HTML-коде страницы |
Meta robots |
Если речь идет об обычной HTML-странице, чаще всего удобнее использовать meta robots.
Если нужно закрыть файлы, документы, изображения или настроить правило массово, лучше использовать X-Robots-Tag.
Какие ошибки могут быть при настройке индексации
Настройка meta robots и X-Robots-Tag кажется простой, но ошибки могут стоить сайту трафика.
Ниже — самые частые проблемы, которые мы встречаем при SEO-аудитах.
Запрет в robots.txt вместо noindex
Частая ошибка — пытаться закрыть страницу от индексации через robots.txt.
Неправильный вариант:
User-agent: *
Disallow: /private-page/
Если нужно убрать страницу из поиска, лучше использовать:
<meta name="robots" content="noindex, follow">
Но страница должна быть доступна для обхода, чтобы поисковик смог увидеть директиву.
Если страница уже закрыта в robots.txt, а на ней стоит noindex, поисковая система может не прочитать этот запрет. Google и Яндекс указывают, что при запрете обхода поисковый робот может не увидеть директивы на странице или в заголовке.
Использование noindex, nofollow на важных страницах
Иногда noindex или noindex, nofollow случайно попадает в шаблон важных страниц.
Например:
- категорий каталога;
- карточек товаров;
- страниц услуг;
- региональных посадочных страниц;
- статей блога.
Это может произойти после:
- переноса сайта;
- разработки нового шаблона;
- закрытия тестовой версии;
- неправильной настройки CMS;
- массовой правки метатегов.
Чтобы избежать проблемы, нужно регулярно проверять сайт в SEO-сканерах и отчетах индексации.
В Google Search Console такие ошибки можно отслеживать в отчете по индексированию страниц. Google также указывает, что для блокировки страницы в результатах поиска нужно использовать noindex, а не правило robots.txt.
Случайный noindex после разработки
Одна из самых опасных ошибок — перенос запрета индексации с тестового сайта на рабочий.
На тестовом домене часто устанавливают: <meta name="robots" content="noindex, nofollow">
Это нормально для dev-версии, но перед запуском сайта директиву нужно убрать.
Если забыть это сделать, новый сайт может не попасть в индекс или потерять уже существующие позиции.
Перед релизом обязательно проверяйте:
- главную страницу;
- основные шаблоны;
- robots.txt;
- HTTP-заголовки;
- canonical;
- sitemap.xml;
- доступность страниц для роботов.
Noindex на странице, закрытой в robots.txt
Если страница закрыта в robots.txt, поисковый робот не сможет зайти на нее и прочитать noindex. В результате запрет может не сработать так, как ожидается.
Правильная логика такая:
- Если нужно убрать HTML-страницу из индекса — откройте ее для обхода и добавьте noindex.
- Дождитесь переобхода страницы.
- Проверьте статус в Google Search Console или Яндекс Вебмастере.
- После удаления из индекса при необходимости можно закрывать страницу от обхода.
Для срочного удаления страницы из Google можно использовать инструмент удаления контента в Google Search Console. Google указывает, что Removals tool позволяет временно убрать страницу из результатов поиска быстрее, но для долгосрочного результата нужно устранить причину появления URL в поиске.
Отсутствие проверки X-Robots-Tag
Иногда X-Robots-Tag вроде бы настроен, но фактически не отдается сервером.
Причины могут быть разные:
- правило добавлено не в тот конфигурационный файл;
- сервер не применил изменения;
- заголовок работает только для части файлов;
- CDN перезаписывает заголовки;
- разные версии сайта отдают разные HTTP-ответы.
Чтобы избежать ошибки, нужно проверять заголовки после настройки. Проверять следует не только один файл, а несколько URL из разных разделов сайта.
Конфликт директив
На странице могут одновременно присутствовать разные сигналы:
- meta robots;
- X-Robots-Tag;
- canonical;
- robots.txt;
- редиректы;
- sitemap.xml.
Если сигналы противоречат друг другу, поисковым системам сложнее корректно обработать страницу.
Например:
- страница закрыта в robots.txt, но указана в sitemap.xml;
- на странице стоит noindex, но она продвигается внутренними ссылками;
- canonical указывает на URL, который закрыт от индексации;
- страница отдает X-Robots-Tag noindex, хотя должна быть в поиске.
Поэтому управление индексацией нужно проверять комплексно, а не по одному параметру.
Резюмируем
Правильная настройка индексации — важная часть технического SEO.
Meta robots и X-Robots-Tag помогают управлять тем, какие страницы и файлы должны появляться в поиске, а какие нужно исключить.
Главные правила:
- meta robots используем для HTML-страниц;
- X-Robots-Tag применяем для файлов, документов, изображений, видео и массовых правил на сервере;
- не используем robots.txt как основной способ удаления страниц из поиска;
- не закрываем страницу в robots.txt, если хотим, чтобы поисковик прочитал noindex;
- проверяем важные страницы после релиза и технических доработок;
- контролируем индексацию в Google Search Console и Яндекс Вебмастере;
- регулярно сканируем сайт SEO-инструментами;
- следим, чтобы директивы не конфликтовали между собой.
Правильно настроенная индексация помогает сохранить важные страницы в поиске, убрать лишние технические URL и снизить риски потери органического трафика.
Для SEO-продвижения это особенно важно: поисковые системы должны видеть именно те страницы, которые приносят пользу пользователям и бизнесу.