Robots.txt против Noindex: в чём разница (и когда что использовать)
Блокировка страницы в robots.txt и добавление тега noindex делают совершенно разные вещи — использование не того способа — частая причина того, что страница случайно застревает в результатах поиска или полностью из них исчезает.
Они решают две разные проблемы
robots.txt управляет сканированием — разрешено ли боту поисковой системы вообще получать доступ к URL. Тег noindex управляет индексацией — может ли страница, которая была просканирована, появляться в результатах поиска. Путаница между ними — одна из самых частых причин того, что страница застревает в результатах поиска, когда вы хотели её убрать, или остаётся невидимой, когда вы действительно хотели, чтобы её нашли.
Что на самом деле делает robots.txt
Правило Disallow в robots.txt просит добросовестные сканеры не получать доступ к URL. Оно не удаляет уже проиндексированную страницу. Если Google проиндексировал URL до его блокировки — или обнаружил его по ссылке откуда-то ещё и проиндексировал только сам URL и анкорный текст, ни разу не получив доступ к странице, — он может продолжать бесконечно показывать этот URL в результатах, обычно без заголовка или описания, поскольку Google соблюдает блокировку и никогда не пересканирует страницу для проверки.
Что на самом деле делает noindex
Тег <meta name="robots" content="noindex"> (или эквивалентный HTTP-заголовок X-Robots-Tag) прямо сообщает сканеру, который уже получил доступ к странице: вы можете это прочитать, просто не добавляйте это в индекс. Это надёжный способ убрать страницу из результатов поиска — но только если сканеру действительно разрешено получить доступ к странице и увидеть тег.
Классическая ошибка: блокировка страницы, для которой одновременно задан noindex
Если URL заблокирован в robots.txt и имеет тег noindex, тег noindex никогда не считывается — сканеру было велено вообще не обращаться к странице, поэтому он никогда не видит инструкцию, находящуюся на этой странице. Страница может оставаться проиндексированной (если уже была, или получает ссылку откуда-то ещё), и у Google нет способа узнать иначе, поскольку удаление требует прочтения тега, доступ к чтению которого заблокирован. Это действительно распространённый способ, которым сайты случайно оставляют малоценные страницы застрявшими в результатах поиска на месяцы.
Когда использовать robots.txt
- Управление бюджетом сканирования на крупных сайтах — удержание сканеров подальше от малоценных путей с большим объёмом (результаты внутреннего поиска, комбинации фасетных фильтров), чтобы они тратили больше времени на действительно важные страницы.
- Полная блокировка тестовых окружений, административных маршрутов и конечных точек API.
- Страницы, которые вы вообще никогда не хотите сканировать — даже чтобы проверить их содержимое, — поскольку само сканирование расходует ресурсы с обеих сторон.
Когда использовать noindex
- Страницы, которые должны существовать и быть доступными для сканирования — для внутренних ссылок, для пользователей, для структуры сайта — но никогда не должны появляться в результатах поиска: архивы тегов/категорий, страницы пагинации после первой, страницы благодарности.
- Скудный или дублирующийся контент, который вы пока не готовы удалить полностью, но к которому всё ещё хотите оставить доступ для посетителей и внутренних инструментов.
- Удаление уже проиндексированной страницы — это работает, только если страница остаётся доступной для сканирования, чтобы Google действительно мог увидеть тег.
Быстрое правило принятия решения
Спросите себя: нужно ли сканеру прочитать эту страницу, чтобы понять, что с ней делать? Если инструкция зависит от того, будет ли увидено содержимое самой страницы (как тег noindex), robots.txt должен разрешать сканирование. Если вы хотите предотвратить само сканирование — независимо от содержимого страницы, — robots.txt — правильный инструмент, а noindex избыточен, поскольку он всё равно никогда не будет прочитан. Для контента, который доступен для сканирования и является дублирующим, а не полностью нежелательным, канонический тег часто подходит лучше, чем любой из этих двух вариантов.
Хотите, чтобы новая страница была найдена быстрее, чем при обычном органическом сканировании?
IndexLaunch мгновенно отправляет каждый добавленный вами URL напрямую в Bing, Yandex, Seznam и Naver через IndexNow, как только вы ставите его в очередь.
Смотреть тарифы