Типичные ошибки robots.txt — случайный запрет важных страниц, неверный путь к файлу, некорректные группы User-agent, конфликтующие правила и попытка управлять индексацией через Disallow. Такие недочёты мешают поисковым роботам сканировать сайт, затрудняют обнаружение нового контента и могут снизить полноту данных в поисковых системах.
В этом руководстве разберём, как работает robots.txt, какие правила особенно опасны и как проверить файл перед публикацией. В конце статьи — последовательный чек-лист аудита, который подходит для корпоративных сайтов, интернет-магазинов, сервисов и контентных проектов.
Что контролирует robots.txt и чего он не делает
Robots.txt — текстовый файл с инструкциями для поисковых роботов. Он должен находиться в корне сайта и быть доступен по адресу вида https://site.ru/robots.txt. Правила файла определяют, какие URL конкретному роботу разрешено или запрещено сканировать.
Важно различать сканирование и индексацию. Disallow ограничивает обход URL, но не гарантирует удаление страницы из поиска. Если поисковая система узнает адрес из внешней ссылки, карты сайта или другого источника, URL может остаться в индексе без содержимого и нормального сниппета.
Для запрета индексации доступной страницы обычно применяют метатег robots со значением noindex или соответствующий HTTP-заголовок. При этом поисковому роботу нельзя запрещать сканирование такой страницы через robots.txt: иначе он не увидит указание noindex.
Файл также не подходит для защиты конфиденциальной информации. Robots.txt доступен всем посетителям, а соблюдение его правил зависит от конкретного робота. Закрытые документы, административные интерфейсы и персональные данные необходимо защищать авторизацией и настройками сервера.
Ошибки в расположении, доступности и синтаксисе файла
Даже правильные директивы не принесут пользы, если робот не может получить файл или однозначно интерпретировать его содержимое.
Файл размещён не в корне сайта
Адреса вида /catalog/robots.txt или /files/robots.txt не управляют обходом соответствующих каталогов. Рабочий robots.txt размещают только в корне конкретного протокола и хоста. Поддомены также требуют собственных файлов: правила основного домена автоматически на них не распространяются.
Сервер возвращает неправильный ответ
Проверьте не только наличие текста в браузере, но и HTTP-статус. Файл должен стабильно открываться без циклических перенаправлений и серверных ошибок. Реакция поисковых систем на недоступный robots.txt зависит от статуса ответа и продолжительности сбоя, поэтому ошибку нельзя считать безобидной.
Отдельная проблема — подмена файла HTML-страницей. Например, сервер может вернуть шаблон страницы 404 со статусом 200. Для пользователя адрес формально открывается, но робот получает не инструкции, а постороннюю разметку.
Нарушена структура групп
Правила объединяются в группы, каждая из которых начинается с директивы User-agent. После неё идут Allow и Disallow для выбранного робота. Пустые строки, комментарии и дублирование групп сами по себе не всегда создают ошибку, но усложняют чтение и повышают риск противоречий.
Безопасная базовая структура для сайта без ограничений выглядит так:
User-agent: *
Disallow:
Пустое значение Disallow означает отсутствие запрета. Строка Disallow: /, напротив, закрывает от сканирования весь сайт для указанной группы.
Используются нестандартные или устаревшие директивы
Поддержка отдельных команд различается между поисковыми роботами. Не стоит рассчитывать, что неизвестная директива будет обработана одинаково всеми системами. Особенно опасно использовать robots.txt для указания noindex: такая команда не является универсальным способом исключения страниц из поиска.
Перед применением специфической директивы следует проверить документацию целевой поисковой системы. Критически важные ограничения лучше реализовывать средствами, назначение которых не зависит от добровольного соблюдения robots.txt.
Опасные запреты и конфликты правил
Наиболее серьёзные ошибки robots.txt возникают не из-за опечаток, а из-за слишком широких масок. Одно короткое правило может ограничить обход тысяч полезных URL.
| Ошибка | Возможное последствие | Что проверить |
|---|---|---|
| Disallow: / | Запрет сканирования всего сайта для группы роботов | Не осталось ли правило после разработки или технических работ |
| Запрет общего фрагмента URL | Под ограничение попадают полезные страницы с таким же фрагментом | Все типы URL, совпадающие с шаблоном |
| Закрытие каталога со стилями и скриптами | Робот не может полноценно отрисовать и оценить страницы | Доступность CSS, JavaScript, изображений и API, необходимых для контента |
| Одновременные Allow и Disallow | Результат отличается от ожидаемого из-за приоритета более конкретного правила | Проверку каждого важного URL в инструментах поисковых систем |
| Правило добавлено не в ту группу | Ограничение применяется к другому роботу или не применяется вовсе | Границы групп User-agent и отсутствие случайных дублей |
Случайное закрытие сайта после переноса
На тестовой площадке полный запрет обхода может быть оправдан как дополнительная мера, хотя сам по себе robots.txt не защищает стенд от доступа. Ошибка возникает, когда файл вместе с проектом переносят на основной домен и оставляют Disallow: /.
Проверка robots.txt должна входить в обязательный список действий перед запуском сайта, сменой CMS, переносом домена и крупным релизом. Полагаться только на визуальную проверку страниц нельзя: сайт может корректно работать для пользователей и одновременно быть закрыт для роботов.
Неверное понимание приоритета правил
При наличии нескольких подходящих правил учитывается не просто порядок строк. Для распространённых поисковых роботов важна специфичность совпадения, а при равной длине разрешающее правило может получить приоритет. Особенности обработки групп и шаблонов следует проверять для каждой целевой системы.
Не пытайтесь мысленно рассчитать сложный набор из десятков пересекающихся масок. Чем критичнее раздел, тем важнее протестировать реальные URL: главную страницу, карточку товара, категорию, статью, фильтр, пагинацию и служебный адрес.

Ошибки при закрытии параметров, фильтров и ресурсов
Интернет-магазины и крупные каталоги часто ограничивают обход URL с фильтрами, сортировками, метками и параметрами. Задача разумна, но универсальное правило для всех проектов отсутствует. Некоторые параметрические страницы бесполезны, а другие отвечают на самостоятельный спрос и должны оставаться доступными.
Все URL с параметрами запрещены одной маской
Широкий запрет адресов со знаком вопроса может затронуть страницы пагинации, языковые версии, отслеживаемые переходы и URL, через которые робот обнаруживает товары. До добавления маски составьте список параметров и определите функцию каждого из них.
- Сортировка и изменение вида обычно не создают самостоятельной ценности для поиска.
- Фильтры могут быть как техническими дублями, так и полезными посадочными страницами.
- Пагинация участвует в доступе к элементам каталога, поэтому её нельзя закрывать без анализа внутренней перелинковки.
- UTM-метки не всегда требуют блокировки в robots.txt: проблему дублей также решают консистентные канонические адреса и внутренние ссылки без меток.
Закрыты CSS, JavaScript или изображения
Современные сайты нередко загружают основной текст, навигацию или карточки через JavaScript. Если робот не получает необходимые файлы, отрисованная версия страницы может отличаться от пользовательской. Запрет технического каталога нельзя оценивать только по его названию: внутри могут находиться ресурсы, необходимые для отображения контента.
Открывать абсолютно все служебные файлы тоже необязательно. Решение принимают по функции ресурса: нужен ли он для загрузки основного содержимого, навигации, мобильной версии и понимания страницы.
Вместо устранения дублей используется только Disallow
Запрет обхода не объединяет сигналы дублей и не назначает канонический URL. Если несколько адресов показывают одинаковый контент, сначала определяют предпочтительную версию, приводят к ней внутренние ссылки и настраивают подходящие технические сигналы. Robots.txt может снижать нежелательное сканирование, но не заменяет системную работу с архитектурой сайта.
Карта сайта и служебные настройки
В robots.txt можно указать адрес XML-карты через директиву Sitemap. Распространённая ошибка — оставить ссылку на тестовый домен, HTTP-версию, удалённый файл или старую структуру после переезда.
Карта сайта должна открываться, содержать предпочтительные индексируемые URL и регулярно обновляться, если контент проекта меняется. Не следует включать в неё страницы, которые запрещены в robots.txt, перенаправляют посетителя, возвращают ошибку или помечены как неиндексируемые. Такое противоречие отправляет поисковой системе взаимоисключающие сигналы.
Наличие строки Sitemap не гарантирует индексацию перечисленных адресов. Карта помогает обнаруживать URL, но поисковая система самостоятельно оценивает доступность, каноничность и качество страниц.
Некоторые CMS и SEO-модули генерируют robots.txt динамически. В таком случае редактирование физического файла может не изменить фактический ответ сервера. После каждой настройки открывайте публичный URL и проверяйте именно тот текст, который получает посетитель.

Чек-лист проверки robots.txt
Проверку лучше проводить по этапам: от доступности файла к отдельным шаблонам URL. Такой порядок помогает сначала исключить критические ошибки, а затем перейти к локальным ограничениям.
- Откройте файл на основном домене. Проверьте протокол, поддомен, отсутствие лишнего пути и корректный HTTP-ответ.
- Сравните версии сайта. Убедитесь, что правила настроены отдельно для нужных хостов и не остались только на старом домене.
- Найдите полный запрет. Просмотрите все группы User-agent и исключите случайный Disallow: / на рабочем сайте.
- Проверьте важные типы страниц. В список должны войти главная, категории, карточки, услуги, статьи, контакты и другие посадочные страницы.
- Проверьте служебные URL. Оцените корзину, личный кабинет, внутренний поиск, сортировки, фильтры, параметры и результаты авторизации.
- Разберите пересекающиеся правила. Для каждой пары Allow и Disallow протестируйте несколько реальных адресов, а не только шаблон каталога.
- Проверьте ресурсы отрисовки. Убедитесь, что робот может загрузить файлы, необходимые для основного контента и навигации.
- Сопоставьте robots.txt с метатегами. Страницы с noindex должны быть доступны для сканирования, пока робот не увидит директиву.
- Проверьте Sitemap. Адрес карты должен быть актуальным, доступным и относиться к нужному сайту.
- Используйте инструменты вебмастеров. Проверьте обработку приоритетных и спорных URL для целевых поисковых систем.
- Зафиксируйте изменения. Сохраните предыдущую версию, дату правки и причину каждого нового правила.
- Контролируйте результат после публикации. Отслеживайте статистику обхода, отчёты об индексации, серверные логи и доступность важных страниц.
Не удаляйте все ограничения только потому, что структура файла кажется сложной. Резкое открытие большого числа фильтров и технических URL способно увеличить нагрузку на сервер и расход ресурсов сканирования. Сначала классифицируйте правила, затем меняйте их небольшими логическими группами.
Частые вопросы
Можно ли запретить индексацию страницы через robots.txt?
Robots.txt управляет прежде всего сканированием и не гарантирует исключение URL из поиска. Для доступной страницы применяют поддерживаемый метатег robots или HTTP-заголовок noindex, не закрывая адрес от робота до обработки директивы.
Нужен ли robots.txt небольшому сайту?
Даже небольшой сайт должен иметь понятный и корректно доступный файл. Если ограничивать нечего, достаточно группы для всех роботов без запрещающих путей и, при необходимости, актуального адреса Sitemap.
Нужно ли закрывать административную панель?
Ограничить её обход можно, но robots.txt не обеспечивает безопасность. Административный интерфейс необходимо защищать авторизацией, ограничениями доступа и настройками сервера.
Как быстро поисковые системы увидят изменения?
Срок зависит от частоты обращения робота к сайту и правил конкретной поисковой системы. После изменения следует проверить доступность файла и наблюдать за обработкой URL в инструментах вебмастеров, не ожидая мгновенного пересмотра всех страниц.
Можно ли использовать один robots.txt для домена и поддоменов?
Нет, робот запрашивает файл на конкретном хосте. Для основного домена и каждого индексируемого поддомена нужны отдельные доступные настройки.
Почему страница остаётся в поиске после добавления Disallow?
Запрет сканирования не равен удалению из индекса. Поисковая система может знать URL из ссылок или карты сайта, но не иметь доступа к содержимому и метатегу noindex.
Что делать после обнаружения ошибки
Сначала оцените масштаб: какие шаблоны затронуты, относятся ли они к важным посадочным страницам и как давно действует правило. Затем подготовьте минимальное исправление, проверьте его на наборе контрольных URL и только после этого публикуйте.
После исправления не ограничивайтесь повторным открытием robots.txt в браузере. Проверьте HTTP-ответ, доступность страниц для нужного User-agent, отчёты поисковых систем и серверные логи. Если ошибка связана с архитектурой, дублями или параметрами, изменение одного файла не устранит первопричину.
Когда правила пересекаются, сайт работает на нескольких поддоменах или число технических URL постоянно растёт, robots.txt стоит проверять в рамках комплексного SEO-продвижения сайта. Такой подход позволяет связать ограничения обхода с каноническими адресами, картами сайта, внутренней перелинковкой и фактической индексацией.


