Файл robots.txt: как настроить и не закрыть от поиска нужные страницы
Файл robots.txt легко недооценить: он маленький, правится за пару минут, а последствия ошибки тянутся неделями. Достаточно одной строки, чтобы из поиска исчезли карточки товаров, страницы услуг или целый каталог, а владелец бизнеса заметил проблему только по падению заявок.
Обратная ситуация тоже неприятна: поисковые роботы тратят время на корзину, личный кабинет, результаты внутреннего поиска и бесконечные адреса с параметрами. Из-за этого важные страницы обходятся медленнее, а структура сайта для поисковика выглядит менее чёткой.
Что делает robots.txt, и чего от него ждать не стоит
Этот файл лежит в корне домена и даёт роботам инструкции, какие разделы обходить, а какие лучше пропустить. Его задача не в том, чтобы «спрятать всё лишнее», а в том, чтобы направить обход на страницы, которые реально должны приносить трафик и заявки.
Главная мысль: robots.txt управляет обходом, но не гарантирует удаление страницы из поиска. Если URL нужно скрыть наверняка, используют другой инструмент: мета-тег robots с noindex, пароль, код ответа 404 или 410, в зависимости от задачи.
Это различие критично. Если закрыть адрес от обхода, но на него есть внутренние или внешние ссылки, поисковик может всё равно знать о такой странице и иногда показывать её в выдаче без нормального описания. Для конфиденциальных файлов, тестовых разделов и служебных документов такой подход ненадёжен.
Ещё один важный момент, запрет обхода не исправляет дубль сам по себе. Если на сайте уже есть десятки похожих URL, одних строк в robots обычно мало. Нужно отдельно решать вопрос с каноническими адресами, структурой ссылок, параметрами и кодами ответа.
Чтобы не путать инструменты, удобно держать перед глазами простое сравнение.
| Задача | Инструмент | Когда подходит | Что важно помнить |
|---|---|---|---|
| Не тратить обход на служебные URL | robots.txt | Корзина, кабинет, внутренний поиск, админка | Страница всё ещё может быть известна поисковику по ссылкам |
| Убрать страницу из поиска, но оставить доступной пользователю | Мета-тег robots с noindex | Тонкие страницы, страница благодарности, временные посадочные | Робот должен иметь доступ к странице, иначе тег не прочитается |
| Объединить дубли | rel=canonical | Сортировки, параметры, похожие версии адресов | Не заменяет запрет обхода и не решает вопрос доступа |
| Убрать страницу совсем | Код ответа 404 или 410 | Удалённые товары, старые акции, неактуальные разделы | Нужны корректные ответы сервера и чистые внутренние ссылки |
| Закрыть от всех пользователей и роботов | Пароль или ограничение доступа на сервере | Тестовый сайт, личные документы, закрытый кабинет партнёров | Надёжнее, чем запись в robots.txt |
Когда robots.txt не решает задачу
Если вы хотите удалить старую страницу акции из поиска, закрыть персональные данные, спрятать коммерческое предложение в PDF или убрать дубль карточки товара, сам по себе robots для этого не лучший выбор. Он не удаляет содержание из интернета и не блокирует доступ пользователю.
На бизнес-сайтах это часто путают. Маркетолог формулирует задачу как «уберите это из поиска», разработчик ставит Disallow, владелец видит, что документ всё ещё открывается по прямой ссылке, и считает, что сайт настроен плохо. На самом деле просто выбран не тот инструмент.
Правильный порядок такой: сначала описать задачу человеческим языком, потом под неё подобрать техническое решение. Если цель, не тратить обход на служебные URL, подходит robots. Если цель, закрыть доступ кому угодно, нужен пароль. Если цель, удалить страницу из поиска, чаще помогают noindex или корректный код ответа.
Из каких директив состоит файл, и как они работают
В большинстве случаев достаточно четырёх директив. Чем короче и понятнее правила, тем меньше шанс ошибки при запуске сайта, редизайне или переносе на другой движок.
- User-agent, указывает, для какого робота действуют правила. Символ * означает всех роботов.
- Disallow, запрещает обход определённого пути или раздела.
- Allow, разрешает обход части раздела, если выше задан более широкий запрет.
- Sitemap, подсказывает адрес XML-карты сайта с важными URL.
Минимальный рабочий вариант для многих проектов выглядит так:
User-agent: * Disallow: /admin/ Disallow: /cart/ Disallow: /search/ Allow: /wp-content/uploads/ Sitemap: https://site.ru/sitemap.xml
Правило применяется к пути адреса, а не к смыслу страницы. Поэтому опаснее всего короткие и слишком общие запреты. Например, безобидная на вид строка для /s может задеть не только поиск по сайту, но и /services/ или другой важный раздел, если структура построена неаккуратно.
Если для одного робота есть и запрет, и разрешение, ориентируются на более конкретное правило. По этой причине Allow нужен не всегда. Его используют там, где вы осознанно открываете часть ранее закрытого раздела, а не просто добавляете строки «на всякий случай».
Не используйте экзотические и устаревшие директивы только потому, что встретили их в старой инструкции. То, что когда-то учитывал один поисковик, другой может игнорировать. Для типового сайта компании или интернет-магазина достаточно стандартных правил и понятной логики.
Важно помнить ещё две вещи. У каждого поддомена свой набор правил, поэтому для shop.site.ru и blog.site.ru нужен отдельный файл. И сам файл должен открываться по адресу /robots.txt с кодом ответа 200, без авторизации и лишних перенаправлений.
Какие страницы обычно закрывают, а какие нужно оставить открытыми
Логика простая: закрывают то, что не должно приводить трафик из поиска или создавать дубли, открывают то, что отвечает на спрос клиента. Но на практике многие действуют наоборот и режут целые шаблоны страниц «для порядка», не проверяя, что именно будет потеряно.
Что обычно закрывают
- Админку, страницы входа и внутренние панели. Они не нужны в выдаче и только тратят обход.
- Корзину, оформление заказа, сравнение, избранное и личный кабинет. Такие URL зависят от действий пользователя и не имеют самостоятельной поисковой ценности.
- Результаты внутреннего поиска по сайту. Они часто порождают сотни и тысячи тонких страниц с почти одинаковым содержимым.
- Тестовые разделы и черновые копии, если они доступны извне. Но для тестового сайта правильнее ещё и закрыть доступ паролем.
Что нельзя закрывать без проверки
Страницы услуг, категорий, карточки товаров, статьи, кейсы, разделы с вопросами и ответами, страницы брендов, полезные подборки, региональные посадочные, если они реально проработаны. Именно они чаще всего дают показы, переходы и заявки. Если закрыть их целиком по маске, вернуть позиции быстро не получится.
Аккуратно относитесь к файлам стилей, сценариям и изображениям. Когда поисковик не может нормально отрисовать страницу, ему сложнее оценить её качество, удобство и полноту. Старый совет закрывать почти весь технический контент давно приносит больше вреда, чем пользы.
Простой тест для владельца бизнеса такой: может ли эта страница ответить на вопрос клиента и привести его к заявке. Если да, она должна быть доступна для обхода. Если URL существует только потому, что его породил движок, его ценность нужно отдельно проверять.
Отдельная тема, фильтры и параметры
В интернет-магазинах и каталогах не все адреса с параметрами плохие. Часть из них создаёт мусор, а часть может быть полезной посадочной страницей, если у неё есть спрос, уникальный набор товаров и понятный текст. Поэтому правило «закрыть всё, где есть знак вопроса» почти всегда слишком грубое.
Если у вас десятки тысяч URL, решение принимают по типам страниц, а не вручную. Сначала определяют, какие комбинации фильтров реально нужны бизнесу и поиску, затем открывают только их, а остальное ограничивают точечно. Такой подход заметно безопаснее, чем массовый запрет по одному шаблону.
Как подход меняется для разных типов сайтов
Одинакового шаблона для всех проектов нет. Набор правил зависит от структуры, движка и от того, какие страницы должны получать поисковый трафик именно у вас.
Небольшой сайт услуг
На сайте на 10-30 страниц обычно всё просто: открыты главная, услуги, отраслевые или региональные посадочные, кейсы, статьи, контакты. Закрывают админку, страницу входа, технические формы и иногда страницу благодарности после отправки заявки, если она не должна индексироваться.
Главная ошибка здесь, закрыть целый раздел /services/ или /blog/ после редизайна, потому что разработчик использовал временное правило и забыл его убрать перед запуском. Снаружи сайт выглядит рабочим, а поисковик получает совсем другую картину.
Корпоративный сайт
У корпоративных сайтов часто есть разделы новостей, вакансий, документов, медиафайлов, формы для партнёров. Не каждый такой раздел стоит закрывать только потому, что он «служебный» с точки зрения компании. Если по документам, описаниям услуг или вакансиям есть целевой спрос, страница должна оставаться доступной для обхода.
Отдельно проверьте PDF, презентации и прайс-листы. Их нередко пытаются спрятать через robots, хотя задача на самом деле другая: либо убрать документ из публичного доступа, либо оставить его открытым как источник лидов. Для такой развилки нужна не одна строка в файле, а нормальное решение по доступу.
Интернет-магазин и каталог
Здесь robots влияет сильнее всего, потому что адресов много и лишний обход дорог. Обычно закрывают корзину, кабинет, сравнение, оформление заказа, результаты внутреннего поиска, часть URL с сортировкой и часть фильтров, которые не несут самостоятельной ценности.
Но категории, карточки, бренды, полезные фильтры и контентные страницы нужно сохранять открытыми. Иначе поисковик увидит магазин как набор служебных URL, а не как каталог, отвечающий на коммерческий спрос. После таких ошибок трафик иногда восстанавливается 2-8 недель, а на крупных проектах дольше.
Сайты на WordPress
На WordPress особенно часто копируют готовый robots.txt из чужой статьи или форума. В итоге закрывают папки, которые нужны для корректной отрисовки, или оставляют слишком жёсткие правила для архивов, рубрик и вложений, не понимая, как именно устроен сайт.
Базовый подход простой: не мешать обходу важных записей и страниц, закрыть вход в админку и результаты внутреннего поиска, отдельно решить вопрос со страницами вложений и дублями архивов. Если вы не уверены, какие шаблоны реально индексируются, сначала проверьте карту сайта и список URL в панелях вебмастеров, а уже потом правьте правила.
Если сомнения начинаются на этапе структуры и индексации, полезно смотреть не только на один файл, а на картину целиком. Для этого обычно заказывают SEO-аудит, чтобы понять, какие страницы должны оставаться открытыми и где именно поисковик теряет важные разделы.
Как не закрыть нужные страницы: безопасный порядок работы
Надёжнее всего идти не от файла, а от списка страниц, которые обязаны быть в поиске. Тогда robots превращается не в сборник запретов, а в аккуратную карту исключений.
- Соберите перечень типов страниц, которые приносят или должны приносить трафик: услуги, категории, карточки, статьи, бренды, региональные страницы. Лучше один раз прописать это в таблице, чем потом искать выпавшие URL вручную.
- Сопоставьте типы страниц с шаблонами адресов. Например, /catalog/, /product/, /services/, /blog/. Именно по шаблонам чаще всего происходит массовая ошибка.
- Проверьте, не совпадают ли нужные шаблоны с тем, что вы собираетесь закрыть. Правило для /search/ обычно безопасно, а правило для /s на некоторых сайтах может случайно зацепить /services/.
- Проверьте по 3-5 живых URL каждого типа через инструменты проверки robots в Яндекс Вебмастере и Google Search Console. Не ограничивайтесь одним примером, потому что разные шаблоны могут вести себя по-разному.
- Сверьте robots с XML-картой сайта. Если адрес есть в карте сайта, но закрыт от обхода, вы сами отправляете поисковику противоречивый сигнал.
- На этапе разработки используйте временные ограничения только там, где точно не забудете их снять. Для тестовых копий безопаснее пароль и закрытие на уровне сервера, а не одна строка Disallow: /, которая потом уедет на основной домен.
Перед любыми правками сохраните текущую версию файла и сделайте резервную копию сайта. Если доступ к серверу ограничен или сайт уже переживал неудачные обновления, пригодится чёткий порядок из статьи о резервных копиях сайта.
Если часть разделов уже пропала из индекса, не спешите править только один robots. Часто проблема идёт в связке с кодами ответа, каноническими адресами, мета-тегами и картой сайта. В такой ситуации полезнее разбирать причину системно, а не лечить симптом одной строкой.
Как проверять файл после правок
После публикации изменений не стоит ждать мгновенного эффекта. Роботы перечитывают файл быстро, но переобход нужных страниц и обновление индекса занимают время, особенно на каталогах и крупных корпоративных сайтах.
- Проверьте доступность файла по адресу /robots.txt. Он должен открываться без ошибок, отдавать код 200 и содержать актуальную версию, а не старую копию из кэша или сети доставки контента.
- Проверьте несколько важных URL вручную через инструменты панелей вебмастеров. Если коммерческая страница внезапно стала blocked by robots, причину лучше увидеть в тот же день.
- Сверьте количество открытых страниц в карте сайта с тем, что реально доступно для обхода. На небольшом проекте на это уходит 30-60 минут, на каталоге 2-4 часа, но эта проверка часто экономит недели потерь.
- Посмотрите, как ведёт себя индекс: возвращаются ли ранее пропавшие страницы, не появилось ли много служебных URL, нет ли резкого падения показов по важным разделам.
- Если сайт большой, полезно смотреть и серверные журналы. По ним видно, куда роботы реально ходят после обновления правил и не тратят ли обход на мусорные адреса.
Не меняйте файл каждый день без чёткого плана. Поисковику легче понять стабильную логику, чем постоянно меняющиеся запреты и разрешения. Сначала внесли правку, потом проверили, дождались переобхода, и только после этого делаете следующий шаг.
В практике студии RDMN неожиданная просадка после запуска сайта нередко объясняется не сложной алгоритмикой, а простым конфликтом правил: нужные разделы закрыты, а служебные открыты. Хорошая новость в том, что такие ошибки обычно лечатся быстро, если заметить их в первые дни, а не через месяц после релиза.
Если задача шире одного технического файла и вам нужен не просто возврат индексации, а стабильный рост трафика, подключают SEO-продвижение. Тогда robots.txt проверяют как часть общей системы, вместе со структурой, контентом, внутренней перелинковкой и аналитикой.
Типичные ошибки, из-за которых сайт теряет трафик
- Оставили Disallow: / после разработки. Самая дорогая и при этом самая банальная ошибка. Сайт запускается, меню работает, формы отправляются, но поисковик получает команду не заходить никуда.
- Закрыли папку или шаблон «с запасом». Под запрет попадают не только служебные страницы, но и карточки, статьи, раздел услуг или изображения. Обычно так случается после копирования чужого файла без понимания структуры собственного сайта.
- Пытаются убрать страницу из выдачи через robots. В результате адрес может ещё долго всплывать в поиске без сниппета. Если страницу надо убрать совсем, используйте noindex, удаление, 404 или 410, а для приватных данных добавляйте пароль.
- Закрыли ресурсы, нужные для отрисовки. Файлы стилей, сценарии и изображения помогают поисковику увидеть страницу так, как её видит пользователь. Когда доступ к ним перекрыт, оценка качества страницы может стать хуже.
- Забыли про поддомены и тестовые копии. У магазина, блога, регионального поддомена и тестового сайта могут быть разные файлы и разные риски. Часто основной домен настроен нормально, а на поддомене висит старое правило или открыта копия сайта.
- Противоречат сами себе. В карте сайта перечисляют URL, которые в том же проекте закрыты от обхода. Или открывают важный адрес через Allow, но более общее правило на другом шаблоне создаёт путаницу при проверке.
- Не проверяют результат после выкладки. Изменение загрузили на сервер и считают задачу закрытой. Но файл может не обновиться из-за кэша, прав у редактора, особенностей движка или ручной правки в другой среде.
Общее правило простое: минимализм лучше изобретательности. Чем короче список запретов и чем понятнее логика по типам страниц, тем меньше шанс, что вы случайно перекроете поисковый трафик на самые ценные разделы.
Частые вопросы
Нужен ли robots.txt маленькому сайту на 5-10 страниц?
Да, но обычно в очень простой версии. Даже небольшому сайту полезно закрыть админку и служебные разделы, а вот усложнять правила без необходимости не стоит.
Можно ли убрать страницу из поиска только через robots.txt?
Нет, это ненадёжный способ. Файл ограничивает обход, но не гарантирует исчезновение адреса из выдачи, если поисковик уже знает о нём по ссылкам или прошлому обходу.
Надо ли закрывать все URL с параметрами и метками?
Нет. Часть параметров действительно создаёт дубли, но часть адресов может вести на полезные посадочные страницы. Решение принимают по типам параметров и по ценности страницы для поиска.
Что делать, если после правки просели позиции?
Сначала проверьте, не стали ли важные URL blocked by robots, и не исчезли ли они из карты сайта или индекса. Затем сравните старую и новую версию файла, проверьте коды ответа и дайте роботам время на переобход, обычно от нескольких дней до 1-3 недель.
Если файла нет совсем, это критично?
Не всегда. Поисковики смогут обходить сайт и без него, но вы потеряете удобный способ направить обход и ограничить служебные разделы. На проектах с каталогом, блогом, личным кабинетом и параметрами отсутствие правил обычно нежелательно.
Нужно ли закрывать страницу благодарности после отправки формы?
Чаще всего да, если она не должна попадать в поиск и не несёт самостоятельной ценности. Но закрывать её лучше не запретом обхода, а способом, который действительно исключит страницу из индекса, если такая задача есть.
Что делать: короткий план
- Определите список страниц, которые должны получать поисковый трафик.
- Разделите URL на полезные, служебные и спорные.
- Составьте короткий набор правил без лишних масок и исключений.
- Проверьте 3-5 адресов каждого типа в инструментах вебмастеров.
- Сверьте правила с XML-картой сайта и структурой меню.
- Сделайте копию текущего файла перед публикацией.
- После выкладки проверьте доступность /robots.txt и статус важных страниц.
- В ближайшие 1-3 недели следите за индексацией, показами и обходом.
Если сомневаетесь хотя бы в одном пункте, лучше остановиться и проверить логику ещё раз. У сайта редко бывает проблема от слишком простого robots.txt, зато от одной неудачной строки легко потерять трафик на самые ценные разделы.
Опишите задачу, и мы вернёмся в течение рабочего дня с вопросами и предварительной оценкой.
Обсудить задачу