Файл robots.txt содержит правила для поисковых роботов. С его помощью можно управлять обходом отдельных страниц и разделов сайта. Важно: Disallow ограничивает обход URL, но не гарантирует удаление страницы из поисковой выдачи. Если страницу нужно исключить из поиска, используйте noindex.
Что такое robots.txt
Файл robots.txt — это текстовый документ с правилами для поисковых роботов. Поисковые системы могут использовать его, чтобы определить, какие URL сайта разрешено или запрещено обходить.
Файл должен называться robots.txt и находиться в корневом каталоге сайта. Например:
https://example.com/robots.txt
Правила файла действуют для конкретного хоста. Если на сайте используются поддомены, для каждого из них может потребоваться отдельный файл robots.txt.
Зачем нужен файл robots.txt
Файл используют для управления обходом сайта поисковыми роботами.
С помощью robots.txt можно:
- запретить обход отдельных страниц,
- закрыть от обхода каталог сайта,
- задать разные правила для поисковых роботов,
- разрешить обход отдельных URL внутри закрытого каталога,
- указать адрес файла
sitemap.xml.
Например, robots.txt может понадобиться для служебных разделов, страниц внутреннего поиска или других URL, которые не нужно регулярно обходить.
Не используйте файл для защиты конфиденциальных данных. Правила robots.txt не ограничивают доступ пользователей к страницам сайта. Кроме того, не все роботы обязаны их соблюдать.
Основные директивы robots.txt
Файл robots.txt строится на нескольких ключевых директивах. Ниже — основные из них.
* — для всех роботовDisallowВ таблице отмечены обязательные и необязательные директивы. Рассмотрим каждую из них подробнее.
- User-agent
Директива User-agent определяет поискового робота, для которого действуют следующие правила. Например:
User-agent: Googlebot
Чтобы задать правило для всех поисковых роботов, используйте символ *:
User-agent: *
- Disallow
Директива Disallow запрещает роботу обход указанного URL или раздела.
Например, чтобы запретить обход страницы /vip.html:
User-agent: *
Disallow: /vip.html
Чтобы запретить обход каталога /private/:
User-agent: *
Disallow: /private/
Пустое значение Disallow означает, что запрета на обход нет:
User-agent: *
Disallow:
- Allow
Директива Allow разрешает обход URL внутри области, закрытой директивой Disallow. Например:
User-agent: *
Disallow: /private/
Allow: /private/public.html
В этом примере обход каталога /private/ запрещен, но робот может обойти URL /private/public.html.
- Sitemap
Директива Sitemap указывает адрес XML-карты сайта. Например:
Sitemap: https://example.com/sitemap.xml
Карта сайта помогает поисковым роботам находить URL сайта.
- Clean-param
Clean-param — директива Яндекса для работы с параметрами URL. Она позволяет указать параметры, которые не влияют на содержимое страницы и которые Яндекс может игнорировать при обработке таких URL. Например:
User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign
Clean-param является расширением Яндекса и не является универсальной директивой для всех поисковых роботов.
- Спецсимволы
В правилах robots.txt можно использовать специальные символы:
* — заменяет любую последовательность символов,
$ — обозначает конец URL.
Например:
User-agent: *
Disallow: /*.pdf$
Такое правило запрещает обход URL, которые заканчиваются на .pdf.
Как создать файл robots.txt
Настройка robots.txt включает следующие шаги:
-
1
Откройте текстовый редактор и сохраните новый файл с именем
robots.txt. -
2
Добавьте правила для поисковых роботов. Например, чтобы запретить обход каталога
/private/, укажите:User-agent: * Disallow: /private/ -
3
Загрузите
robots.txtв корневой каталог сайта через файловый менеджер хостинга или по протоколу FTP/SFTP. -
4
Чтобы убедиться, что файл доступен, откройте в браузере:
https://example.com/robots.txtгде
example.com— доменное имя вашего сайта.
Яндекс рекомендует, чтобы сервер возвращал для robots.txt код HTTP 200.
robots.txt должен находиться в корневом каталоге сайта. Файл в подкаталоге не используется как основной файл правил для всего сайта.
Примеры настройки robots.txt
Ниже приведены примеры распространенных сценариев настройки robots.txt. Выберите подходящий пример и измените его с учетом структуры сайта.
Как разрешить обход всего сайта
Чтобы разрешить поисковым роботам обход всего сайта, укажите:
User-agent: *
Disallow:
При необходимости можно указать карту сайта:
User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml
Как закрыть от обхода одну страницу
Чтобы запретить обход страницы /vip.html, укажите:
User-agent: *
Disallow: /vip.html
Как закрыть от обхода каталог
Чтобы запретить обход URL в каталоге /private/, укажите:
User-agent: *
Disallow: /private/
Как разрешить страницу внутри закрытого каталога
Чтобы запретить обход каталога /private/, но разрешить страницу /private/public.html, укажите:
User-agent: *
Disallow: /private/
Allow: /private/public.html
Как задать правило для конкретного поискового робота
Чтобы запретить обход страницы только роботу Google, укажите:
User-agent: Googlebot
Disallow: /vip.html
Чтобы запретить роботу Яндекса обход всего сайта, кроме URL, начинающихся с /shared, укажите:
User-agent: Yandex
Disallow: /
Allow: /shared
Как запретить обход всего сайта
Чтобы запретить обход сайта всем поисковым роботам, укажите:
User-agent: *
Disallow: /
Используйте это правило с осторожностью. Оно запрещает поисковым роботам обход URL сайта.
Если страницы уже известны поисковой системе, Disallow не гарантирует их удаление из поисковой выдачи.
После загрузки файла обязательно проверьте его работу.
Как проверить robots.txt
Для проверки robots.txt выполните следующие шаги:
-
1
Откройте в браузере адрес формата
https://example.com/robots.txt. Убедитесь, что файл открывается и содержит нужные правила. -
2
В Яндекс Вебмастере откройте инструмент Анализ robots.txt. С его помощью можно:
проверить синтаксис файла,
найти ошибки,
проверить, разрешен ли обход конкретного URL.
-
3
После изменения файла убедитесь, что правила не закрыли важные страницы сайта от обхода. Например:
главную страницу,
страницы товаров и услуг,
разделы сайта,
статьи.
Файл robots.txt доступен, а правила работают корректно.
Частые ошибки при настройке robots.txt
Даже при правильной настройке robots.txt легко допустить ошибку, которая повлияет на обход сайта поисковыми роботами. Вот самые частые из них.
https://example.com/files/robots.txt, а не https://example.com/robots.txtrobot.txt или robots.txt.txtrobots.txtDisallow: /, которое запрещает обход всех URL сайтаrobots.txt для запрета индексированияDisallow удалит страницу из поисковой выдачиrobots или HTTP-заголовке X-Robots-Tag. URL при этом должен быть доступен для обходаCrawl-delayCrawl-delayCrawl-delay. Скорость обхода Яндекса настраивается в Яндекс Вебмастереrobots.txt для защиты данныхrobots.txt не ограничивает доступ пользователей. Для защиты данных настройте авторизацию и ограничение доступа на стороне сайта или сервераDisallow или Allow. Проверьте действие правила через инструмент Анализ robots.txt в Яндекс ВебмастереЧтобы избежать ошибок, проверяйте robots.txt после каждого изменения. Убедитесь, что файл доступен по адресу формата https://example.com/robots.txt, а правила не запрещают обход важных страниц.
Частые вопросы
Где находится файл robots.txt?
Файл должен находиться в корневом каталоге сайта и быть доступен по адресу:
https://example.com/robots.txt
где example.com — доменное имя вашего сайта.
Для поддоменов могут потребоваться отдельные файлы.
Как настроить robots.txt, чтобы разрешить обход всего сайта?
Добавьте:
User-agent: *
Disallow:
Такое правило разрешает поисковым роботам обходить URL сайта.
Как закрыть весь сайт от обхода поисковыми роботами?
Добавьте:
User-agent: *
Disallow: /
Это правило запрещает поисковым роботам обход URL сайта. Используйте его только при необходимости.
Можно ли удалить страницу из поиска с помощью robots.txt?
Disallow ограничивает обход URL, но не гарантирует удаление страницы из поисковой выдачи. Если страницу нужно исключить из поиска, используйте noindex или другой подходящий способ. URL при этом должен быть доступен роботу, чтобы он мог обработать директиву noindex.
Как проверить настройку robots.txt?
https://example.com/robots.txt и проверьте правила в Яндекс Вебмастере с помощью инструмента «Анализ robots.txt».
Помогла ли вам статья?
Спасибо за оценку. Рады помочь 😊