Купить Корзина
  • Облако и ИТ-инфраструктура
  • Продукты
    • Сайт под ключ
    • Сайт под ключ на Tilda
    • Интернет-магазин под ключ
    • Конструктор сайтов Рег.ру
  • Продукты
    • SEO-продвижениеКомплексное продвижение под ключ — 6 тарифов, стратегия, тексты, ссылки и аналитика
    • GEO-продвижениеПродвижение в ответах нейросетей — там, где клиенты уже ищут вас
    • SEO-стартБазовая оптимизация с фиксированной ценой
    • SEO-аудитТехнический разбор вашего сайта с рекомендациями по улучшению
  • Продукты
    • Зарегистрировать новый домен
    • Освобождающиеся домены
    • Магазин доменов
    • Доменный брокер
    • Продлить домен
    • Перенести домен в Рег.ру
    • Проверить домен в Whois-сервисе
  • Продукты
    • Базовые тарифы хостинга
    • ВИП-тарифы хостинга
    • Хостинг для 1C-Битрикс
    • Продление хостинга
    • Бесплатный перенос сайта в Рег.ру
    • Сайт на WordPress
  • Продукты
    • Почта на доменеНастройте почту и создайте ящики самостоятельно
  • Продукты
    • Заказать SSL-сертификат
    • Бесплатный SSL-сертификат
    • SSL-сертификаты Wildcard
    • SSL-сертификаты GlobalSign
    • SSL‑сертификаты ТЦИ
    • Проверка SSL-сертификата
  • Продукты
    • Сервис для онлайн-записи YCLIENTS
    • Контур Диадок
    • Электронная подпись от Контура
    • Торговый эквайринг от СберБизнеса
    • Регистрация своего дела со СберБизнесом
    • Антивирус для сайта
    • Лицензия 1С-Битрикс
    • Автоматическое SEO-продвижение
    • Яндекс Директ
    • Яндекс Бизнес
  • Продукты
    • Виртуальные VPS
    • Высокочастотные VPS
    • Дешевые VPS
    • Облачные VPS
    • Управляемые VPS
    • Перенести VPS в Рег.ру
  • Сайт + SEO
  • Сайт с SEO-продвижением
  • Рег.решения
    • Сайт под ключ — от 10 939 ₽Дизайн, наполнение, запуск — мы делаем всё за вас. Домен бесплатно
    • Сайт под ключ на Tilda — от 19 950 ₽Дизайн, интеграции, аналитика. Домен бесплатно
    • Почта под ключ — 4 095 ₽Настроим почту на домене за вас и перенесем письма со старого ящика
    • Многодоменов .ru/.рф — 979 ₽Регистрация доменов по выгодным ценам — чем больше, тем выгоднее
  • Рег.решения
    • Пакет услуг для сайта на хостинге — 5 299 ₽Домен, хостинг и другие инструменты для надежной работы сайта
    • Пакет услуг для высоконагруженных проектов — 60 999 ₽Обеспечьте быструю и бесперебойную работу одного или нескольких сайтов
    • Кибербезопасность сайта — 10 099 ₽Защита сайта и клиентов от утечки данных, спама, фишинга и других угроз
  • Рег.решения
    • Почта под ключ — 4 095 ₽Настроим почту на домене за вас и перенесем письма со старого ящика
    • Сайт и почта под ключ — от 8 399 ₽Современный сайт для бизнеса и корпоративная почта на вашем домене
  • Рег.решения
    • Пакет услуг для сайта на хостинге — 5 299 ₽Домен, хостинг и другие инструменты для надежной работы сайта
    • Пакет услуг для высоконагруженных проектов — 62 099 ₽Обеспечьте быструю и бесперебойную работу одного или нескольких сайтов
    • Кибербезопасность сайта — 10 099 ₽Защита сайта и клиентов от утечки данных, спама, фишинга и других угроз
  • Рег.решения
    • Упаковка бренда — 5 444 ₽
    • Аналитика ниши и товаров — 1 490 ₽
    • Поиск сотрудников — 6 599 ₽
    • Пакет услуг для открытия бизнеса — 80 399 ₽
    • Онлайн-присутствие вашего бизнеса — 8 229 ₽
  • Рег.облако
    • Выделенные серверыГотовые физические (Bare Metal) серверы, большой выбор конфигураций
    • Облачные серверыВиртуальные машины, автоустановка приложений, конфигуратор тарифов
    • Управляемые базы данных (DBaaS)Кластеры баз данных PostgreSQL и MySQL с репликацией
    • Кластеры Kubernetes (KaaS)Сервис автоматизированного развертывания кластеров Kubernetes
    • Частное облако VMwareИзолированное облако под управлением заказчика, индивидуальная конфигурация
    • Объектное хранилище S3Масштабируемое хранилище с платой только за использованные ресурсы
  • Телефон в Москве

    +7 495 580-11-11
  • Бесплатный звонок по России

    8 800 555-34-78
  • Или обратитесь в наши офисы

    Региональные номера
    1. База знаний
    2. Хостинг
    3. Продвижение сайта
    4. Запрет индексации в robots.txt

    Запрет индексации в robots.txt

    Управление индексацией — это контроль над тем, какие страницы вашего сайта попадают в результаты поиска.

    robots.txt не удаляет страницы из поисковой выдачи, только ограничивает их сканирование. Чтобы страница исчезла из результатов поиска, нужен метатег noindex или HTTP-заголовок X-Robots-Tag. Для блокировки ИИ-краулеров (GPTBot, ClaudeBot и других) используются отдельные правила в robots.txt.

    Для удаления страницы из выдачи сначала добавьте noindex, дождитесь пересканирования, затем, при необходимости, настройте Disallow. Для блокировки ИИ-ботов используйте отдельные правила — обучающие и поисковые краулеры настраиваются по-разному.

    Что входит в управление индексацией

    Управление индексацией — это не одна директива, а система инструментов:

    • robots.txt управляет сканированием, но не удаляет из индекса;
    • noindex или X-Robots-Tag удаляет из индекса;
    • правила для ИИ-краулеров контролируют использование контента для обучения ИИ.

    Чем сканирование отличается от индексации

    Сканирование и индексация — два разных независимых процесса. Страница может быть просканирована, но не проиндексирована. И наоборот — страница может попасть в индекс, если на нее ведут ссылки с других сайтов, даже если робот не имел к ней доступа.

    Сканирование (crawling) — робот посещает страницу и собирает информацию о ее содержимом. Управляется директивами в robots.txt.

    Индексация (indexing) — страница добавляется в базу данных поисковой системы и становится доступной в результатах поиска. Управляется через noindex (метатег или HTTP-заголовок).

    Поэтому Disallow в robots.txt не гарантирует удаление страницы из выдачи. Ранее проиндексированная страница может оставаться в результатах поиска неограниченно долго.

    Сравнение инструментов управления индексацией

    Инструмент Что контролирует Влияет на индекс Когда использовать
    robots.txt (Disallow) Сканирование Косвенно Блокировка служебных разделов, снижение нагрузки на сервер
    noindex (метатег) Индексацию Да, удаляет Удаление отдельных HTML-страниц из выдачи
    X-Robots-Tag Индексацию Да, удаляет Удаление не-HTML файлов (PDF, изображения, видео)
    Правила для ИИ-краулеров Доступ ИИ-ботов Не влияет на поиск Контроль использования контента для обучения ИИ

    Как запретить сканирование через robots.txt

    Важно!

    Никогда не блокируйте страницу в robots.txt до того, как добавите noindex. Если робот не может просканировать страницу, он не увидит метатег noindex.

    • 1
      Добавьте метатег noindex на страницу.
    • 2
      Дождитесь, пока Googlebot пересканирует страницу и удалит ее из индекса (может занять от нескольких дней до месяцев). Google официально не поддерживает указание noindex в robots.txt.
    • 3
      При необходимости добавьте Disallow в robots.txt после удаления из индекса.

    Блокировка всего сайта

    Вот что важно знать о директивах в robots.txt.

    Директива Host устарела. Яндекс не поддерживает ее с 2018 года. Вместо нее используйте инструмент «Переезд сайта» в Яндекс Вебмастере.

    Файл robots.txt не должен превышать 500 КБ. Если файл больше, робот может его проигнорировать.

    Регистр в названиях директив не важен. Disallow, disallow и DISALLOW работают одинаково. Но пути к папкам и файлам чувствительны к регистру.

    Чтобы закрыть сайт от сканирования всеми поисковыми системами
    User-agent: *
    Disallow: /

    User-agent: * означает, что правило применяется ко всем поисковым роботам, кроме тех, для которых указаны отдельные блоки.

    Чтобы закрыть сайт только для Яндекса, но оставить в других поисковых системах
    User-agent: YandexBot
    Disallow: /
    Чтобы открыть только для Google, но закрыть для других поисковых систем
    User-agent: Googlebot
    Allow: /
    User-agent: *
    Disallow: /
    Блокировка отдельных папок или страниц

    Для закрытия конкретного раздела:

    User-agent: *
    Disallow: /catalog/

    Для блокировки отдельной страницы:

    User-agent: *
    Disallow: /catalog/old-page.html

    Важно: символ / в конце пути означает блокировку всей папки. Если его нет, правило применяется к файлам, начинающимся с этой строки.

    Директива Allow разрешает сканирование, даже если оно запрещено правилом Disallow.

    Пример: при указании директив Disallow: /catalog/ и Allow: /catalog/public/ робот не будет сканировать каталог, кроме папки public.

    После внесения изменений проверьте robots.txt в Яндекс Вебмастере и в Google Search Console. Вы получите отчет о том, какие правила видит робот, есть ли ошибки в файле, и если да — то какие именно.

    Глобальные ИИ-краулеры

    На сегодняшний день поисковые системы — не единственные, кто сканирует ваш сайт. Множество ИИ-ботов собирают контент для обучения моделей и генерации ответов.

    Различие обучающих и поисковых глобальных краулеров
    Краулер Разработчик Назначение Рекомендация
    GPTBot OpenAI Обучение моделей На усмотрение владельца сайта
    OAI-SearchBot OpenAI Поиск в ChatGPT Не блокировать — потеряете видимость
    ClaudeBot Anthropic Обучение Claude На усмотрение владельца сайта
    Claude-SearchBot Anthropic Поиск в Claude Не блокировать
    Google-Extended Google Обучение Gemini На усмотрение владельца сайта
    CCBot Common Crawl Публичный архив На усмотрение владельца сайта
    PerplexityBot Perplexity Поиск в Perplexity Не блокировать

    Ограничения robots.txt для ИИ-ботов

    robots.txt — это «джентльменское соглашение». Добросовестные краулеры (GPTBot, ClaudeBot, Google-Extended) его соблюдают. Однако некоторые боты могут игнорировать правила. Для более надежной защиты можно использовать блокировку по IP-адресам в .htaccess или возвращать HTTP-код 403 через конфигурацию веб-сервера.

    Примеры правил для блокировки глобальных обучающих ИИ-краулеров
    User-agent: GPTBot
    Disallow: /
    User-agent: ClaudeBot
    Disallow: /
    User-agent: CCBot
    Disallow: /
    User-agent: Google-Extended
    Disallow: /

    Блокировка Google-Extended не убирает сайт из Google Поиска и AI Overviews (блок с ИИ-ответами над результатами поиска). За традиционный поиск отвечает обычный Googlebot.

    Примеры правил для разрешения глобальных поисковых ИИ-краулеров
    User-agent: OAI-SearchBot
    Allow: /
    User-agent: PerplexityBot
    Allow: /

    Китайские ИИ-краулеры

    Китайские ИИ-сервисы доступны в России и поддерживают кириллицу. Логика управления китайскими ИИ-краулерами та же, что и у краулеров OpenAI и Anthropic: обучающие и поисковые. Блокировать обучающие краулеры или нет, решает владелец сайта. Поисковые блокировать не стоит, иначе сайт исчезнет из ответов этих ИИ-продуктов.

    Китайские ИИ-краулеры: назначение и рекомендации
    Краулер Разработчик Назначение Рекомендация
    DeepSeekBot DeepSeek Обучение моделей На усмотрение владельца сайта
    QwenBot Alibaba Обучение Qwen На усмотрение владельца сайта
    TongyiBot Alibaba Поиск в Tongyi Qianwen Не блокировать — потеряете видимость
    Qwen-User Alibaba Запросы пользователей Qwen Не блокировать
    KimiBot Moonshot AI Обучение Kimi На усмотрение владельца сайта
    Kimi-SearchBot Moonshot AI Поисковый индекс Kimi Не блокировать
    Kimi-User Moonshot AI Запросы пользователей Kimi Не блокировать
    MoonshotBot Moonshot AI Обучение Kimi (альтернативный идентификатор) На усмотрение владельца сайта

    Что важно знать о китайских ИИ-краулерах

    Особенность Kimi-User. По документации Moonshot AI, Kimi-User используется для запросов, инициированных пользователем (например, когда пользователь просит Kimi пересказать статью). Поскольку действие запускает пользователь, правила robots.txt могут не применяться напрямую — даже если вы заблокируете Kimi-User, запрос всё равно может быть выполнен.

    История соблюдения у DeepSeekBot. DeepSeekBot заявлен как соблюдающий robots.txt, но его публичная история соблюдения менее задокументирована, чем у GPTBot и ClaudeBot. Для организаций с жесткими требованиями к защите данных рекомендуется дополнительно настроить блокировку по IP-адресам в .htaccess.

    Примеры правил для блокировки китайских обучающих ИИ-краулеров
    User-agent: DeepSeekBot
    Disallow: /
    User-agent: QwenBot
    Disallow: /
    User-agent: KimiBot
    Disallow: /
    User-agent: MoonshotBot
    Disallow: /
    Примеры правил для разрешения китайских поисковых ИИ-краулеров
    User-agent: TongyiBot
    Allow: /
    User-agent: Qwen-User
    Allow: /
    User-agent: Kimi-SearchBot
    Allow: /
    User-agent: Kimi-User
    Allow: /

    Роботы Яндекса: особенности и управление

    Для российского сайта Яндекс — основной источник поискового трафика. Поэтому важно понимать не только общие правила robots.txt, но и специфику роботов Яндекса.

    Групповой токен User-agent: Yandex

    В robots.txt можно указать не конкретного робота, а групповой токен Yandex. Это правило применяется ко всем роботам Яндекса, у которых нет отдельного блока.

    User-agent: Yandex
    Disallow: /

    Если в файле есть User-agent: Yandex, то правило User-agent: * не учитывается роботами Яндекса. Это особенность Яндекса: групповой токен Yandex имеет приоритет над *. Если вам нужно задать правила для всех роботов, кроме Яндекса, укажите их отдельными блоками.

    Важно: Некоторые роботы Яндекса могут игнорировать даже групповое правило User-agent: Yandex. Для них нужно указывать точное имя User-agent.

    Подробнее — в документации Яндекса по robots.txt.

    Главный робот YandexBot

    YandexBot — основной индексирующий робот Яндекса. Именно он обеспечивает попадание страниц в поиск Яндекса и связанные с ним сервисы, включая YandexGPT. Блокировать YandexBot можно только в том случае, если вы сознательно хотите убрать сайт из Яндекса. Для большинства сайтов его нужно пропускать.

    User-agent: `Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)`

    Другие роботы Яндекса

    Помимо основного YandexBot, Яндекс использует ряд специализированных роботов.

    Роботы Яндекса и их отношение к robots.txt
    Робот Назначение Соблюдает robots.txt?
    YandexBot Основной индексирующий робот Да
    YandexImages Индексация изображений для Яндекс Картинок Да
    YandexMobileBot Сканирование мобильных версий сайтов Да
    YandexRenderResourcesBot Загрузка таблиц стилей (CSS), скриптов (JS) и изображений для понимания визуального отображения страниц Да
    YandexAdditional / YandexAdditionalBot Дополнительные задачи сканирования Да
    YandexAccessibilityBot Проверка доступности сайта Нет
    YandexCalendar Загрузка календарных файлов Нет
    YandexDirect Сбор информации о партнерских сайтах для рекламы Нет

    Специализированные роботы требуют отдельного подхода

    Если вы хотите ограничить, например, только YandexImages, но оставить доступ для основного поиска, укажите отдельный блок:

    Пример отдельного блока для специализированного робота
    User-agent: YandexImages
    Disallow: /private/
    
    User-agent: YandexBot
    Allow: /

    Особенности в работе с роботами Яндекса.

    Яндекс официально игнорирует директиву Crawl-delay с 22 февраля 2018 года. Проверить сканирование и настроить частоту посещения ресурса роботами можно только через Яндекс Вебмастер. Через robots.txt это сделать нельзя.

    Директива Clean-param работает только с Яндексом. Она позволяет указать роботу, какие параметры в URL можно игнорировать при сканировании. Это помогает избежать дублей страниц. Например, если у вас есть страницы example.com/catalog?sort=price и example.com/catalog?sort=name, которые ведут на один и тот же контент, добавьте Clean-param: sort /catalog/ — робот будет считать их одной страницей.

    Как проверить подлинность User-agent через DNS:

    • 1
      По логам сервера определите IP-адрес, с которого пришел запрос с этим User-agent.
    • 2
      Выполните обратный DNS-запрос, чтобы получить имя хоста.
    • 3
      Проверьте, что хост принадлежит Яндексу — все имена роботов Яндекса заканчиваются на yandex.ru, yandex.net или yandex.com.
    • 4
      Выполните прямой DNS-запрос и убедитесь, что этому имени соответствует тот же IP-адрес, с которого пришел робот. Если IP не совпадает — имя хоста подделано.

    Не добавляйте роботов в белый список только по строке User-Agent — злоумышленник может ее подделать. Проверка через обратный DNS надежнее, чем белый список по IP.

    Частые вопросы

    Можно ли указать noindex в robots.txt?
    Нет. Ни Google, ни Яндекс не поддерживают директиву noindex в robots.txt. Для этого используются только метатег или HTTP-заголовок.
    Что делать, если страница с noindex все еще в выдаче?
    Поисковому роботу нужно пересканировать страницу, чтобы увидеть noindex. Это может занять от нескольких дней до месяцев. Проверьте, не блокирует ли robots.txt доступ к странице — если да, робот не сможет увидеть метатег.
    Блокировка GPTBot повлияет на позиции в Google?
    Нет. GPTBot и Googlebot — независимые системы. Блокировка GPTBot не влияет на традиционный поиск Google.
    Как быстро удалить страницу из Google?
    Используйте инструмент «Удаление URL» в Search Console для временного удаления (примерно на 6 месяцев). Для постоянного удаления добавьте noindex и дождитесь пересканирования.
    Что будет, если закрыть весь сайт в robots.txt?
    Роботы перестанут сканировать сайт, но страницы, уже находящиеся в индексе, останутся в выдаче. Они исчезнут только после того, как робот пересканирует их и увидит noindex — но он не сможет этого сделать, пока доступ закрыт. Поэтому закрывать сайт в robots.txt без предварительного noindex — ошибка.

    Помогла ли вам статья?

    Спасибо за оценку. Рады помочь 😊

     👍
    Специальные предложения
    • Гранты для бизнеса до 500к
    • Скидки на cloud GPU до 50%
    • Скидки на bare-metal с А4000 и А5000
    • Кешбэк 100% на kubernetes
    • vk
    • telegram
    • ok
    • vc
    • dzen
    • rbc
    • max
    • Продукты
      • Домены
      • Хостинг
      • Почта
      • SSL-сертификаты
      • Конструктор сайтов
      • VPS и VDS серверы
      • Магазин доменов
      • Облако для бизнеса
    • Решения по сфере бизнеса
      • Подойдут всем
      • Маркетплейсы
      • Образование
      • Бьюти
      • Медицина
      • Автосервисы
      • Бытовые услуги
      • Досуг
      • Спорт
      • Все решения
    • Сервисы
      • Whois – проверить данные домена
      • Определить IP адрес
      • Проверить порт на доступность
      • Проверить IP адрес сайта
      • Перевести домен в Punycode
      • Проверить скорость интернета
    • Компания
      • О компании
      • Контакты
      • Офисы
      • Новости
      • Акции и скидки
      • Блог
      • Отзывы клиентов
    • Полезное
      • Стоимость услуг
      • Способы оплаты
      • Бонусная программа
      • Документы
      • База знаний
      • ЭДО
      • Партнерам
    • Другое
      • РБК: новости России и мира сегодня
      • Новости компаний РФ
      • РБК Инвестиции: курсы валют
      • Спецпроект с Онлайн Патентом
      • РБК Курсы

    Облачная платформа Рег.ру включена в реестр российского ПО Запись № 23682 от 29.08.2024

    • mintsifry
    • icann
    • cctld
    © ООО «РЕГ.РУ»
    • Политика конфиденциальности
    • Политика обработки персональных данных
    • Правила применения рекомендательных технологий
    • Правила пользования и другие правила и политики
    • Сообщить о нарушении
    • Используем куки, это делает удобнее вашу работу с сайтом