Управление индексацией — это контроль над тем, какие страницы вашего сайта попадают в результаты поиска.
robots.txt не удаляет страницы из поисковой выдачи, только ограничивает их сканирование. Чтобы страница исчезла из результатов поиска, нужен метатег noindex или HTTP-заголовок X-Robots-Tag. Для блокировки ИИ-краулеров (GPTBot, ClaudeBot и других) используются отдельные правила в robots.txt.
Для удаления страницы из выдачи сначала добавьте noindex, дождитесь пересканирования, затем, при необходимости, настройте Disallow. Для блокировки ИИ-ботов используйте отдельные правила — обучающие и поисковые краулеры настраиваются по-разному.
Что входит в управление индексацией
Управление индексацией — это не одна директива, а система инструментов:
- robots.txt управляет сканированием, но не удаляет из индекса;
noindexилиX-Robots-Tagудаляет из индекса;- правила для ИИ-краулеров контролируют использование контента для обучения ИИ.
Чем сканирование отличается от индексации
Сканирование и индексация — два разных независимых процесса. Страница может быть просканирована, но не проиндексирована. И наоборот — страница может попасть в индекс, если на нее ведут ссылки с других сайтов, даже если робот не имел к ней доступа.
Сканирование (crawling) — робот посещает страницу и собирает информацию о ее содержимом. Управляется директивами в robots.txt.
Индексация (indexing) — страница добавляется в базу данных поисковой системы и становится доступной в результатах поиска. Управляется через noindex (метатег или HTTP-заголовок).
Поэтому Disallow в robots.txt не гарантирует удаление страницы из выдачи. Ранее проиндексированная страница может оставаться в результатах поиска неограниченно долго.
Сравнение инструментов управления индексацией
| Инструмент | Что контролирует | Влияет на индекс | Когда использовать |
|---|---|---|---|
| robots.txt (Disallow) | Сканирование | Косвенно | Блокировка служебных разделов, снижение нагрузки на сервер |
| noindex (метатег) | Индексацию | Да, удаляет | Удаление отдельных HTML-страниц из выдачи |
| X-Robots-Tag | Индексацию | Да, удаляет | Удаление не-HTML файлов (PDF, изображения, видео) |
| Правила для ИИ-краулеров | Доступ ИИ-ботов | Не влияет на поиск | Контроль использования контента для обучения ИИ |
Как запретить сканирование через robots.txt
Важно!
Никогда не блокируйте страницу в robots.txt до того, как добавите noindex. Если робот не может просканировать страницу, он не увидит метатег noindex.
-
1
Добавьте метатег
noindexна страницу. -
2
Дождитесь, пока Googlebot пересканирует страницу и удалит ее из индекса (может занять от нескольких дней до месяцев). Google официально не поддерживает указание
noindexв robots.txt. -
3
При необходимости добавьте
Disallowв robots.txt после удаления из индекса.
Блокировка всего сайта
Вот что важно знать о директивах в robots.txt.
Директива Host устарела. Яндекс не поддерживает ее с 2018 года. Вместо нее используйте инструмент «Переезд сайта» в Яндекс Вебмастере.
Файл robots.txt не должен превышать 500 КБ. Если файл больше, робот может его проигнорировать.
Регистр в названиях директив не важен. Disallow, disallow и DISALLOW работают одинаково. Но пути к папкам и файлам чувствительны к регистру.
Чтобы закрыть сайт от сканирования всеми поисковыми системами
User-agent: *
Disallow: /
User-agent: * означает, что правило применяется ко всем поисковым роботам, кроме тех, для которых указаны отдельные блоки.
Чтобы закрыть сайт только для Яндекса, но оставить в других поисковых системах
User-agent: YandexBot
Disallow: /
Чтобы открыть только для Google, но закрыть для других поисковых систем
User-agent: Googlebot
Allow: /
User-agent: *
Disallow: /
Блокировка отдельных папок или страниц
Для закрытия конкретного раздела:
User-agent: *
Disallow: /catalog/
Для блокировки отдельной страницы:
User-agent: *
Disallow: /catalog/old-page.html
Важно: символ / в конце пути означает блокировку всей папки. Если его нет, правило применяется к файлам, начинающимся с этой строки.
Директива Allow разрешает сканирование, даже если оно запрещено правилом Disallow.
Пример: при указании директив Disallow: /catalog/ и Allow: /catalog/public/ робот не будет сканировать каталог, кроме папки public.
После внесения изменений проверьте robots.txt в Яндекс Вебмастере и в Google Search Console. Вы получите отчет о том, какие правила видит робот, есть ли ошибки в файле, и если да — то какие именно.
Глобальные ИИ-краулеры
На сегодняшний день поисковые системы — не единственные, кто сканирует ваш сайт. Множество ИИ-ботов собирают контент для обучения моделей и генерации ответов.
| Краулер | Разработчик | Назначение | Рекомендация |
|---|---|---|---|
| GPTBot | OpenAI | Обучение моделей | На усмотрение владельца сайта |
| OAI-SearchBot | OpenAI | Поиск в ChatGPT | Не блокировать — потеряете видимость |
| ClaudeBot | Anthropic | Обучение Claude | На усмотрение владельца сайта |
| Claude-SearchBot | Anthropic | Поиск в Claude | Не блокировать |
| Google-Extended | Обучение Gemini | На усмотрение владельца сайта | |
| CCBot | Common Crawl | Публичный архив | На усмотрение владельца сайта |
| PerplexityBot | Perplexity | Поиск в Perplexity | Не блокировать |
Ограничения robots.txt для ИИ-ботов
robots.txt — это «джентльменское соглашение». Добросовестные краулеры (GPTBot, ClaudeBot, Google-Extended) его соблюдают. Однако некоторые боты могут игнорировать правила. Для более надежной защиты можно использовать блокировку по IP-адресам в .htaccess или возвращать HTTP-код 403 через конфигурацию веб-сервера.
Примеры правил для блокировки глобальных обучающих ИИ-краулеров
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
Блокировка Google-Extended не убирает сайт из Google Поиска и AI Overviews (блок с ИИ-ответами над результатами поиска). За традиционный поиск отвечает обычный Googlebot.
Примеры правил для разрешения глобальных поисковых ИИ-краулеров
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
Китайские ИИ-краулеры
Китайские ИИ-сервисы доступны в России и поддерживают кириллицу. Логика управления китайскими ИИ-краулерами та же, что и у краулеров OpenAI и Anthropic: обучающие и поисковые. Блокировать обучающие краулеры или нет, решает владелец сайта. Поисковые блокировать не стоит, иначе сайт исчезнет из ответов этих ИИ-продуктов.
| Краулер | Разработчик | Назначение | Рекомендация |
|---|---|---|---|
| DeepSeekBot | DeepSeek | Обучение моделей | На усмотрение владельца сайта |
| QwenBot | Alibaba | Обучение Qwen | На усмотрение владельца сайта |
| TongyiBot | Alibaba | Поиск в Tongyi Qianwen | Не блокировать — потеряете видимость |
| Qwen-User | Alibaba | Запросы пользователей Qwen | Не блокировать |
| KimiBot | Moonshot AI | Обучение Kimi | На усмотрение владельца сайта |
| Kimi-SearchBot | Moonshot AI | Поисковый индекс Kimi | Не блокировать |
| Kimi-User | Moonshot AI | Запросы пользователей Kimi | Не блокировать |
| MoonshotBot | Moonshot AI | Обучение Kimi (альтернативный идентификатор) | На усмотрение владельца сайта |
Что важно знать о китайских ИИ-краулерах
Особенность Kimi-User. По документации Moonshot AI, Kimi-User используется для запросов, инициированных пользователем (например, когда пользователь просит Kimi пересказать статью). Поскольку действие запускает пользователь, правила robots.txt могут не применяться напрямую — даже если вы заблокируете Kimi-User, запрос всё равно может быть выполнен.
История соблюдения у DeepSeekBot. DeepSeekBot заявлен как соблюдающий robots.txt, но его публичная история соблюдения менее задокументирована, чем у GPTBot и ClaudeBot. Для организаций с жесткими требованиями к защите данных рекомендуется дополнительно настроить блокировку по IP-адресам в .htaccess.
Примеры правил для блокировки китайских обучающих ИИ-краулеров
User-agent: DeepSeekBot
Disallow: /
User-agent: QwenBot
Disallow: /
User-agent: KimiBot
Disallow: /
User-agent: MoonshotBot
Disallow: /
Примеры правил для разрешения китайских поисковых ИИ-краулеров
User-agent: TongyiBot
Allow: /
User-agent: Qwen-User
Allow: /
User-agent: Kimi-SearchBot
Allow: /
User-agent: Kimi-User
Allow: /
Роботы Яндекса: особенности и управление
Для российского сайта Яндекс — основной источник поискового трафика. Поэтому важно понимать не только общие правила robots.txt, но и специфику роботов Яндекса.
Групповой токен User-agent: Yandex
В robots.txt можно указать не конкретного робота, а групповой токен Yandex. Это правило применяется ко всем роботам Яндекса, у которых нет отдельного блока.
User-agent: Yandex
Disallow: /
Если в файле есть User-agent: Yandex, то правило User-agent: * не учитывается роботами Яндекса. Это особенность Яндекса: групповой токен Yandex имеет приоритет над *. Если вам нужно задать правила для всех роботов, кроме Яндекса, укажите их отдельными блоками.
Важно: Некоторые роботы Яндекса могут игнорировать даже групповое правило User-agent: Yandex. Для них нужно указывать точное имя User-agent.
Подробнее — в документации Яндекса по robots.txt.
Главный робот YandexBot
YandexBot — основной индексирующий робот Яндекса. Именно он обеспечивает попадание страниц в поиск Яндекса и связанные с ним сервисы, включая YandexGPT. Блокировать YandexBot можно только в том случае, если вы сознательно хотите убрать сайт из Яндекса. Для большинства сайтов его нужно пропускать.
User-agent: `Mozilla/5.0 (compatible; YandexBot/3.0; +http://yandex.com/bots)`
Другие роботы Яндекса
Помимо основного YandexBot, Яндекс использует ряд специализированных роботов.
| Робот | Назначение | Соблюдает robots.txt? |
|---|---|---|
| YandexBot | Основной индексирующий робот | Да |
| YandexImages | Индексация изображений для Яндекс Картинок | Да |
| YandexMobileBot | Сканирование мобильных версий сайтов | Да |
| YandexRenderResourcesBot | Загрузка таблиц стилей (CSS), скриптов (JS) и изображений для понимания визуального отображения страниц | Да |
| YandexAdditional / YandexAdditionalBot | Дополнительные задачи сканирования | Да |
| YandexAccessibilityBot | Проверка доступности сайта | Нет |
| YandexCalendar | Загрузка календарных файлов | Нет |
| YandexDirect | Сбор информации о партнерских сайтах для рекламы | Нет |
Специализированные роботы требуют отдельного подхода
Если вы хотите ограничить, например, только YandexImages, но оставить доступ для основного поиска, укажите отдельный блок:
Пример отдельного блока для специализированного робота
User-agent: YandexImages
Disallow: /private/
User-agent: YandexBot
Allow: /
Особенности в работе с роботами Яндекса.
Яндекс официально игнорирует директиву Crawl-delay с 22 февраля 2018 года. Проверить сканирование и настроить частоту посещения ресурса роботами можно только через Яндекс Вебмастер. Через robots.txt это сделать нельзя.
Директива Clean-param работает только с Яндексом. Она позволяет указать роботу, какие параметры в URL можно игнорировать при сканировании. Это помогает избежать дублей страниц.
Например, если у вас есть страницы example.com/catalog?sort=price и example.com/catalog?sort=name, которые ведут на один и тот же контент, добавьте Clean-param: sort /catalog/ — робот будет считать их одной страницей.
Как проверить подлинность User-agent через DNS:
-
1
По логам сервера определите IP-адрес, с которого пришел запрос с этим User-agent.
-
2
Выполните обратный DNS-запрос, чтобы получить имя хоста.
-
3
Проверьте, что хост принадлежит Яндексу — все имена роботов Яндекса заканчиваются на
yandex.ru,yandex.netилиyandex.com. -
4
Выполните прямой DNS-запрос и убедитесь, что этому имени соответствует тот же IP-адрес, с которого пришел робот. Если IP не совпадает — имя хоста подделано.
Не добавляйте роботов в белый список только по строке User-Agent — злоумышленник может ее подделать. Проверка через обратный DNS надежнее, чем белый список по IP.
Частые вопросы
Можно ли указать noindex в robots.txt?
Что делать, если страница с noindex все еще в выдаче?
Блокировка GPTBot повлияет на позиции в Google?
Как быстро удалить страницу из Google?
Что будет, если закрыть весь сайт в robots.txt?
Помогла ли вам статья?
Спасибо за оценку. Рады помочь 😊