Что такое robots.txt и как его настроить
robots.txt — файл в корне сайта с правилами для поисковых роботов: что обходить, а что нет. Основные директивы, частые ошибки и чем robots.txt не является.
robots.txt — текстовый файл в корне сайта (site.ru/robots.txt) с правилами для поисковых роботов: какие разделы обходить, какие нет и где лежит карта сайта.
Основные директивы
User-agent: *
Disallow: /cart/
Disallow: /search
Allow: /search/help
Clean-param: utm_source&utm_medium&utm_campaign
Sitemap: https://site.ru/sitemap.xml- User-agent — для какого робота правила:
*— для всех,Yandex— для Яндекса. - Disallow и Allow — запретить или разрешить обход адресов, которые начинаются с указанного пути.
- Clean-param — директива Яндекса: какие параметры адреса не меняют содержимое. Так робот не плодит дубли.
- Sitemap — адрес карты сайта.
Директива Host устарела: главное зеркало Яндекс определяет по редиректам.
Частые ошибки
Disallow: /на рабочем сайте — остался после разработки и закрыл весь сайт.- Закрыты CSS и JS — робот не может нормально отрисовать страницу.
- Попытка убрать страницу из поиска через robots.txt. Запрет обхода не удаляет известный адрес из поиска — для этого нужен noindex, а страница при этом должна быть открыта для обхода.
Как проверить
Аудит SerpWatch читает robots.txt по правилам Яндекса и Google и не заходит в закрытые разделы. В Вебмастере есть отдельный анализатор robots.txt.
Частые вопросы
Можно ли через robots.txt удалить страницу из поиска?
Нет. robots.txt запрещает обход, но не удаляет адрес из поиска. Для этого нужен noindex, а страница должна оставаться открытой для обхода.
Где проверить robots.txt?
В Яндекс Вебмастере есть анализатор robots.txt. Аудит SerpWatch читает его по правилам Яндекса и Google.
Аудит сайта в SerpWatch
≈45 проверок по 8 разделам, Core Web Vitals, подсказки как исправить, экспорт в Excel
Проверить бесплатно Попробовать бесплатно