Зачем нужен файл robots.txt: полный гайд для новичков в 2026 году

Представьте: вы запустили сайт, наполнили его крутым контентом, а Яндекс и Google его не видят. Или хуже — боты сжирают весь трафик сервера, и сайт падает. Знакомая боль? Чаще всего проблема в файле robots.txt. Этот крошечный текстовый документ управляет тем, как поисковые роботы сканируют ваш сайт. Если его нет или он настроен неправильно — вы теряете клиентов, деньги и нервы. В этом гайде я расскажу, зачем нужен robots.txt, как его создать и не наделать ошибок. Пошагово, для новичков.
Что такое robots.txt и где он лежит
Robots.txt — это обычный текстовый файл, который лежит в корне сайта. Он даёт указания поисковым роботам: какие страницы можно сканировать, а какие — нет. Никакой магии: просто набор правил, которые боты читают перед обходом.
Где искать: https://вашсайт.ru/robots.txt. Если открыть эту ссылку и увидеть текст — все ок. Если ошибка 404 — файла нет.
Как создать: Откройте блокнот (Notepad), напишите директивы, сохраните как robots.txt в кодировке UTF-8 без BOM. Затем загрузите в корень сайта через FTP или админку хостинга.
Как работает robots.txt
Когда поисковый бот приходит на сайт, он первым делом запрашивает robots.txt. Если файл есть — он парсит директивы и действует согласно им. Если файла нет — бот считает, что можно сканировать всё.
Порядок обработки:
- Бот делает GET-запрос к
https://вашсайт.ru/robots.txt. - Получает ответ: 200 OK, 404, 403 или 5xx.
- Если 200 — читает содержимое и применяет правила.
- Если 404 — сканирует весь сайт (как будто файла нет).
- Если 403 или 5xx — боты могут вести себя по-разному (Google временно прекращает сканирование, Яндекс может считать, что доступа нет).
Важно: Robots.txt — это не запрет в юридическом смысле. Это просьба. Послушные боты (Google, Яндекс, Bing) соблюдают, но некоторые (плохие) игнорируют.
Основные директивы robots.txt с примерами
В файле используются директивы. Каждая группа правил начинается с User-agent, затем идут Disallow, Allow и другие.
| Директива | Описание | Пример |
|---|---|---|
User-agent |
Указывает, к какому роботу относятся правила. * — для всех. |
User-agent: * |
Disallow |
Запрещает сканирование определённых URL или папок. Пустое значение — разрешить всё. | Disallow: /admin/ |
Allow |
Разрешает сканирование, даже если есть Disallow. Только для Google и Bing. | Allow: /admin/public/ |
Sitemap |
Указывает путь к карте сайта. | Sitemap: https://вашсайт.ru/sitemap.xml |
Crawl-delay |
Задаёт задержку между запросами (в секундах). Поддерживается не всеми. | Crawl-delay: 5 |
Пример полного файла:
User-agent: *
Disallow: /admin/
Disallow: /private/
Allow: /admin/public/
Sitemap: https://mysite.ru/sitemap.xml
Примеры для реальных кейсов
Блокировка админки
Если у вас WordPress, закройте /wp-admin/:
User-agent: *
Disallow: /wp-admin/
Публичный сайт + staging на поддомене
На поддомене staging.mysite.ru разместите robots.txt, который закрывает всё:
User-agent: *
Disallow: /
Блокировка динамических параметров
Закрыть страницы с ? и sessionid:
User-agent: *
Disallow: /*?
Disallow: /*sessionid=
Как разные поисковые системы трактуют директивы
- Google: поддерживает Allow, Crawl-delay игнорирует (использует свой механизм), максимальный размер файла 500 КБ, игнорирует строки после 5000 символов.
- Yandex: уважает Crawl-delay, может игнорировать Allow, если Disallow и Allow конфликтуют — приоритет у Disallow. Максимальный размер 32 КБ.
- Bing: поддерживает Allow, Crawl-delay — да, но не обязан соблюдать. Размер до 500 КБ.
Важно: Не полагайтесь только на robots.txt для защиты конфиденциальных данных. Используйте пароли и .htaccess.
Что robots.txt может и чего не может
Может:
- Управлять краулинговым бюджетом (бот не тратит время на ненужные страницы).
- Блокировать дубли, страницы поиска, сортировки.
- Указывать путь к sitemap.
Не может:
- Запретить индексацию страницы (для этого нужен
meta robots noindex). - Скрыть страницу от пользователей (роботы игнорируют, а люди видят).
- Гарантировать, что страница не появится в поиске (если на неё ссылаются другие сайты, бот может её проиндексировать даже при запрете сканирования).
Частая ошибка: Пытаются закрыть страницу от индексации через Disallow, а она всё равно попадает в поиск. Решение: используйте noindex в мета-теге или заголовке X-Robots-Tag.
Влияние robots.txt на индексацию и crawl budget
Crawl budget — это количество страниц, которое поисковый бот может просканировать за одно посещение. Если у вас сотни тысяч страниц, а бот тратит время на мусор (админка, дубли, корзина), важные страницы могут не проиндексироваться. Через robots.txt вы говорите боту: «сюда не ходи, там ничего полезного».
Как оптимизировать: Разрешите только нужные разделы. Для новостного сайта — /news/, /articles/, /about/. Закройте /tag/, /search/, /feed/.
Тестирование и инструменты
Google Search Console (GSC)
- Зайдите в GSC → Инструменты → «Проверка robots.txt».
- Введите URL.
- Оно покажет, какие строки заблокированы и для каких роботов.
Яндекс Вебмастер
- Инструменты → «Проверка robots.txt».
- Аналогично Google.
curl (для продвинутых)
curl -I https://yoursite.com/robots.txt
Посмотрите статус ответа.
Онлайн-тестеры
Частые ошибки и последствия
| Ошибка | Последствие | Как исправить |
|---|---|---|
Disallow: / для всех |
Сайт полностью исчезает из поиска. | Уберите нечаянный Disallow. |
| Блокировка CSS/JS | Google видит «голый» HTML, ранжирует хуже. | Разрешите статику: Allow: /css/ и /js/. |
| Несколько Sitemap | Бот может прочесть только один (но Google умеет читать все). | Укажите одну или используйте sitemap index. |
Случайный пробел в User-agent: * |
Правило не применится. | Пишите без лишних пробелов: User-agent: *. |
| Закрытие страниц 404 в robots.txt | Бесполезно: 404 уже не индексируются. | Удалите. |
Реальный случай: Владелец интернет-магазина случайно поставил Disallow: / при копировании конфига. Сайт исчез из Яндекса за сутки. Вернул обратно — все восстановилось через 2 недели.
Рекомендации: чек-лист для внедрения и проверки robots.txt
- Создайте файл с правилами.
- Загрузите в корень сайта.
- Проверьте доступность:
https://вашсайт.ru/robots.txt→ 200 OK. - Проверьте каждую директиву через инструменты вебмастеров.
- Проверьте, не заблокирована ли важная страница (например, главная, разделы).
- Разрешите CSS/JS, чтобы Google видел дизайн.
- Укажите Sitemap.
- Деплойте на бой.
- Мониторьте в течение недели: появились ли в индексе нужные страницы, не пропали ли неважные.
- Обновляйте при изменении структуры сайта.
Заключение
Robots.txt — простой, но мощный инструмент. Он помогает управлять краулинговым бюджетом, скрывать служебные разделы и указывать поисковикам путь. Но помните: это не защита от индексации. Для конфиденциальных страниц используйте noindex или авторизацию.
Что делать прямо сейчас:
- Откройте свой
https://вашсайт.ru/robots.txt. - Убедитесь, что он не закрывает главную страницу.
- Добавьте ссылку на sitemap.
- Протестируйте через Google Search Console.
Правильно настроенный robots.txt — первый шаг к SEO-успеху. Не игнорируйте его.



Комментарии