Зачем нужен файл robots.txt: полный гайд для новичков в 2026 году

Зачем нужен файл robots.txt: полный гайд для новичков в 2026 году

Представьте: вы запустили сайт, наполнили его крутым контентом, а Яндекс и Google его не видят. Или хуже — боты сжирают весь трафик сервера, и сайт падает. Знакомая боль? Чаще всего проблема в файле robots.txt. Этот крошечный текстовый документ управляет тем, как поисковые роботы сканируют ваш сайт. Если его нет или он настроен неправильно — вы теряете клиентов, деньги и нервы. В этом гайде я расскажу, зачем нужен robots.txt, как его создать и не наделать ошибок. Пошагово, для новичков.

Что такое robots.txt и где он лежит

Robots.txt — это обычный текстовый файл, который лежит в корне сайта. Он даёт указания поисковым роботам: какие страницы можно сканировать, а какие — нет. Никакой магии: просто набор правил, которые боты читают перед обходом.

Где искать: https://вашсайт.ru/robots.txt. Если открыть эту ссылку и увидеть текст — все ок. Если ошибка 404 — файла нет.

Как создать: Откройте блокнот (Notepad), напишите директивы, сохраните как robots.txt в кодировке UTF-8 без BOM. Затем загрузите в корень сайта через FTP или админку хостинга.

Как работает robots.txt

Когда поисковый бот приходит на сайт, он первым делом запрашивает robots.txt. Если файл есть — он парсит директивы и действует согласно им. Если файла нет — бот считает, что можно сканировать всё.

Порядок обработки:

  1. Бот делает GET-запрос к https://вашсайт.ru/robots.txt.
  2. Получает ответ: 200 OK, 404, 403 или 5xx.
  3. Если 200 — читает содержимое и применяет правила.
  4. Если 404 — сканирует весь сайт (как будто файла нет).
  5. Если 403 или 5xx — боты могут вести себя по-разному (Google временно прекращает сканирование, Яндекс может считать, что доступа нет).

Важно: Robots.txt — это не запрет в юридическом смысле. Это просьба. Послушные боты (Google, Яндекс, Bing) соблюдают, но некоторые (плохие) игнорируют.

Основные директивы robots.txt с примерами

В файле используются директивы. Каждая группа правил начинается с User-agent, затем идут Disallow, Allow и другие.

Директива Описание Пример
User-agent Указывает, к какому роботу относятся правила. * — для всех. User-agent: *
Disallow Запрещает сканирование определённых URL или папок. Пустое значение — разрешить всё. Disallow: /admin/
Allow Разрешает сканирование, даже если есть Disallow. Только для Google и Bing. Allow: /admin/public/
Sitemap Указывает путь к карте сайта. Sitemap: https://вашсайт.ru/sitemap.xml
Crawl-delay Задаёт задержку между запросами (в секундах). Поддерживается не всеми. Crawl-delay: 5

Пример полного файла:

User-agent: *
Disallow: /admin/
Disallow: /private/
Allow: /admin/public/
Sitemap: https://mysite.ru/sitemap.xml

Примеры для реальных кейсов

Блокировка админки

Если у вас WordPress, закройте /wp-admin/:

User-agent: *
Disallow: /wp-admin/

Публичный сайт + staging на поддомене

На поддомене staging.mysite.ru разместите robots.txt, который закрывает всё:

User-agent: *
Disallow: /

Блокировка динамических параметров

Закрыть страницы с ? и sessionid:

User-agent: *
Disallow: /*?
Disallow: /*sessionid=

Как разные поисковые системы трактуют директивы

  • Google: поддерживает Allow, Crawl-delay игнорирует (использует свой механизм), максимальный размер файла 500 КБ, игнорирует строки после 5000 символов.
  • Yandex: уважает Crawl-delay, может игнорировать Allow, если Disallow и Allow конфликтуют — приоритет у Disallow. Максимальный размер 32 КБ.
  • Bing: поддерживает Allow, Crawl-delay — да, но не обязан соблюдать. Размер до 500 КБ.

Важно: Не полагайтесь только на robots.txt для защиты конфиденциальных данных. Используйте пароли и .htaccess.

Что robots.txt может и чего не может

Может:

  • Управлять краулинговым бюджетом (бот не тратит время на ненужные страницы).
  • Блокировать дубли, страницы поиска, сортировки.
  • Указывать путь к sitemap.

Не может:

  • Запретить индексацию страницы (для этого нужен meta robots noindex).
  • Скрыть страницу от пользователей (роботы игнорируют, а люди видят).
  • Гарантировать, что страница не появится в поиске (если на неё ссылаются другие сайты, бот может её проиндексировать даже при запрете сканирования).

Частая ошибка: Пытаются закрыть страницу от индексации через Disallow, а она всё равно попадает в поиск. Решение: используйте noindex в мета-теге или заголовке X-Robots-Tag.

Влияние robots.txt на индексацию и crawl budget

Crawl budget — это количество страниц, которое поисковый бот может просканировать за одно посещение. Если у вас сотни тысяч страниц, а бот тратит время на мусор (админка, дубли, корзина), важные страницы могут не проиндексироваться. Через robots.txt вы говорите боту: «сюда не ходи, там ничего полезного».

Как оптимизировать: Разрешите только нужные разделы. Для новостного сайта — /news/, /articles/, /about/. Закройте /tag/, /search/, /feed/.

Тестирование и инструменты

Google Search Console (GSC)

  1. Зайдите в GSC → Инструменты → «Проверка robots.txt».
  2. Введите URL.
  3. Оно покажет, какие строки заблокированы и для каких роботов.

Яндекс Вебмастер

  1. Инструменты → «Проверка robots.txt».
  2. Аналогично Google.

curl (для продвинутых)

curl -I https://yoursite.com/robots.txt

Посмотрите статус ответа.

Онлайн-тестеры

Частые ошибки и последствия

Ошибка Последствие Как исправить
Disallow: / для всех Сайт полностью исчезает из поиска. Уберите нечаянный Disallow.
Блокировка CSS/JS Google видит «голый» HTML, ранжирует хуже. Разрешите статику: Allow: /css/ и /js/.
Несколько Sitemap Бот может прочесть только один (но Google умеет читать все). Укажите одну или используйте sitemap index.
Случайный пробел в User-agent: * Правило не применится. Пишите без лишних пробелов: User-agent: *.
Закрытие страниц 404 в robots.txt Бесполезно: 404 уже не индексируются. Удалите.

Реальный случай: Владелец интернет-магазина случайно поставил Disallow: / при копировании конфига. Сайт исчез из Яндекса за сутки. Вернул обратно — все восстановилось через 2 недели.

Рекомендации: чек-лист для внедрения и проверки robots.txt

  1. Создайте файл с правилами.
  2. Загрузите в корень сайта.
  3. Проверьте доступность: https://вашсайт.ru/robots.txt → 200 OK.
  4. Проверьте каждую директиву через инструменты вебмастеров.
  5. Проверьте, не заблокирована ли важная страница (например, главная, разделы).
  6. Разрешите CSS/JS, чтобы Google видел дизайн.
  7. Укажите Sitemap.
  8. Деплойте на бой.
  9. Мониторьте в течение недели: появились ли в индексе нужные страницы, не пропали ли неважные.
  10. Обновляйте при изменении структуры сайта.

Заключение

Robots.txt — простой, но мощный инструмент. Он помогает управлять краулинговым бюджетом, скрывать служебные разделы и указывать поисковикам путь. Но помните: это не защита от индексации. Для конфиденциальных страниц используйте noindex или авторизацию.

Что делать прямо сейчас:

  • Откройте свой https://вашсайт.ru/robots.txt.
  • Убедитесь, что он не закрывает главную страницу.
  • Добавьте ссылку на sitemap.
  • Протестируйте через Google Search Console.

Правильно настроенный robots.txt — первый шаг к SEO-успеху. Не игнорируйте его.

ПП

Технический писатель с 6-летним опытом. Писал документацию для Яндекс Облака, потом ушёл в EdTech-контент. Автор 50+ гайдов, которые суммарно прочитали 2 млн раз. Его принцип: "Если читатель не смо...

guides
Понравилась статья?

Как вам статья?

Комментарии

Пока нет комментариев

Читайте также

← Все статьи журнала