robots.txt: полное руководство по настройке

robots.txt: полное руководство по настройке
David Kaufmann
Уроки SEO

Устали слышать про robots.txt и не понимать, о чём идёт речь? Не переживайте, сегодня мы принесли решение вашей проблемы. В этой статье постараемся объяснить, что такое robots.txt, как его настроить (особенно в WordPress) и какое влияние он может оказать на SEO нашего проекта.

Поехали!

Что такое robots.txt и зачем он нужен?

robots.txt — это просто файл, размещённый в корне сайта, который позволяет запретить определённым ботам (например, ботам Google или Bing) заходить на ваш сайт или в отдельные его части.

ВНИМАНИЕ: важно понимать, что это протокол, и по общему правилу все «хорошие» боты его соблюдают (GoogleBot, BingBot, Semrush, ...), но любой бот с дурными намерениями может его проигнорировать — например, Screaming Frog, если включить вот эту опцию:

игнорировать robots.txt в screaming frog
игнорировать robots.txt в screaming frog

Почему файл robots.txt важен для SEO?

Как мы уже упоминали, все хорошие боты (например, GoogleBot) соблюдают этот протокол, поэтому мы можем использовать файл, чтобы направлять Google по нашему сайту. Страницы, которые вы здесь запретите, появятся с пометкой «Заблокировано в robots.txt» в Google Search Console.

Что? В смысле? Направлять Google с помощью robots.txt?

Да, не переживайте, объясним на примере — так станет гораздо понятнее:

Представьте, что на вашем сайте есть закрытый раздел, куда попадают только зарегистрированные пользователи, а как мы прекрасно знаем, Google не может зайти ни на один сайт, требующий авторизации (пока...).

Так разве не логично, чтобы Google не тратил наш краулинговый бюджет на сканирование страниц, которые не представляют для него ценности?

Именно! Одно из важнейших применений robots.txt — закрывать пути, малоценные для Google, и тем самым заставлять его сосредоточиться на важных страницах нашего сайта. Поэтому robots.txt должен быть одной из опор в нашей SEO-стратегии.

И это лишь один пример из тысяч вещей, которые можно сделать с этим файлом. Среди прочего: указать наш sitemap, увеличить интервал сканирования, закрыть от сканирования ресурсы, ...

Как создать файл robots.txt

Что ж... за работу!

Создать этот файл действительно просто: достаточно взять текстовый редактор (Блокнот в Windows или TextEdit на Mac) либо онлайн-редактор и после составления robots.txt экспортировать его в формате txt.

Когда файл готов, остаётся назвать его «robots.txt» и загрузить в корень сайта через панель сервера или по FTP.

Чтобы проверить, загрузился ли он корректно, достаточно добавить к вашему домену «/robots.txt», например https://seocrawl.ai/robots.txt

ВНИМАНИЕ: осторожнее с кэшем — лучше смотреть в режиме инкогнито ;)

А если у меня WordPress?

Если у вас WordPress, всё проще: лучшие SEO-плагины, такие как Rank Math или Yoast, имеют встроенный модуль для редактирования robots.txt напрямую.

В случае Rank Math вы найдёте его в Rank Math > General Settings > Edit robots.txt

Robots TXT в Wordpress
Robots TXT в Wordpress

В случае Yoast нужно пройти в SEO > Tools > File Editor

Так вы легко отредактируете или создадите файл, не выполняя ни одного из описанных выше шагов.

Команды

Ниже разберём многие из доступных нам команд вместе с соответствующими примерами:

Закрыть сайт от сканирования

User-agent: * Disallow: /

ПРИМЕЧАНИЕ: если вы разрабатываете сайт и не хотите, чтобы хоть один бот заходил, читал и индексировал ваш контент, это правило отлично подойдёт.

Закрыть от сканирования страницу

User-agent: * Disallow: /url-of-page-i-dont-want-crawled

Закрыть от сканирования папку

User-agent: * Disallow: /folder/

Разрешить доступ к странице

User-agent: * Allow: /page

Закрыть папку и разрешить страницу в этой папке

User-agent: * Disallow: /folder/ Allow: /folder/page

Указать sitemap

Sitemap: https://domain.com/sitemap.xml

Давать указания конкретным ботам

На этом остановимся чуть подробнее. Если вы заметили, большинство предыдущих директив начиналось со строки:

User-agent: *

Эта «*» означает всех ботов. То есть все директивы после этой строки применяются ко всем ботам. Если же мы хотим отдать отдельные распоряжения конкретным ботам, нужно изменить её так:

User-agent: Googlebot если мы хотим обратиться к боту Google

User-agent: Bingbot если мы хотим обратиться к боту Bing

User-agent: DuckDuckBot если мы хотим обратиться к боту DuckDuckGo

Остаётся лишь выяснить, как называется бот, которому вы хотите отдать распоряжение, и указать его так, как мы только что показали.

Проверьте и протестируйте файл robots.txt

Теперь, когда вы закончили «доводку» своего robots и он полностью оптимизирован и подогнан под ваш сайт, остаётся только его протестировать.

Протестировать? Зачем?

Затем, чтобы убедиться, что мы не напортачили ни в одной строке и что файл действительно закрывает те части сайта, которые мы хотим закрыть.

Для этого рекомендуем воспользоваться этим инструментом.

Инструмент для проверки robots txt 1.jpg
Инструмент для проверки robots txt 1.jpg

Оказавшись внутри, вам нужно лишь:

  • Ввести URL, для которого хотите проверить, разрешено ли сканирование

  • Выбрать User Agent

  • Нажать TEST

Сразу после этого загрузится весь наш файл robots.txt, а ниже будет указано, разрешён доступ или нет.

Результат проверки robots txt.jpg
Результат проверки robots txt.jpg

В данном случае, как видим, результат положительный, но если бы мы ввели URL, доступ к которому запрещён, инструмент подсветил бы ещё и строку, которая его блокирует:

Пример URL, заблокированного robots txt.jpg
Пример URL, заблокированного robots txt.jpg

Кроме того, этот инструмент позволяет править наш robots.txt прямо оттуда и вносить любые нужные изменения, чтобы результат совпал с нашей целью. После правки и проверки остаётся лишь применить эти новые изменения к нашему robots.

Бонус: сделайте свой robots.txt незабываемым

Мы показали вам уйму строк кода, которые работают для ботов, но вы также можете вставлять комментарии, начиная строку с «#». То есть всё, что начинается с «#», боты проигнорируют. Это открывает целый мир возможностей и внутренних шуток. Поэтому советуем заглянуть в robots.txt сайтов windupschool, pccomponentes или Minube — наверняка вас там ждёт сюрприз ?

Minube Robots TXT
Minube Robots TXT

Заключение

Как вы убедились, файлу robots.txt есть что предложить, и он же требует немалой аккуратности: неудачно поставленная директива способна закрыть от сканирования весь ваш сайт.

Надеемся, это руководство вам пригодится, а по любым вопросам — увидимся в комментариях.

Автор: David Kaufmann

David Kaufmann

Последние 10 с лишним лет я полностью одержим SEO — и, честно говоря, не хотел бы иначе.

Моя карьера вышла на новый уровень, когда я работал старшим SEO-специалистом в Chess.com — одном из ста самых посещаемых сайтов интернета. Работа в таком масштабе: миллионы страниц, десятки языков и одна из самых конкурентных выдач — научила меня тому, чему не научит ни один курс и ни один сертификат. Этот опыт изменил моё представление о том, как выглядит по-настоящему сильное SEO, и лёг в основу всего, что я построил потом.

Из него выросло SEO Alive — агентство для брендов, которые всерьёз занимаются органическим ростом. Мы не продаём дашборды и ежемесячные отчёты. Мы строим стратегии, которые реально двигают цифры, соединяя классическое SEO с новым и захватывающим миром Generative Engine Optimization (GEO): чтобы ваш бренд появлялся не только в синих ссылках Google, но и внутри ответов, которые ChatGPT, Perplexity и Google AI Overviews каждый день выдают миллионам людей.

А поскольку инструмента, который нормально закрывает оба этих мира, я так и не нашёл, я сделал его сам — SEOcrawl AI, платформу SEO-аналитики корпоративного уровня, где в одном месте собраны позиции, технические аудиты, мониторинг ссылок, здоровье краулинга и отслеживание видимости бренда в ИИ. Это та платформа, которой мне всегда не хватало.

→ Читать все статьи автора David
Больше статей от David Kaufmann

Откройте больше материалов этого автора