Краулинговый бюджет: что это и как его оптимизировать

Краулинговый бюджет: что это и как его оптимизировать
David Kaufmann
Уроки SEO

Когда речь заходит о SEO, в голову всегда приходят «ключевые слова», «метаданные», заголовки и контент. Но техническое SEO — это другая сторона SEO, которая тоже очень важна и которую нужно учитывать в стратегии поискового продвижения.

Внутри этого мира есть понятие краулингового бюджета. Разберём его подробно!

Что такое краулинговый бюджет?

Краулинговый бюджет — это время, которое Google уделяет сайту, когда его посещает. Этот бюджет влияет на ранжирование и индексацию сайта, и именно поэтому так важно следить за краулинговым бюджетом своего сайта. Чтобы бюджет был оптимальным, ключевые принципы такие:

  • доступность

  • скорость

  • качество

  • авторитет

Что такое краулер?

Краулер — это паук, или бот, который автоматически обходит сайты и их URL. Этот бот сохраняет и классифицирует контент, который затем показывается пользователям в результатах поиска. Его называют Googlebot, и это основной краулер самой важной поисковой системы. Из этого следует, что Google обязательно должен найти ваш сайт и знать о вашем существовании.

Как краулинговый бюджет влияет на мой сайт?

Оптимизированный краулинговый бюджет будет способствовать лучшему положению вашего сайта в поисковых системах. А заодно поможет корректной индексации всех важных страниц. Забывать о краулинговом бюджете в стратегии SEO-продвижения нельзя, потому что время, которое Google вкладывает в знакомство с нашим сайтом, очень важно.

Как это работает?

Пауки Google обходят ваш сайт, и, если краулинговый бюджет небольшой, они вполне могут уйти, так и не просканировав весь новый контент. Бюджет назначается на основе двух факторов:

  • Лимит сканирования: показывает максимальный объём сканирования, который выдерживает сайт, и какие есть предпочтения.

  • Потребность в сканировании: показывает, с какой частотой сайт следует обходить, исходя из популярности площадки и частоты её обновления.

Знаете ли вы, как часто сканируется ваш сайт?

Благодаря Google Search Console мы можем посмотреть статистику сканирования за последние три месяца. В ней видно, сколько страниц бот обходит в день, сколько килобайтов скачивает за день и за какое время в миллисекундах загружается страница. У данных есть среднее значение с оценкой «высокое», «нормальное» и «низкое». Эти данные очень показательны, если учитывать общее число страниц на нашем сайте и средние показатели сканирования в день. По ним можно понять, укладываемся ли мы в норму или, наоборот, краулинговый бюджет нужно улучшать.

Статистика сканирования
Статистика сканирования

Вреден ли маленький краулинговый бюджет?

У маленького краулингового бюджета есть минусы:

  • Контенту сложно быстро выйти в топ, потому что Google не знает о его существовании и, соответственно, не сканирует и не индексирует его.

  • Далёкие от начала сайта области становятся уязвимыми, если краулинговый бюджет мал. У бота не хватит времени пройти по страницам или разделам, которые расположены дальше по сайту.

  • Сделанные доработки по on-page SEO не будут просканированы, а значит, улучшения останутся невидимыми.

  • Если другой сайт проиндексирует и выведет в топ тот же контент раньше нашего, Google может решить, что контент скопировали мы, и наложить за это санкции.

  • Большой краулинговый бюджет сам по себе ничего не гарантирует, если мы его правильно не оптимизируем.

Как ведут себя пауки?

Чтобы понять, какие страницы Google посещает и во что вкладывает время при сканировании, а также совпадает ли это с нашими приоритетами в поисковом продвижении, нужно смотреть информацию из логов.

Логи — это запросы к серверу, которые сохраняются и к которым мы можем обратиться, чтобы узнать, куда Googlebot заходит, а куда нет. Выгрузить и разобрать этот документ проще с помощью ScreamingFrog Log File Analyser.

Анализ логов в ScreamingFrog Log File Analyser
Анализ логов в ScreamingFrog Log File Analyser

Как оптимизировать наш краулинговый бюджет?

Нужно чётко понимать, какие URL для нас ключевые — и для поискового продвижения, и для бизнеса, — чтобы именно они сканировались чаще всего. Нет смысла тратить краулинговый бюджет на страницы, которые на самом деле не важны: страницы с параметрами, пагинации и так далее.

Критично важно не иметь проблем с дублированным контентом и URL, которые каннибализируют одно и то же ключевое слово. Некачественный контент тоже вреден, потому что боты потратят время на его обход.

Чтобы всё оптимизировать, нужно сделать упор на следующих областях:

WPO (Web Performance Optimization)

Оптимизируйте скорость загрузки, или WPO, чтобы Google не тратил на обход вашего сайта слишком много времени. Google любит чистый код и как можно меньшее количество файлов: так проще загружаться и так получается оптимальный пользовательский опыт при просмотре.

Доработки WPO для краулингового бюджета
Доработки WPO для краулингового бюджета

Не забудьте:

  • Уменьшить и сжать файлы CSS и JS

  • Следить за весом и размером изображений и указывать их размеры

  • Выбрать Nginx в качестве сервера, чтобы улучшить продвижение за счёт кеширования.

Ссылки и редиректы

Бот пройдёт по всему контенту вашего сайта, а ещё перейдёт по каждой без исключения ссылке на каждой странице. Чтобы сканирование шло правильно, учитывайте следующее:

  • Избегайте лишних редиректов: Google в них потеряется.

  • Цепочки редиректов — это перенаправления множества URL, из-за которых Google заплутает и не доберётся до конечных адресов.

Цепочки редиректов или петли редиректов
Цепочки редиректов или петли редиректов
  • Битые ссылки (страницы, ссылки на которые отдают статус 404 not found) во внутренней перелинковке.

Screaming Frog и Search Console станут нашими главными союзниками в поиске сбойных редиректов и любых URL с ошибками.

Сбойные редиректы в Search Console
Сбойные редиректы в Search Console

Внутренняя перелинковка

Внутренняя перелинковка — то, за чем критически важно следить, чтобы не перестараться со ссылками и не заставить ботов блуждать по URL.

  • Нужно усиливать самые важные области и оставлять менее важные менее залинкованными. Поэтому есть страницы вроде политики конфиденциальности или страницы про cookie, которые не стоит ставить на каждой странице в главном меню или подвале.

Код

  • Желательно использовать как можно больше HTML, чтобы ботам было проще сканировать и индексировать. Хорошо известно, что страницы на JavaScript Google рендерит и индексирует с трудом.

XML-карта сайта

Карта сайта — один из основополагающих файлов для Google, потому что она обеспечивает корректное сканирование и индексацию сайта.

  • Чем организованнее, тем лучше. Организуйте карту сайта по вертикалям или папкам.

  • Задайте название, которое описывает содержимое. Избегайте слишком общих названий вроде «sitemap 1»

Рекомендации по XML-карте сайта
Рекомендации по XML-карте сайта
  • Отдельная карта сайта для изображений, для видео и по языкам.

  • URL, которые вы включаете, всегда должны быть самыми важными, поэтому не добавляйте страницы с редиректами, без canonical, страницы с фильтрами, пагинации и так далее. Также не включайте малозначимые страницы вроде политики конфиденциальности или cookie.

Robots txt

Вместе с картой сайта файл robots.txt — один из ключевых файлов в индексации и сканировании сайта. Так что не забудьте оптимизировать его по максимуму:

  • Укажите в нём XML-карту сайта, чтобы максимально упростить сканирование.

  • Не закрывайте важные папки. Для этого можно воспользоваться инструментом проверки robots.txt в Search Console и посмотреть, не закрываете ли вы какую-нибудь важную папку или страницу.

Инструмент проверки robots.txt в Search Console
Инструмент проверки robots.txt в Search Console
  • Не закрывайте страницы с редиректами или canonical

  • Откройте доступ к JS и CSS

Теги hreflang

  • Эти вспомогательные атрибуты помогут Google определить, на каких языках и в скольких доступен сайт.

Metarobots noindex и X-Robots-Tag

Эти директивы говорят боту, какие страницы или папки не следует индексировать, но доступ к сканированию они не закрывают.

  • Теги с директивой metarobots «noindex» расходуют краулинговый бюджет, поэтому крайне важно ими не злоупотреблять.

  • Заголовок X-Robots добавляется в хедер на уровне кода и может передать Google сразу несколько директив, в том числе не индексировать страницу.

Использованные источники:

  • José Facchin: What is the crawl Budget, how important is it for Google and how can you improve it?

  • SEOCOM Agency: What is the Crawl Budget?

  • Big SEO Agency: What is the Crawl Budget? Keys to optimize it

  • ContentKing: Crawl budget in SEO: reference guide

  • Mi posicionamiento web: What is the Crawl Budget?

  • Luis Villanueva: What is the Crawl Budget?

  • Neil Patel: How to Use Google's Crawl Budget to Improve Your Website's SEO

  • Search Engine Journal: 7 tips to optimize Crawl Budget for SEO

  • Webmasters Google Blog: What crawl Budget means for Googlebot?

  • DeepCrawl: What is crawl budget?

Автор: David Kaufmann

David Kaufmann

Последние 10 с лишним лет я полностью одержим SEO — и, честно говоря, не хотел бы иначе.

Моя карьера вышла на новый уровень, когда я работал старшим SEO-специалистом в Chess.com — одном из ста самых посещаемых сайтов интернета. Работа в таком масштабе: миллионы страниц, десятки языков и одна из самых конкурентных выдач — научила меня тому, чему не научит ни один курс и ни один сертификат. Этот опыт изменил моё представление о том, как выглядит по-настоящему сильное SEO, и лёг в основу всего, что я построил потом.

Из него выросло SEO Alive — агентство для брендов, которые всерьёз занимаются органическим ростом. Мы не продаём дашборды и ежемесячные отчёты. Мы строим стратегии, которые реально двигают цифры, соединяя классическое SEO с новым и захватывающим миром Generative Engine Optimization (GEO): чтобы ваш бренд появлялся не только в синих ссылках Google, но и внутри ответов, которые ChatGPT, Perplexity и Google AI Overviews каждый день выдают миллионам людей.

А поскольку инструмента, который нормально закрывает оба этих мира, я так и не нашёл, я сделал его сам — SEOcrawl AI, платформу SEO-аналитики корпоративного уровня, где в одном месте собраны позиции, технические аудиты, мониторинг ссылок, здоровье краулинга и отслеживание видимости бренда в ИИ. Это та платформа, которой мне всегда не хватало.

→ Читать все статьи автора David
Больше статей от David Kaufmann

Откройте больше материалов этого автора