SEO термин

Robots Exclusion Protocol (Протокол за изключване на роботи)

Стандартът (включващ robots.txt), използван от сайтовете за комуникация с уеб ботовете.

Robots Exclusion Protocol е стандарт за комуникация между уебсайтове и автоматизирани ботове, включително търсачки. Чрез него сайтът може да посочи кои части не трябва да бъдат обхождани от определени роботи. Най-познатият му елемент е файлът robots.txt, който се поставя в основната директория на домейна.

Какво означава Robots Exclusion Protocol?

Протоколът за изключване на роботи определя прост набор от правила, които crawler-и могат да прочетат преди обхождане. В robots.txt се използват директиви като User-agent, Disallow и Allow. Те казват за кои ботове важи дадено правило и кои URL пътища са разрешени или ограничени за обхождане. Протоколът разчита на доброволно спазване от страна на ботовете и не е механизъм за защита на поверителна информация.

Защо е важно за SEO?

Правилно написаният robots.txt помага да се управлява crawl budget, да се ограничат технически или дублиращи се секции и да се избегне ненужно натоварване от обхождане. Неправилна директива обаче може да блокира важни страници, CSS, JavaScript или изображения, което затруднява търсачката да разбере и индексира сайта коректно.

Пример

Директива като Disallow: /admin/ казва на съответния бот да не обхожда административната секция. Ако обаче се използва Disallow: / по невнимание, целият сайт може да бъде блокиран за обхождане от посочения user-agent.

Чести грешки

  • Използване на robots.txt за скриване на чувствителни данни вместо реална защита с достъп.
  • Блокиране на ресурси, нужни за рендериране на страниците.
  • Объркване между обхождане и индексиране.
  • Липса на тест след миграция, промяна на CMS или пускане на нова версия.

Свързани понятия

Robots Exclusion Protocol е свързан с robots.txt, crawler-и, crawl budget, noindex, canonical тагове и XML sitemap. Важно е да се различава забраната за обхождане от указанията за индексиране, защото те решават различни SEO проблеми.

Robots.txt премахва ли страница от индекса?

Не директно. Robots.txt управлява обхождането. За контрол върху индексирането обикновено се използва noindex, когато страницата може да бъде достъпена и прочетена от търсачката.

Всички ботове ли спазват Robots Exclusion Protocol?

Не. Добросъвестните търсачки и crawler-и обикновено го спазват, но злонамерени или некачествени ботове могат да го игнорират.

Къде се намира файлът robots.txt?

Той трябва да бъде достъпен в основата на домейна, например example.com/robots.txt. Поддомейните използват отделни файлове.