Robots.txt (Файл robots) е текстов файл в основната директория на сайта, който дава инструкции на обхождащите ботове кои части от сайта могат или не трябва да обхождат.
Какво означава Robots.txt?
Файлът robots.txt използва протокола Robots Exclusion Protocol. Той обикновено се намира на адрес като example.com/robots.txt и съдържа правила за конкретни ботове или за всички ботове. Най-често се използват директиви като User-agent, Disallow и Allow. Те насочват crawler системите как да се държат при обхождане, но не са механизъм за защита на поверителна информация.
Защо е важно за SEO?
Robots.txt влияе върху crawl budget, техническата оптимизация и достъпа до важни ресурси. Добре настроеният файл може да ограничи обхождането на вътрешни търсения, параметризирани URL адреси, филтри или административни секции. Неправилна директива обаче може да блокира важни страници, CSS, JavaScript или цели секции, което затруднява търсачките да разберат съдържанието и структурата на сайта.
Пример
Ако сайт има вътрешни резултати от търсене на адреси, започващи с /search/, собственикът може да добави Disallow: /search/ за всички ботове. Така crawler системите няма да губят ресурси в голям набор от нискостойностни страници, генерирани от вътрешната търсачка.
Чести грешки
- Блокиране на целия сайт чрез Disallow: / по време на продукционна работа.
- Използване на robots.txt за скриване на чувствителни данни, вместо реален контрол на достъпа.
- Блокиране на ресурси, нужни за правилно рендериране на страниците.
- Очакване, че забраната за обхождане винаги премахва URL от индекса.
Свързани понятия
Свързани понятия са crawl budget, noindex, XML sitemap, Googlebot, обхождане, индексиране и техническо SEO.
Заявете SEO одит