robots.txt — текстовый файл в корне домена, который сообщает веб-краулерам, какие пути на сайте им разрешено или не разрешено запрашивать. Он использует простой синтаксис из строк User-agent (к какому краулеру применяются правила) и Allow / Disallow (какие пути URL).
Определение
robots.txt — текстовый файл в корне домена, который сообщает веб-краулерам, какие пути на сайте им разрешено или не разрешено запрашивать. Он использует простой синтаксис из строк User-agent (к какому краулеру применяются правила) и Allow / Disallow (какие пути URL).
Соблюдающие правила краулеры, включая крупные поисковики, читают его перед краулом и уважают его директивы; это конвенция, а не принудительный контроль безопасности.
Самое важное про robots.txt — понять, чего он не делает. Disallow URL предотвращает краул, но не предотвращает индексацию: если на закрытый URL ссылаются другие страницы, поисковик всё равно может показать его в выдаче голой ссылкой без сниппета, потому что он знает, что URL существует, но не был допущен загрузить его контент.
Чтобы держать страницу вне индекса, правильный инструмент — директива noindex на самой странице, что требует, чтобы страница была краулимой, поэтому она не должна быть одновременно закрыта в robots.txt.
В контексте
На большом iGaming-аффилиатном сайте robots.txt используют, чтобы держать краулеров вдали от путей без ценности, которые тратили бы краул-бюджет: внутренний поиск, комбинации параметров фильтров вне вайтлиста, сессионные и трекинговые параметры, admin- и staging-пути и паттерны URL бесконечной прокрутки или календаря. Сделанное хорошо, это концентрирует внимание краулера на контентных страницах, которые должны ранжироваться.
Частые дорогие ошибки — закрыть то, что должно краулиться: случайный Disallow: /, оставленный от staging-конфига, блокировка пути к CSS или JS, нужному странице для рендеринга (что ломает mobile-first рендеринг), или блокировка раздела, чьи страницы несут noindex, так что noindex никогда не читается и URL висят в индексе голыми ссылками. robots.txt стоит пересматривать после каждой миграции сайта и смены шаблона, тестировать в robots.txt-тестере поисковика и правильно сочетать с noindex и canonical, а не использовать вместо них.
Разобранный пример
Аффилиат проверяет свой robots.txt и находит Disallow: /reviews/, оставшийся от редизайна, который тихо снял с краула 800 страниц-обзоров с noindex,follow. Он убирает disallow, чтобы страницы могли быть перекраулены, noindex наконец читается, и задуманное поведение краула и индекса восстанавливается.
Связанные термины
Частые вопросы
Смотрите полный глоссарий iGaming и арбитража — сотни терминов EN/RU с примерами.
← Назад к глоссарию