Назад в блог Техническое SEO • 8 минут чтения

Файл robots.txt: Стандарты, изменения и ошибки

Протокол исключений для роботов (Robots Exclusion Protocol), созданный Мартином Костером еще в 1994 году, долгие годы оставался относительно неформальным соглашением между вебмастерами и поисковиками. Однако за последние 10–20 лет подход к сканированию и индексации кардинально изменился.

В этой статье специалисты SeoCraft рассказывают про историю развития формата robots.txt, разоблачают популярные мифы, рассматривают ключевые ошибки и предлагают удобный калькулятор типовых конфигураций под любые CMS.

Как изменился robots.txt за последние 10–20 лет?

Долгое время стандарты robots.txt различались от одного поисковика к другому. Яндекс поддерживал уникальные спецификации (например, Clean-param или Host), в то время как Google трактовал инструкции по-своему. Лишь в 2019 году Google возглавил инициативу по превращению REP (Robots Exclusion Protocol) в официальный стандарт IETF (RFC 9309).

1. Официальная стандартизация IETF (RFC 9309)

В 2019–2022 годах регламент сканирования был унифицирован. Было строго закреплено максимальное время ожидания ответа файла (500 Server Error временно приостанавливает обход), максимальный размер файла (до 500 КБ для Google) и правила разрешения конфликтов.

2. Отказ от блокировки CSS и JS файлов

Раньше считалось нормой закрывать папки скриптов и стилей (например, /wp-includes/ в WordPress). Однако с развитием JavaScript-рендеринга (Headless Browsers) Googlebot и Яндекс Бот научились визульно рендерить страницы как браузер. Закрытие CSS/JS теперь мешает поисковику корректно оценить мобильность и верстку сайта.

3. Появление AI-краулеров (2023–2026)

С приходом ChatGPT, Claude, Perplexity и Gemini появились специализированные боты для сбора обучающих данных (например, GPTBot, ClaudeBot, PerplexityBot). Теперь вебмастера используют robots.txt не только для SEO, но и для управления доступом нейросетей к контенту сайта.

Устаревшие vs Актуальные директивы

Директива Статус Комментарий и замена
Host Устарел Удален Яндексом в 2018 г. Заменен на 301-редиректы и тег rel="canonical".
Noindex (в robots) Устарел Google прекратил поддержку в 2019 г. Используйте метатег <meta name="robots" content="noindex"> или HTTP-заголовок.
Crawl-delay Ограничен Google игнорирует директиву. Поддерживается Яндексом и Bing, но настраивается в Панелях вебмастера.
Disallow / Allow Актуален Фундаментальные правила управления доступом к URL-структуре.
Sitemap Критически важен Указывает абсолютный путь к XML-карте сайта для быстрого обнаружения ссылок.

Топ-5 частых ошибок при составлении robots.txt

  • Использование Allow: * вместо Allow: /

    Символ звездочки не является корректным значением для корня сайта. Правильная запись для полного открытия индексации: Allow: /.

  • Попытка деиндексировать страницу через Disallow

    Disallow закрывает файл от сканирования, но НЕ запрещает его индексацию, если на него ведут внешние ссылки. Страница может попасть в индекс без тайтла и описания.

  • Блокировка CSS, JavaScript и изображений

    Запрет на сканирование скриптов и стилей не позволяет ИИ-ботам и поисковикам правильно отрендерить страницу.

  • Ошибки с чувствительностью к регистру (Case Sensitivity)

    Пути в robots.txt учитывают регистр. Disallow: /admin не закроет папку /Admin/.

  • Относительные ссылки в Sitemap

    Директива Sitemap должна содержать только абсолютный URL с указанием протокола (https://domain.com/sitemap.xml).

Калькулятор и генератор типовых robots.txt по CMS

Выберите вашу систему управления контентом (CMS) из списка слева, чтобы сформировать готовый корректный файл robots.txt справа.

💡 Обратите внимание:

Не забудьте заменить example.com на ваш реальный домен в строке Sitemap.

Сгенерированный robots.txt:

                                
                            

Заключение: Файл robots.txt остается ключевой «входной дверью» для всех типов краулеров. Поддерживайте файл в актуальном состоянии, удаляйте устаревшие директивы вроде Host и следите за доступностью ресурсов вашего сайта для современных поисковых и ИИ-систем.

Проверьте техническое состояние вашего сайта

Получите бесплатный разбор файла robots.txt, индексации и видимости в поисковиках.