Файл robots.txt: Стандарты, изменения и ошибки
Протокол исключений для роботов (Robots Exclusion Protocol), созданный Мартином Костером еще в 1994 году, долгие годы оставался относительно неформальным соглашением между вебмастерами и поисковиками. Однако за последние 10–20 лет подход к сканированию и индексации кардинально изменился.
В этой статье специалисты SeoCraft рассказывают про историю развития формата robots.txt, разоблачают популярные мифы, рассматривают ключевые ошибки и предлагают удобный калькулятор типовых конфигураций под любые CMS.
Как изменился robots.txt за последние 10–20 лет?
Долгое время стандарты robots.txt различались от одного поисковика к другому. Яндекс поддерживал уникальные спецификации (например, Clean-param или Host), в то время как Google трактовал инструкции по-своему. Лишь в 2019 году Google возглавил инициативу по превращению REP (Robots Exclusion Protocol) в официальный стандарт IETF (RFC 9309).
1. Официальная стандартизация IETF (RFC 9309)
В 2019–2022 годах регламент сканирования был унифицирован. Было строго закреплено максимальное время ожидания ответа файла (500 Server Error временно приостанавливает обход), максимальный размер файла (до 500 КБ для Google) и правила разрешения конфликтов.
2. Отказ от блокировки CSS и JS файлов
Раньше считалось нормой закрывать папки скриптов и стилей (например, /wp-includes/ в WordPress). Однако с развитием JavaScript-рендеринга (Headless Browsers) Googlebot и Яндекс Бот научились визульно рендерить страницы как браузер. Закрытие CSS/JS теперь мешает поисковику корректно оценить мобильность и верстку сайта.
3. Появление AI-краулеров (2023–2026)
С приходом ChatGPT, Claude, Perplexity и Gemini появились специализированные боты для сбора обучающих данных (например, GPTBot, ClaudeBot, PerplexityBot). Теперь вебмастера используют robots.txt не только для SEO, но и для управления доступом нейросетей к контенту сайта.
Устаревшие vs Актуальные директивы
| Директива | Статус | Комментарий и замена |
|---|---|---|
| Host | Устарел | Удален Яндексом в 2018 г. Заменен на 301-редиректы и тег rel="canonical". |
| Noindex (в robots) | Устарел | Google прекратил поддержку в 2019 г. Используйте метатег <meta name="robots" content="noindex"> или HTTP-заголовок. |
| Crawl-delay | Ограничен | Google игнорирует директиву. Поддерживается Яндексом и Bing, но настраивается в Панелях вебмастера. |
| Disallow / Allow | Актуален | Фундаментальные правила управления доступом к URL-структуре. |
| Sitemap | Критически важен | Указывает абсолютный путь к XML-карте сайта для быстрого обнаружения ссылок. |
Топ-5 частых ошибок при составлении robots.txt
-
Использование Allow: * вместо Allow: /
Символ звездочки не является корректным значением для корня сайта. Правильная запись для полного открытия индексации:
Allow: /. -
Попытка деиндексировать страницу через Disallow
Disallowзакрывает файл от сканирования, но НЕ запрещает его индексацию, если на него ведут внешние ссылки. Страница может попасть в индекс без тайтла и описания. -
Блокировка CSS, JavaScript и изображений
Запрет на сканирование скриптов и стилей не позволяет ИИ-ботам и поисковикам правильно отрендерить страницу.
-
Ошибки с чувствительностью к регистру (Case Sensitivity)
Пути в
robots.txtучитывают регистр.Disallow: /adminне закроет папку/Admin/. -
Относительные ссылки в Sitemap
Директива
Sitemapдолжна содержать только абсолютный URL с указанием протокола (https://domain.com/sitemap.xml).
Калькулятор и генератор типовых robots.txt по CMS
Выберите вашу систему управления контентом (CMS) из списка слева, чтобы сформировать готовый корректный файл robots.txt справа.
💡 Обратите внимание:
Не забудьте заменить example.com на ваш реальный домен в строке Sitemap.
Заключение: Файл robots.txt остается ключевой «входной дверью» для всех типов краулеров. Поддерживайте файл в актуальном состоянии, удаляйте устаревшие директивы вроде Host и следите за доступностью ресурсов вашего сайта для современных поисковых и ИИ-систем.
Проверьте техническое состояние вашего сайта
Получите бесплатный разбор файла robots.txt, индексации и видимости в поисковиках.