
Нужна помощь с реализацией?
Наша команда готова взяться за ваш проект. Оставьте заявку — мы свяжемся с вами и обсудим детали.
Похожие статьи
Все статьи

Семантическое ядро сайта: пошаговая инструкция по сбору ключевых слов для продвижения
Читать полностью

Мультиязычный сайт: SEO-оптимизация, настройка hreflang и локализация для нейросетей
Читать полностью

Структурированные данные Schema.org: как улучшить видимость сайта в поиске в 2026 году
Читать полностью
Телеграмм
Делимся визуально привлекательными фрагментами наших последних веб-проектов.
ВКонтакте
Пишем о интересных технических решениях и вызовах в разработке.
MAX
Демонстрируем дизайнерские элементы наших веб-проектов.
TenChat
Деловые связи, кейсы и экспертные публикации.
Рассылка
© 2025-2026 МАЙПЛ. Все права защищены.
robots.txt — текстовый файл в корне сайта, который указывает роботам, какие разделы не обходить. Он запрещает обход, но не гарантирует отсутствие страницы в индексе: для этого нужен мета-тег noindex.
Рабочие директивы в 2026 году: User-agent, Disallow, Allow, Sitemap и Clean-param у Яндекса. Host и Crawl-delay отменены, скорость обхода теперь задается в Вебмастере.
Ниже — шаблоны под пять типов сайтов и CMS, решение по ботам нейросетей вроде GPTBot и ClaudeBot и проверка файла на ошибки за несколько шагов.

Disallow закрывает страницу от обхода, а не от появления в выдаче. Допустим, магазин закрыл страницу акции, а на нее уже ведут внешние ссылки. Робот внутрь не заходит и содержимого не видит, но адрес все равно попадает в выдачу — голым URL, без заголовка и описания. Это и есть разница между обходом и индексацией.
Еще одно ограничение: файл — рекомендация, а не замок. Людей и недобросовестных ботов он не остановит.
| Задача | Disallow | noindex | Пароль |
|---|---|---|---|
| Убрать страницу из выдачи | Не помогает | Подходит | Не нужен |
| Скрыть контент от посетителей | Не помогает | Не помогает | Подходит |
| Не тратить обход на служебное | Подходит | Не помогает | Не нужен |
Главная ловушка: если сразу закрыть раздел через Disallow, робот не дойдет до страницы и не увидит на ней noindex. Порядок обратный: сначала noindex, дождаться выпадения из индекса, потом Disallow.
Откройте свой файл и найдите разделы, закрытые «чтобы не было в индексе». Проверьте, стоит ли на этих страницах noindex.

| Директива | Роботы | Что делает | Пример строки |
|---|---|---|---|
| User-agent | Все | Задает, для какого робота группа правил | User-agent: * |
| Disallow | Яндекс, Google | Запрещает обход пути | Disallow: /cart/ |
| Allow | Яндекс, Google | Открывает исключение внутри запрета | Allow: /cart/help/ |
| Sitemap | Яндекс, Google | Сообщает адрес карты сайта | Sitemap: полный адрес с https |
| Clean-param | Яндекс | Склеивает дубли по GET-параметрам | Clean-param: utm_source /catalog/ |
Знак * заменяет любую последовательность символов, $ фиксирует конец адреса, а все после # — комментарий: Disallow: /*.pdf$ # закрыли все PDF.
Если Allow и Disallow спорят за один адрес, побеждает более длинное правило, а не то, что выше по файлу. В строке Sitemap нужен полный адрес с протоколом, и таких строк может быть несколько — например, по карте на раздел.
Несколько параметров пишут через «&» и добавляют путь: Clean-param: utm_source&utm_medium&sort /catalog/. Яндекс склеит адреса с метками в одну страницу.
Риск — склеить важное. Если параметр меняет содержимое, например цвет или размер товара, разные страницы превратятся в одну. Google эту директиву не читает: для него — canonical или Disallow по маске /*?utm_.
Выпишите из Метрики параметры, которые чаще всего встречаются в адресах, и соберите их в одну строку Clean-param.

Роль Host теперь выполняют 301-редирект и настройка главного зеркала в Вебмастере. Crawl-delay Яндекс игнорирует, а Google не поддерживал ее никогда. Скорость обхода у Яндекса задается в Вебмастере, в разделе «Индексирование», а Google подстраивает ее сам по ответам сервера.
Если сервер проседает под роботом, снизьте скорость в Вебмастере и проверьте ответы 5xx — Crawl-delay тут не поможет. Не оставляйте Host с доменом без https или со старым зеркалом: это только путает.
Удалите обе строки из файла и проверьте, что редирект ведет на главное зеркало.

Шаблон — стартовая точка: пути сверьте со своей структурой. Базовые требования: файл лежит только в корне домена, отдает код 200 без редиректов, сохранен в UTF-8, у каждого поддомена свой файл.
Лендинг:
User-agent: * # правила для всех роботов
Disallow: /thanks/ # страница после заявки
Sitemap: https://site.ru/sitemap.xml # с протоколом и доменом
Корпоративный сайт:
User-agent: * # для всех
Disallow: /admin/ # панель управления
Disallow: /search/ # внутренний поиск
Sitemap: https://site.ru/sitemap.xml
Магазин с фильтрами:
User-agent: * # для всех
Disallow: /cart/ # корзина
Disallow: /*?sort= # сортировки
Disallow: /*?*& # сочетания фильтров
Allow: /catalog/*/filter/ # посадочные фильтры с трафиком
Sitemap: https://site.ru/sitemap.xml
Если фильтры плодят массу адресов, закрывайте сортировки и сочетания, но оставляйте посадочные страницы фильтров, которые приносят трафик. Замените домен в строке Sitemap и загрузите файл в корень.
У SPA и динамических сайтов карту сайта генерирует сервер, и она обновляется при каждом деплое. Папки с JS не закрывайте: без скриптов робот увидит пустую страницу.
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /?s=
Disallow: /xmlrpc.php
Disallow: /feed/ # по необходимости
Disallow: /tag/ # по необходимости
CSS и JS не закрывайте, иначе Google не отрисует страницу. SEO-плагины генерируют виртуальный файл, а физический его перекрывает.
User-agent: *
Disallow: /bitrix/
Allow: /bitrix/js/
Allow: /bitrix/templates/
Allow: /upload/
Disallow: /personal/
Disallow: /auth/
Disallow: /basket/
Disallow: /*?sort=
Disallow: /*PAGEN
Не пишите Disallow: /upload/ целиком — картинки товаров пропадут из поиска по изображениям.

К обычным роботам добавились краулеры нейросетей, и у них другое назначение: они не строят выдачу, а собирают материал для обучения моделей и для ответов ассистентов. Запрет для них прописывается тем же способом, что и для поисковых роботов, — отдельной группой User-agent в том же файле.
| User-agent | Чей бот | Зачем приходит | Влияет ли запрет на обычный поиск |
|---|---|---|---|
| GPTBot | OpenAI | Сбор данных для обучения моделей | Нет, это не Googlebot |
| ClaudeBot | Anthropic | Сбор данных для обучения моделей | Нет, отдельный краулер |
| PerplexityBot | Perplexity | Обход страниц для ответов ассистента с ссылками на источник | Нет, не пересекается с поиском |
| YandexAdditional | Яндекс | Обучение алгоритмов и нейросетевых сервисов компании | Нет, основной YandexBot работает отдельно |
Запрет YandexAdditional или GPTBot не выкидывает сайт из обычной выдачи Яндекса и Google: эти строки касаются только конкретного бота, а не всей поисковой системы. Смешивать их с директивами для YandexBot или Googlebot не нужно.
Аргументы по обе стороны спокойные, без крайностей. За открытый доступ: упоминания и ссылки в ответах нейросетей, новый канал переходов на сайт. Против: контент уходит на обучение моделей без явного согласия, краулеры создают лишнюю нагрузку на сервер, а платные материалы могут пересказываться в ответах без визита читателя на сайт.
Коммерческому сайту с услугами обычно выгоднее пускать этих ботов: упоминания в ответах ассистентов работают как дополнительный источник заявок. Медиа с платным контентом чаще закрывают обучающих ботов, чтобы материалы не пересказывались бесплатно за пределами сайта.
Рабочий вариант для первого случая — просто не добавлять для этих user-agent отдельных запретов. Для второго добавляют блок вида User-agent: GPTBot и Disallow: /, повторяя строку для каждого нужного бота. Комбинированный вариант тоже возможен: блог остается открытым, а закрытый платный раздел получает Disallow отдельной строкой в той же группе.
Запрет в robots.txt остается просьбой: часть ботов ее не соблюдает, поэтому для действительно закрытых данных нужна авторизация, а не только строка в файле. После правки бот подхватит новые правила не сразу: по RFC 9309 краулер не должен использовать кэшированную копию robots.txt дольше 24 часов, так что обновление отражается на его поведении в течение суток.
Прежде чем что-то запрещать, стоит посмотреть в логах сервера, какие из этих ботов уже заходят на сайт и как часто — это покажет, есть ли смысл вообще их регулировать.

Если число страниц в поиске резко упало, первым делом откройте site.ru/robots.txt в браузере. Найдите строку Disallow: / без уточнений, проверьте код ответа файла и сверьте пару адресов из sitemap с правилами.
Конфликт sitemap и Disallow поисковики читают по-разному: Яндекс в Вебмастере покажет предупреждение, а Google может проиндексировать закрытый URL без содержимого. Пройдите эти четыре шага на своем сайте.

В Яндекс.Вебмастере откройте «Инструменты → Анализ robots.txt», вставьте правки и список URL. Зеленая отметка значит, что доступ открыт. Красный текст покажет правило, которое закрывает адрес.
В Google Search Console отчет robots.txt в настройках показывает загруженную версию файла и ошибки, а «Проверка URL» — доступ для конкретной страницы.
Типовые сообщения читаются так: «заблокировано в файле robots.txt» — адрес попал под Disallow, ищите правило; «проиндексировано, несмотря на блокировку» — страница закрыта от обхода, но есть в индексе, нужен noindex вместо запрета; ошибка загрузки файла — проверьте код ответа и редиректы. Пути в интерфейсах меняются, сверьте их перед работой.
Исправили ошибку, которая закрывала важные разделы, — отправьте файл на перепроверку и запросите переобход ключевых URL, не дожидаясь робота. Кэш файла живет до суток, изменения в выдаче видны через несколько дней или недель.
Проверяйте боевой домен, а не тестовый поддомен: правила на них часто разные.
Прогоните самые важные URL сайта через оба сервиса и убедитесь, что доступ к ним открыт.
Сомневаетесь, что закрыто лишнее? Технический разбор индексации входит в SEO-продвижение МАЙПЛ от 80 000 ₽ — покажем, какие страницы робот не видит.