Настройка и проверка robots.txt для закрытия технических дублей
Дата публикации: 16.06.2026

Настройка и проверка robots.txt для закрытия технических дублей

Хочу себе такие же кнопки

Что вы получите от этого урока

Вы узнаете, как правильно настроить файл robots.txt, чтобы закрывать технические дубли страниц, какие правила писать, как проверять их работу и какие подводные камни могут подстерегать вас в процессе. После урока вы сможете быстро решить проблему «мусорных» URL‑ов, которые размывают вес вашего сайта в поиске и мешают выйти в топ по запросу «услуги в Конаково».


1. Почему robots.txt важен для борьбы с дублями


2. Основные директивы robots.txt

Директива Описание Пример
User-agent Указывает, к какому роботу относится правило. * – все роботы. User-agent: *
Disallow Запрещает сканировать указанный путь. Disallow: /?utm_source=
Allow Разрешает сканировать путь, даже если он попадает под более общее Disallow. Allow: /blog/
Sitemap Указывает расположение карты сайта (Sitemap XML). Sitemap: https://example.com/sitemap.xml

Важно: robots.txt управляет только сканированием, а не индексированием. Если страница уже попала в индекс, её нужно дополнительно удалить через noindex в мета‑теге или в Google Search Console.


3. Какие URL‑ы обычно считаются техническими дублями

Тип дубля Пример URL Почему он дубль Как закрыть в robots.txt
Параметры сессии example.com/?PHPSESSID=abcdef Содержит идентификатор сессии, контент одинаковый Disallow: /?PHPSESSID=
UTM‑метки example.com/?utm_source=mail Трекинговые параметры, не влияют на контент Disallow: /?utm_source=
Параметры сортировки/фильтрации example.com/products?sort=price Тот же список товаров, только порядок изменён Disallow: /products?sort=
Трейлы слэша example.com/page и example.com/page/ Оба URL ведут на одну страницу Disallow: /page (если хотите закрыть без слэша)
Параметры языка example.com/?lang=ru Дублирование контента на разных языках (если язык задаётся в URL) Disallow: /?lang=

4. Пошаговая настройка robots.txt для закрытия дублей

Шаг 1. Составьте список «вредных» параметров

  1. Откройте Google Search Console → Параметры URL (если у вас уже есть доступ).
  2. Выполните лог‑анализ в Яндекс.Вебмастере и в Google Analytics, чтобы увидеть, какие параметры часто появляются в запросах.
  3. Запишите их в таблицу (пример выше).

Шаг 2. Создайте базовый шаблон файла

User-agent: *
Disallow: /?utm_source=
Disallow: /?utm_medium=
Disallow: /?utm_campaign=
Disallow: /?PHPSESSID=
Disallow: /?lang=
Sitemap: https://example.com/sitemap.xml

Подсказка: если у вас несколько параметров, их можно перечислять в отдельных строках Disallow. Поисковые роботы обрабатывают их независимо.

Шаг 3. Тестируйте правила в режиме «песочницы»

Обратите внимание на сообщения «Allowed» и «Disallowed». Если нужный URL попадает в «Allowed», значит правило не сработало – проверьте точность пути.

Шаг 4. Разместите файл на сервере

  1. Сохраните текст в файле robots.txt.
  2. Загрузите его в корневой каталог сайта (/public_html/robots.txt или /var/www/html/robots.txt).
  3. Убедитесь, что файл доступен по адресу https://example.com/robots.txt.

Шаг 5. Поставьте «проверку» в Google Search Console

Шаг 6. Удалите уже проиндексированные дубли (по желанию)


5. Частые ошибки и как их избежать

Ошибка Почему возникает Как исправить
Неправильный слеш Disallow: /?utm_source= vs Disallow: ?utm_source= Всегда начинайте путь со слеша (/).
Пробелы в начале строки Поисковый робот воспринимает пробел как часть пути. Удаляйте все ведущие пробелы.
Закрытие важного контента Случайно запретили /blog/ и все подпапки. Добавьте Allow: /blog/ после общего Disallow.
Отсутствие Sitemap Поисковики могут не находить карту сайта. Добавьте строку Sitemap: https://example.com/sitemap.xml.
Кеширование старой версии Сервер отдаёт старый robots.txt из кэша. Очистите кэш CDN и проверьте заголовок Cache-Control.

6. Как проверять «живой» статус robots.txt

  1. cURL: curl -I https://example.com/robots.txt – смотрим код 200 и содержимое.
  2. Онлайн‑инструменты (например, https://www.robotstxt.org/robotstxt.html) – вставляем URL и получаем разбор.
  3. Браузер: просто откройте https://example.com/robots.txt и убедитесь, что в файле нет лишних символов (BOM, скрытых пробелов).

7. Пример «полного» robots.txt для сайта‑услуги в Конаково

# Общие правила для всех роботов
User-agent: *
Disallow: /?utm_source=
Disallow: /?utm_medium=
Disallow: /?utm_campaign=
Disallow: /?utm_term=
Disallow: /?utm_content=
Disallow: /?PHPSESSID=
Disallow: /?lang=
Disallow: /?sort=
Disallow: /?filter=

# Разрешаем доступ к публичным разделам
Allow: /services/
Allow: /about/
Allow: /contact/
Allow: /blog/

# Карта сайта
Sitemap: https://konakovo-services.ru/sitemap.xml

Почему так?

  • Все рекламные и сессионные параметры закрыты.
  • Основные разделы, важные для SEO, явно разрешены, чтобы не возникло конфликтов между Disallow и Allow.
  • Карта сайта помогает роботам быстро находить нужные страницы.

Практика для закрепления

  1. Список параметров
    Составьте таблицу из пяти параметров, которые часто появляются в URL вашего сайта (например, ref, session, page, category, sort). Для каждого укажите, будет ли он закрыт в robots.txt и почему.

  2. Написание правила
    На основе таблицы из пункта 1 напишите корректный блок Disallow для каждого параметра. Убедитесь, что каждый путь начинается со слеша.

  3. Тестирование
    Воспользуйтесь бесплатным онлайн‑тестером robots.txt (поиск «robots.txt tester»). Вставьте ваш файл и проверьте, что URL https://example.com/?ref=partner помечен как Blocked, а https://example.com/services/ – как Allowed.

  4. Проверка в реальном времени
    Опубликуйте ваш robots.txt на тестовом домене (можно использовать поддомен test.example.com). С помощью curl -I https://test.example.com/robots.txt убедитесь, что сервер отдает правильный файл и заголовок Content-Type: text/plain.

  5. Аудит уже проиндексированных дублей
    Откройте Google Search Console → ПокрытиеОтфильтровать по «Дубли». Составьте список из трех URL‑ов, которые уже проиндексированы, и предложите, как их удалить (мета‑тег noindex, удаление через GSC и т.п.).


Итоги

С этими навыками ваш сайт будет быстро сканироваться, а вес страниц сосредоточится только на оригинальном контенте – именно то, что нужно, чтобы выйти в топ по запросу «услуги в Конаково» без бюджета на контекстную рекламу. Удачной оптимизации!


БЕСПЛАТНЫЙ КУРС: «КАК СОЗДАТЬ ЦИФРОВОЙ СЕЙФ ЗА 1 ВЕЧЕР»
Бесплатный курс: Оптимизация Битрикс на VDSina шаг за шагом
Чат онлайн с функцией стикеров
Чат-встреча
Fashion-байинг: ключевые этапы создания сезонной коллекции
ИП или ООО: как выбрать форму бизнеса в Москве
Как правильно настроить robots.txt для SEO
Как правильно размещать стрелки с подписями
Конвертер Азбуки Морзе в Аудио
Коттеджный поселок "Дуслык" — вблизи Уфы
Онлайн общение Екатеринбург
Онлайн рулетка с поддержкой мобильных устройств
Основы SEO: понимание Google Analytics и Google Search Console
От нуля до поездки: самостоятельный туризм
Платформы для оплаты ИИ
Подготовка к ОГЭ: справочные материалы
Решение проблем с индексированием сайта
РФ 2026, Европа, РКН, Adsense: $3000/мес без потери аккаунта
Сбои AutoCAD при загрузке - как избежать
Стальные фитинги и трубы для промышленности
Только слух, без текста: 5 минут ежедневного погружения
Видео чат случайный
Создание сайтовПродвижение сайтовПоддержка сайтовРедизайн сайтов
Создание баннеровСоздание презентацийСоздание фирменного стиля
3D-моделирование3D-визуализация
Оформить предварительный заказ на любую из услуг
Политика конфиденциальности