Перейти к содержимому
Инструменты Кейсы Компания Контакты
+7 (495) 185-60-65
SEO

Генератор robots.txt онлайн — создать файл за пару минут

Пресет под вашу CMS, свои строки Disallow и адрес карты сайта. Готовый текст robots.txt копируется одной кнопкой и кладётся в корень.

Файл robots.txt обычно копируют с форума, кладут в корень и забывают про него на годы. Через полгода выясняется, что в нём осталась строка Disallow: / с тестового домена, и сайта нет в поиске. Ошибка в этом файле стоит дороже, чем его отсутствие.

Форма выше собирает файл построчно. Выбираете пресет под свою CMS, дописываете свои запреты, указываете адрес карты сайта. Результат меняется в соседнем поле сразу.

Зачем сайту robots.txt

Файл говорит роботам, какие разделы обходить не нужно. Бюджет обхода не бесконечен. Без файла краулер тратит его на внутренний поиск, корзину, фильтры с параметрами и личный кабинет, а нужные страницы ждут своей очереди и попадают в индекс медленнее.

Как собрать файл

  1. Отметьте галочку согласия, иначе форма не отзывается.
  2. Выберите пресет: 1C-Bitrix, WordPress, Drupal, Tilda или универсальный, где открыто всё.
  3. Допишите свои пути в поле «Дополнительные Disallow», по одному в строке: /search/, /cart/.
  4. Укажите полный адрес карты сайта, если она есть. Строка Sitemap встанет в конец файла.
  5. Нажмите «Скопировать», вставьте текст в robots.txt и положите файл в корень сайта.

Он должен открываться по адресу ваш-домен/robots.txt. У каждого поддомена свой файл, один общий на всех не сработает.

Генератор собирает один блок User-agent: *, то есть правила сразу для всех роботов. Отдельных секций для Яндекса и Google здесь нет, при необходимости допишете их руками.

Как выглядит готовый файл

Возьмём пресет WordPress и адрес карты сайта. В поле результата окажется ровно это:

  • User-agent: *
  • Disallow: /wp-admin/
  • Disallow: /wp-includes/
  • Disallow: /wp-json/
  • Disallow: /xmlrpc.php
  • Disallow: /?s=
  • Disallow: /search/
  • Disallow: /author/
  • Disallow: */trackback/
  • Sitemap: https://example.ru/sitemap.xml

Свои строки из поля Disallow встают следом за строками пресета, в том же порядке, в каком вы их написали. Перед строкой Sitemap генератор оставляет пустую строку: так файл читается глазами легче, а роботам всё равно.

Что уже лежит в пресетах

Каждая CMS сорит своими служебными адресами, поэтому наборы правил разные.

  • 1C-Bitrix: /bitrix/, /search/, /auth/, /personal/ плюс параметры печати, регистрации и служебных действий. Это движок, поиск, авторизация и личный кабинет: страницы, одинаковые для всех или недоступные роботу.
  • WordPress: /wp-admin/, /wp-includes/, /wp-json/, /xmlrpc.php, поиск по /?s= и /search/, архивы авторов и трекбеки. Закрывают админку, служебные точки и страницы, которые плодят дубли анонсов.
  • Drupal: /admin/, /user/, /node/add/, /search/, /filter/tips, /comment/reply/. Всё это формы и служебные экраны, в выдаче им делать нечего.
  • Tilda: /search, /cart, /members/. Поиск, корзина и закрытая зона для участников.
  • Универсальный: правил нет, в файл уходит одна строка Allow: /. Как только вы добавите свой путь, эта строка пропадёт: она нужна только пустому файлу.

Пресет это отправная точка, а не готовая настройка. Пробегитесь по строкам глазами: половины этих разделов у вас может не быть, зато найдётся свой служебный раздел, которого нет в списке. Корзину и оформление заказа магазину почти всегда приходится дописывать самому: в пресетах Битрикса и WordPress их нет.

Чего генератор не умеет

  • Не собирает Clean-param. Директива Яндекса про GET-параметры пишется руками. Для магазина с фильтрами это важная строка, не забудьте о ней.
  • Не делает отдельные блоки для роботов. Нужны разные правила Яндексу и Google, дописывайте вторую секцию сами.
  • Не проверяет синтаксис. Путь без слеша в начале или звёздочка не на месте уйдут в файл как есть, без предупреждения.
  • Не скачивает файл. Есть кнопка «Скопировать», а robots.txt вы создаёте у себя сами.
  • Не добавляет Host. И правильно: директива мертва с 2018 года.

Регистрации нет, лимита генераций нет, текст никуда не уходит: файл собирается прямо в вашем браузере.

Где чаще всего ошибаются

  • Закрывают CSS и JS. Робот должен видеть страницу так же, как её видит посетитель, поэтому закрытые стили и скрипты портят оценку.
  • Путают Disallow и noindex. Запрет обхода не убирает страницу из выдачи: по внешним ссылкам она там останется. Убирают метатегом noindex или заголовком X-Robots-Tag.
  • Тащат директиву Host. Яндекс не учитывает её с 2018 года, Google не понимал никогда, а главное зеркало давно задаётся обычным 301-редиректом.
  • Пишут несколько путей в одной строке. Одно правило живёт в одной строке, и слеш в начале пути обязателен.
  • Закрывают лишнее в WordPress. Запрет /wp-json/ ломает часть плагинов и предпросмотр в редакторе. Пресет его закрывает, поэтому проверьте сайт после выкладки.

Готовый файл прогоните через «Анализ robots.txt» в Яндекс Вебмастере или отчёт в Google Search Console. Важные страницы должны открываться роботу, служебные закрываться. Новую версию роботы подхватят не сразу, обычно в течение суток.

Следующий шаг после robots.txt это карта сайта. Проверить, что в неё попало, поможет разбор и сборка sitemap.xml, а посмотреть, какой ответ отдаёт сервер по закрытым адресам, можно проверкой заголовков сервера.

Частые вопросы

Куда загружать файл robots.txt?

Строго в корневой каталог сайта, чтобы файл открывался по адресу ваш-домен/robots.txt. В подпапках и на других адресах роботы его не ищут. У каждого поддомена должен быть собственный файл: общий с основным доменом не работает.

Чем Disallow отличается от noindex?

Disallow запрещает роботу обходить страницу, но не гарантирует, что её не будет в выдаче: по внешним ссылкам она может остаться в индексе без описания. Метатег noindex и заголовок X-Robots-Tag, наоборот, убирают страницу из индекса, но робот должен их увидеть, а значит обход страницы нужно разрешить. Совмещать Disallow с noindex на одной странице бессмысленно: робот просто не дойдёт до метатега.

Нужно ли указывать Sitemap в robots.txt?

Желательно. Директива Sitemap с полным адресом карты сайта, вместе с протоколом, помогает роботам быстрее находить новые и обновлённые страницы. Генератор ставит её в конец файла. Дополнительно карту стоит добавить в Яндекс Вебмастер и Google Search Console: там видно, сколько страниц из неё дошло до индекса.

Что обычно закрывают в robots.txt интернет-магазина?

Служебные и дублирующие разделы: корзину и оформление заказа, личный кабинет, результаты внутреннего поиска, сортировки и фильтры с GET-параметрами, версии для печати. В пресетах Битрикса и WordPress из этого списка закрыты личный кабинет, авторизация и поиск. Корзину и оформление заказа допишите сами в поле «Дополнительные Disallow»: адреса у каждого магазина свои.

Как закрыть фильтры и рекламные метки с GET-параметрами?

Для Яндекса правильный способ это директива Clean-param: она склеивает адреса с параметрами и без. Google её не понимает, там помогает rel=canonical на основную страницу. Наш генератор Clean-param не собирает, строку придётся дописать руками после вставки файла. Грубый вариант «Disallow: /*?» работает у обоих, но заодно закрывает нужные адреса с параметрами, так что сначала проверьте, что под него попадает.

Можно ли закрыть от роботов сайт на время разработки?

Да, для тестового домена строка «Disallow: /» это нормальное решение. Опасность в другом: этот файл переезжает на боевой домен вместе с сайтом, и о нём забывают. Поставьте проверку robots.txt отдельным пунктом в чек-лист запуска, а после выкладки сразу откройте ваш-домен/robots.txt глазами.

Похожие инструменты

Статьи по теме