Генератор robots.txt онлайн — создать файл за пару минут
Пресет под вашу CMS, свои строки Disallow и адрес карты сайта. Готовый текст robots.txt копируется одной кнопкой и кладётся в корень.
Файл robots.txt обычно копируют с форума, кладут в корень и забывают про него на годы. Через полгода выясняется, что в нём осталась строка Disallow: / с тестового домена, и сайта нет в поиске. Ошибка в этом файле стоит дороже, чем его отсутствие.
Форма выше собирает файл построчно. Выбираете пресет под свою CMS, дописываете свои запреты, указываете адрес карты сайта. Результат меняется в соседнем поле сразу.
Зачем сайту robots.txt
Файл говорит роботам, какие разделы обходить не нужно. Бюджет обхода не бесконечен. Без файла краулер тратит его на внутренний поиск, корзину, фильтры с параметрами и личный кабинет, а нужные страницы ждут своей очереди и попадают в индекс медленнее.
Как собрать файл
- Отметьте галочку согласия, иначе форма не отзывается.
- Выберите пресет: 1C-Bitrix, WordPress, Drupal, Tilda или универсальный, где открыто всё.
- Допишите свои пути в поле «Дополнительные Disallow», по одному в строке: /search/, /cart/.
- Укажите полный адрес карты сайта, если она есть. Строка Sitemap встанет в конец файла.
- Нажмите «Скопировать», вставьте текст в robots.txt и положите файл в корень сайта.
Он должен открываться по адресу ваш-домен/robots.txt. У каждого поддомена свой файл, один общий на всех не сработает.
Генератор собирает один блок User-agent: *, то есть правила сразу для всех роботов. Отдельных секций для Яндекса и Google здесь нет, при необходимости допишете их руками.
Как выглядит готовый файл
Возьмём пресет WordPress и адрес карты сайта. В поле результата окажется ровно это:
- User-agent: *
- Disallow: /wp-admin/
- Disallow: /wp-includes/
- Disallow: /wp-json/
- Disallow: /xmlrpc.php
- Disallow: /?s=
- Disallow: /search/
- Disallow: /author/
- Disallow: */trackback/
- Sitemap: https://example.ru/sitemap.xml
Свои строки из поля Disallow встают следом за строками пресета, в том же порядке, в каком вы их написали. Перед строкой Sitemap генератор оставляет пустую строку: так файл читается глазами легче, а роботам всё равно.
Что уже лежит в пресетах
Каждая CMS сорит своими служебными адресами, поэтому наборы правил разные.
- 1C-Bitrix: /bitrix/, /search/, /auth/, /personal/ плюс параметры печати, регистрации и служебных действий. Это движок, поиск, авторизация и личный кабинет: страницы, одинаковые для всех или недоступные роботу.
- WordPress: /wp-admin/, /wp-includes/, /wp-json/, /xmlrpc.php, поиск по /?s= и /search/, архивы авторов и трекбеки. Закрывают админку, служебные точки и страницы, которые плодят дубли анонсов.
- Drupal: /admin/, /user/, /node/add/, /search/, /filter/tips, /comment/reply/. Всё это формы и служебные экраны, в выдаче им делать нечего.
- Tilda: /search, /cart, /members/. Поиск, корзина и закрытая зона для участников.
- Универсальный: правил нет, в файл уходит одна строка Allow: /. Как только вы добавите свой путь, эта строка пропадёт: она нужна только пустому файлу.
Пресет это отправная точка, а не готовая настройка. Пробегитесь по строкам глазами: половины этих разделов у вас может не быть, зато найдётся свой служебный раздел, которого нет в списке. Корзину и оформление заказа магазину почти всегда приходится дописывать самому: в пресетах Битрикса и WordPress их нет.
Чего генератор не умеет
- Не собирает Clean-param. Директива Яндекса про GET-параметры пишется руками. Для магазина с фильтрами это важная строка, не забудьте о ней.
- Не делает отдельные блоки для роботов. Нужны разные правила Яндексу и Google, дописывайте вторую секцию сами.
- Не проверяет синтаксис. Путь без слеша в начале или звёздочка не на месте уйдут в файл как есть, без предупреждения.
- Не скачивает файл. Есть кнопка «Скопировать», а robots.txt вы создаёте у себя сами.
- Не добавляет Host. И правильно: директива мертва с 2018 года.
Регистрации нет, лимита генераций нет, текст никуда не уходит: файл собирается прямо в вашем браузере.
Где чаще всего ошибаются
- Закрывают CSS и JS. Робот должен видеть страницу так же, как её видит посетитель, поэтому закрытые стили и скрипты портят оценку.
- Путают Disallow и noindex. Запрет обхода не убирает страницу из выдачи: по внешним ссылкам она там останется. Убирают метатегом noindex или заголовком X-Robots-Tag.
- Тащат директиву Host. Яндекс не учитывает её с 2018 года, Google не понимал никогда, а главное зеркало давно задаётся обычным 301-редиректом.
- Пишут несколько путей в одной строке. Одно правило живёт в одной строке, и слеш в начале пути обязателен.
- Закрывают лишнее в WordPress. Запрет /wp-json/ ломает часть плагинов и предпросмотр в редакторе. Пресет его закрывает, поэтому проверьте сайт после выкладки.
Готовый файл прогоните через «Анализ robots.txt» в Яндекс Вебмастере или отчёт в Google Search Console. Важные страницы должны открываться роботу, служебные закрываться. Новую версию роботы подхватят не сразу, обычно в течение суток.
Следующий шаг после robots.txt это карта сайта. Проверить, что в неё попало, поможет разбор и сборка sitemap.xml, а посмотреть, какой ответ отдаёт сервер по закрытым адресам, можно проверкой заголовков сервера.
Частые вопросы
Куда загружать файл robots.txt?
Строго в корневой каталог сайта, чтобы файл открывался по адресу ваш-домен/robots.txt. В подпапках и на других адресах роботы его не ищут. У каждого поддомена должен быть собственный файл: общий с основным доменом не работает.
Чем Disallow отличается от noindex?
Disallow запрещает роботу обходить страницу, но не гарантирует, что её не будет в выдаче: по внешним ссылкам она может остаться в индексе без описания. Метатег noindex и заголовок X-Robots-Tag, наоборот, убирают страницу из индекса, но робот должен их увидеть, а значит обход страницы нужно разрешить. Совмещать Disallow с noindex на одной странице бессмысленно: робот просто не дойдёт до метатега.
Нужно ли указывать Sitemap в robots.txt?
Желательно. Директива Sitemap с полным адресом карты сайта, вместе с протоколом, помогает роботам быстрее находить новые и обновлённые страницы. Генератор ставит её в конец файла. Дополнительно карту стоит добавить в Яндекс Вебмастер и Google Search Console: там видно, сколько страниц из неё дошло до индекса.
Что обычно закрывают в robots.txt интернет-магазина?
Служебные и дублирующие разделы: корзину и оформление заказа, личный кабинет, результаты внутреннего поиска, сортировки и фильтры с GET-параметрами, версии для печати. В пресетах Битрикса и WordPress из этого списка закрыты личный кабинет, авторизация и поиск. Корзину и оформление заказа допишите сами в поле «Дополнительные Disallow»: адреса у каждого магазина свои.
Как закрыть фильтры и рекламные метки с GET-параметрами?
Для Яндекса правильный способ это директива Clean-param: она склеивает адреса с параметрами и без. Google её не понимает, там помогает rel=canonical на основную страницу. Наш генератор Clean-param не собирает, строку придётся дописать руками после вставки файла. Грубый вариант «Disallow: /*?» работает у обоих, но заодно закрывает нужные адреса с параметрами, так что сначала проверьте, что под него попадает.
Можно ли закрыть от роботов сайт на время разработки?
Да, для тестового домена строка «Disallow: /» это нормальное решение. Опасность в другом: этот файл переезжает на боевой домен вместе с сайтом, и о нём забывают. Поставьте проверку robots.txt отдельным пунктом в чек-лист запуска, а после выкладки сразу откройте ваш-домен/robots.txt глазами.
Похожие инструменты
Разбор и сборка sitemap.xml — парсер и генератор карты сайта
Два режима в одном окне: карта сайта разбирается в таблицу с фильтром, а список ссылок собирается в готовый sitemap.xml с датой lastmod.
Проверка заголовков сервера онлайн — HTTP-статус и редиректы
Показывает сырой ответ сервера по любому адресу: статус, цепочку переходов и заголовки целиком. Без регистрации, адреса не сохраняются.
Генератор JSON-LD микроразметки schema.org онлайн
Семь типов schema.org в одной форме: выбираете тип, заполняете поля и забираете готовый блок JSON-LD. Всё собирается прямо в браузере.