Умный дедупликатор ключевых фраз онлайн — удалить дубли из списка
Чистит ядро от дублей по вашим правилам: регистр, пробелы, порядок слов. Первая формулировка фразы остаётся нетронутой.
Допустим, ядро собрано из нескольких выгрузок. Двенадцать тысяч строк. Половина повторяет друг друга: где-то лишний пробел, где-то заглавная буква, где-то слова переставлены местами. Excel снимает только точные повторы, поэтому «купить диван» и «диван купить» он оставит обе.
Дедупликатор ключевых фраз выше сравнивает строки не посимвольно. Сначала он приводит каждую фразу к общему виду, а уже потом ищет повторы. Вы вставляете список и видите, сколько строк было и сколько осталось. Ядро при этом никуда не уходит: считает браузер, на сервер не отправляется ни строки.
Этим он и отличается от привычных способов. Excel и выгрузка из Key Collector снимут точные повторы, а переставленные слова и разную «ё» оставят. Здесь обе ловушки закрываются галочкой.
Что здесь считается дублем
Перед сравнением каждая строка приводится к общему виду. Отвечают за это пять галочек под полем ввода.
- Обрезать пробелы. Включена сразу. Снимает пробелы по краям строки.
- Схлопывать повторяющиеся пробелы внутри строки. Тоже включена, лечит мусор из таблиц.
- Игнорировать регистр. Включена: «Купить Диван» и «купить диван» склеятся.
- Считать ё и е одной буквой. Выключена. Включайте, когда в ядре есть «ёлки» и «елки».
- Игнорировать порядок слов во фразе. Выключена. С ней «купить диван» и «диван купить» станут одной фразой.
Последняя галочка и есть главная ловушка инструмента. Она склеивает перестановки, а заодно и то, что перестановкой только выглядит. «Москва Казань» и «Казань Москва» превратятся в одну фразу, хотя билеты покупают в разные стороны. На гео, направлениях и парах «из чего в что» её лучше не включать.
В результат идёт первая исходная формулировка фразы. Нормализация нужна для сравнения, ваши фразы она не переписывает. Исключение одно: обрезка пробелов чистит и сам результат, так что краевые пробелы в скопированный список не попадут.
Как удалить дубли из списка
Сначала отметьте согласие над формой: до этого поле ввода не работает. Галочка нигде не запоминается, после перезагрузки страницы её надо поставить заново.
Вставьте фразы в поле «Ключевые фразы», по одной в строке. Отметьте галочки. Выберите сортировку: как есть, по алфавиту или по длине. Отдельный переключатель «Привести результат к нижнему регистру» приводит готовый список к строчным буквам, по умолчанию он выключен.
Считает он на лету. Тронули галочку: цифры пересчитались сами. Три счётчика показывают, сколько строк было, сколько осталось и сколько ушло в дубли. Пустые строки в счёт не идут вообще.
Ядро уходит в кластеризацию
Оставьте включёнными обрезку пробелов, схлопывание и регистр, добавьте «ё». Порядок слов не трогайте: кластеризатор сам разложит перестановки по группам, а вы не потеряете направления. Сортировку оставьте «как есть», чтобы видеть, из какой выгрузки что пришло.
Список готовится для рекламного кабинета
Здесь наоборот: включайте и порядок слов, и «ё», и приведение результата к нижнему регистру. Кабинету всё равно, как написана фраза, а лишние написания одной фразы только размывают статистику. Сортировку поставьте по алфавиту: так проще вычитывать список глазами.
Что делать с результатом
Нажмите «Скопировать» и забирайте список дальше по маршруту: в кластеризатор, в файл для рекламного кабинета, в таблицу с частотностями, куда вычищенное ядро обычно и уходит перед тем, как его разложат по группам объявлений. Кнопки «Скачать» у инструмента нет, результат забирается через буфер обмена.
Посмотрите на счётчик удалённых. Типичная картина после склейки трёх выгрузок: было 12 400 строк, осталось 7 300, ушло в дубли 5 100. Восемь строк из двенадцати тысяч: дублей нет, чистить было нечего. Четыре тысячи: дело уже не в дедупликаторе, а в том, как собираются выгрузки.
Сколько строк он потянет
Жёсткого предела в инструменте нет, упирается всё в браузер. До пятидесяти тысяч строк список пересчитывается за доли секунды. На сотне тысяч пересчёт занимает около секунды, а с галочкой порядка слов вдвое дольше, потому что каждую фразу приходится разбирать на слова и сортировать.
Считает он после каждого нажатия клавиши, поэтому большое ядро вставляйте целиком и правьте до вставки. Если браузер задумался, режьте выгрузку на части.
О чём помнить
- Сортировка по длине ставит короткие фразы наверх. Короткие обычно и есть высокочастотники, а длинные хвосты уходят вниз, так что ядро оценивается на глаз за полминуты.
- Дубли считаются по всему списку сразу. Из двух одинаковых строк остаётся та, что встретилась раньше, поэтому порядок вставки имеет значение. Кладите первой ту выгрузку, чьё написание фраз вам ближе.
- Галочки работают в связке. Сначала схлопываются пробелы, потом снимается регистр, потом «ё», и только потом сортируются слова. Включать их по одной и смотреть на счётчик удалённых полезно: сразу видно, какой именно мусор сидит в ядре.
- Список остаётся в браузере. Ядро клиента вставляйте спокойно: на сервер оно не уходит.
Вставьте список в поле выше и посмотрите на счётчик дублей.
Частые вопросы
Фраза остаётся в исходном виде или приводится к нижнему регистру?
По умолчанию в результате сохраняется первая встреченная исходная формулировка фразы. Если нужен весь список строчными буквами, включите отдельную галочку «Привести результат к нижнему регистру»: она работает уже после дедупликации и на сравнение не влияет.
Как найти дубли с переставленными словами?
Включите галочку «Игнорировать порядок слов во фразе». Тогда «купить диван» и «диван купить» будут считаться одной фразой. Осторожнее с гео и направлениями: «Москва Казань» и «Казань Москва» тоже склеятся, а это разные запросы.
Какая из двух одинаковых строк останется?
Та, что встретилась в списке раньше. Инструмент идёт сверху вниз и первую встреченную формулировку оставляет, остальные считает дублями. Поэтому порядок вставки решает, какое написание вы увидите в результате: кладите первой ту выгрузку, чьи формулировки вам ближе.
Сколько строк можно вставить?
Ограничения в инструменте нет, считает браузер. До пятидесяти тысяч строк список пересчитывается за доли секунды, на сотне тысяч уходит около секунды, а с галочкой порядка слов вдвое дольше. Пересчёт идёт после каждого нажатия клавиши, поэтому большое ядро лучше вставлять целиком и править до вставки.
Результат можно скачать файлом?
Нет, кнопки «Скачать» у инструмента нет. Готовый список забирается кнопкой «Скопировать»: он уходит в буфер обмена, дальше вставляйте его в таблицу, в текстовый файл или сразу в рекламный кабинет.
Список фраз куда-то отправляется?
Нет, дедупликация целиком происходит в браузере, ни одна строка на сервер не уходит. Ядро клиента и любые внутренние выгрузки можно вставлять без опаски.
Похожие инструменты
Пересечение и разность списков онлайн — сравнить два или три списка
Показывает, чем два или три списка отличаются: общее, уникальное и объединение без повторов. Кнопку нажимать не нужно.
Плотность ключевых слов — подсчёт вхождений онлайн
Точные вхождения, совпадения по подстроке и плотность каждой фразы в процентах. Сравните свой текст с конкурентами и увидите разрыв.
Разбивка большого списка на части онлайн — по N строк с копированием и скачиванием
Длинный список режется на части по N строк: у каждой свой счётчик, кнопка копирования и файл .txt. Пригодится, когда кабинет ставит лимит на загрузку.