Перейти к содержимому
Инструменты Кейсы Компания Контакты
+7 (495) 185-60-65
Маркетинг

Калькулятор значимости A/B-теста онлайн — z-тест, p-value, доверительный интервал

Четыре числа по двум вариантам и уровень доверия: конверсии, прирост, z-оценка, p-значение и доверительные интервалы Уилсона для каждой группы.

Вариант B дал 7% конверсии, вариант A пять. В отчёте это выглядит как победа. Через неделю разница иногда испаряется, потому что на маленьких числах случайность шумит громче любого оффера.

Калькулятор выше отвечает на один вопрос: разница настоящая или пока похожа на шум. Нужны четыре числа.

Когда пригодится

  • Тест лендинга, письма или заголовка объявления закончился, и пора решать, катить ли победителя на весь трафик.
  • Подрядчик прислал отчёт со словом «выиграл»: проверить это самому занимает минуту.
  • Тест ещё идёт, и вы прикидываете, сколько трафика собирать дальше.

Что вводить и что получится

По каждому варианту два числа: сколько было посетителей и сколько из них сконвертировалось. Ниже уровень доверия, по умолчанию 95%. Девяносто смягчает порог, девяносто девять ужесточает и потребует заметно больше данных.

В ответ появятся конверсия каждой группы, прирост в процентах, z-оценка и двустороннее p-значение. Отдельной строкой стоит «да» или «нет» в графе значимости, а под результатами доверительные интервалы для каждой конверсии, посчитанные методом Уилсона.

Прирост считается относительный, а не в пунктах. Рост с 5% до 7% калькулятор покажет как плюс сорок процентов, потому что 7 больше 5 в 1,4 раза. Это та же цифра, которой обычно хвалятся в отчётах.

Пример на цифрах

Возьмём подсказки к полям: по тысяче посетителей в каждой группе, 50 конверсий у A и 70 у B.

Конверсии выходят 5,00% и 7,00%, прирост плюс 40%. Звучит как разгромная победа. А дальше начинается интересное.

Z-оценка 1,883, p-значение 0,0597. Порог при уровне доверия 95% равен 0,05. Наше значение выше, поэтому в графе значимости стоит «нет», а плашка жёлтая: данных пока не хватает.

Интервалы объясняют, почему. У варианта A истинная конверсия лежит где-то между 3,81% и 6,53%, у варианта B между 5,58% и 8,75%. Эти отрезки перекрываются, то есть настоящие конверсии вариантов вполне могут совпадать.

Теперь переключите уровень доверия на 90%. Порог станет 0,1, наши 0,0597 в него проходят, и вердикт сменится на зелёный. Тот же тест, те же данные, другой ответ. Поэтому уровень доверия выбирают до старта, а не после того, как посмотрели на результат.

А если добрать трафика до двух тысяч в группе при тех же долях, z поднимется до 2,663, p упадёт до 0,0077, и победа станет значимой уже на 95%. Цифры те же, уверенности больше.

Как читать вердикт

Зелёная плашка означает, что B значимо лучше A. Красная говорит обратное: вариант B хуже, и катить его не надо. Жёлтая означает, что разницы пока не видно и стоит собрать ещё данных.

Значимость тут это сравнение p-значения с порогом. Порог равен единице минус уровень доверия: 0,05 при 95%, 0,1 при 90%, 0,01 при 99%. Меньше порога значит «да», больше или ровно столько же значит «нет».

Если эффект очень сильный, в графе p-значения появится «<0.0001». Это не ошибка. Просто число оказалось меньше четырёх знаков после запятой, и калькулятор не стал показывать нули.

Дальше посмотрите на интервалы. Сильно перекрываются? Значит, истинные конверсии вариантов ещё могут совпадать. И отдельно ловите предупреждение о маленькой группе: оно загорается, если в какой-то группе меньше сотни посетителей, меньше пяти конверсий или меньше пяти отказов. Последнее ловит редкий случай, когда конвертируются почти все.

Ещё одно красное сообщение не про статистику вовсе. Впишете конверсий больше, чем посетителей, и калькулятор скажет об этом прямо, а считать откажется.

Как проверить чужой отчёт за минуту

Подрядчик пишет: «Вариант B победил, конверсия выросла на 40%, катим». Проверка занимает меньше времени, чем чтение письма.

  1. Попросите четыре числа: посетители и конверсии по каждой группе. Не проценты, а штуки. Проценты без знаменателя ничего не значат.
  2. Вбейте их сюда на уровне доверия 95%.
  3. Посмотрите на плашку. Жёлтая означает, что победы пока нет, как бы бодро ни звучал отчёт.
  4. Сверьте прирост. Часто «плюс 40%» в письме и прирост в калькуляторе расходятся: в письме считали в пунктах, а не в процентах от базы.

Если четыре числа вам не дают, это уже ответ. Тест, который нельзя пересчитать, обсуждать бессмысленно.

Данных мало: добирать или остановиться

Жёлтая плашка сама по себе не решение. Решение зависит от того, сколько трафика вам вообще нужно было собрать.

Посчитайте это в калькуляторе размера выборки: он скажет, сколько посетителей нужно на группу при вашей базовой конверсии и желаемом эффекте. Не добрали до плана, продолжайте. Добрали и разницы нет, тест закончен, и ответ у него отрицательный.

Если план оказался неподъёмным, загляните в калькулятор MDE. Он покажет, какой эффект вы вообще способны поймать на своём трафике. Бывает, что при тысяче посетителей в месяц ловится только двукратный рост, а значит тестировать цвет кнопки смысла нет.

Откуда брать цифры

Источник данных решает половину споров. Метрика, рекламный кабинет и CRM покажут на одном и том же тесте разные конверсии, и каждый будет по-своему прав.

  • Метрика и аналитика сайта считают достижение цели. Сюда попадут и тестовые отправки, и боты, и человек, нажавший кнопку дважды.
  • Рекламный кабинет приписывает конверсию по своей модели атрибуции и видит только свой трафик.
  • CRM знает настоящие заявки и сделки, но туда доезжает не всё и не сразу.

Договоритесь об источнике до старта теста и считайте по нему одному. Мешать в одном расчёте лиды из CRM для варианта A и цели Метрики для варианта B нельзя: разница вылезет из разных линеек, а не из оффера.

И берите уникальных пользователей, а не визиты. Один человек, зашедший пять раз, это не пять посетителей.

Сколько держать тест

Калькулятор не знает, за какой срок собраны ваши числа. Он посчитает данные за три дня так же уверенно, как за месяц.

Минимум это полная неделя, а лучше две. Понедельник и суббота ведут себя по-разному, и тест, оборванный в четверг, покажет характер четверга.

Сезон тоже вмешивается. Распродажа, праздники, всплеск после рассылки: если событие пришлось на середину теста, оно задело группы неравномерно. Такой период лучше выкинуть и добрать данные позже.

Проверьте и сам сплит. Если в группе A тысяча посетителей, а в B четыреста, трафик делится неправильно. Калькулятор посчитает и так, но сначала стоит выяснить, почему перекос, потому что причина обычно техническая.

О чём помнить

Значимость ничего не говорит о размере выигрыша. Она отвечает только на вопрос, случайна разница или нет. Прирост в два процента и прирост в сорок бывают одинаково значимыми, а денег приносят очень по-разному.

Заглядывать в тест каждый день и останавливать его в тот момент, когда p-значение первый раз нырнуло ниже порога, не стоит. Так ловится случайный всплеск, а не реальный эффект. Объём выборки лучше задать заранее и досидеть до него.

Наблюдения должны быть независимыми. Один человек, зашедший на страницу пять раз, это не пять посетителей, и группы придётся считать по уникальным пользователям.

Считает всё браузер, цифры никуда не уходят. Данные клиента можно вводить как есть, не пересчитывая их в «условные единицы».

Частые вопросы

Что значит «статистическая значимость»?

Это ответ на вопрос, могла ли разница между вариантами получиться просто по случайности. Калькулятор считает p-значение и сравнивает его с порогом: 0,05 при уровне доверия 95%. Меньше порога значит, что разницу можно считать настоящей. Больше значит, что при таких числах случай объясняет её не хуже, чем ваш новый оффер.

Какой уровень доверия выбрать?

Девяносто пять процентов подходит почти всегда, это негласный стандарт. Девяносто берут, когда цена ошибки мала и переделать легко: цвет кнопки, формулировка заголовка. Девяносто девять оставляют для дорогих решений вроде смены тарифной сетки, но данных оно потребует примерно вдвое больше. Главное, выберите уровень до старта теста.

p-значение вышло 0,051 при пороге 0,05. Можно объявлять победителя?

Формально нет, и на глаз тоже нет. Разница между 0,049 и 0,051 не означает разницы в реальности, она означает, что вы стоите ровно на границе. Правильный ход один: добрать трафика и пересчитать. Если добирать нечего, запишите результат как «не доказано» и выбирайте вариант по другим соображениям.

Почему калькулятор говорит, что данных недостаточно?

Потому что при текущих числах p-значение выше порога: разница ещё может объясняться случайностью. Продолжайте собирать трафик, с ростом выборки тест становится чувствительнее. Сколько именно нужно, покажет калькулятор размера выборки. Если план по трафику вы уже выбрали, а разницы нет, у теста просто отрицательный ответ.

Прирост здесь не сходится с отчётом подрядчика. Кто прав?

Скорее всего, вы считаете разное. Калькулятор показывает относительный прирост: с 5% до 7% это плюс 40%. В отчётах часто пишут разницу в пунктах, и те же цифры превращаются в «плюс 2%». Обе формулировки верны, но смешивать их нельзя. Уточните у подрядчика, что стоит за его процентом.

Мои данные куда-то передаются?

Нет. Все расчёты идут в вашем браузере на JavaScript, никакие цифры не уходят на сервер. Числа клиента можно вводить как есть, не пересчитывая их в условные единицы.

Похожие инструменты

Внедрения

Статьи по теме