Споры о том, какой заголовок лучше или нужен ли на карточке товара блок отзывов, можно вести неделями. A/B-тест решает их данными: половина посетителей видит один вариант, половина — другой, а побеждает тот, что приносит больше заказов. Звучит просто, но на практике большинство тестов, которые мы видим у клиентов, проведены с ошибками и дают ложные выводы. Расскажем, как устроен корректный эксперимент, сколько трафика для него нужно и что делать, если трафика мало.
Что такое A/B-тест и когда он нужен
A/B-тест — это контролируемый эксперимент. Посетители случайным образом делятся на группы: группа A видит текущую версию страницы, группа B — изменённую. Все остальные условия одинаковы: тот же период, те же источники трафика, та же реклама. Если в группе B конверсия выше и разница статистически значима, изменение можно внедрять для всех.
Главное преимущество перед сравнением «до и после» — устойчивость к внешним факторам. Если вы поменяли страницу в понедельник, а во вторник конкурент запустил распродажу, сравнение недель покажет падение, хотя ваше изменение могло быть удачным. В A/B-тесте обе группы испытывают одинаковое влияние распродажи, и разница между ними отражает только эффект изменения.
Тест нужен не всегда. Очевидные исправления — сломанная кнопка, ошибка в цене, страница, которая грузится восемь секунд, — проверять не нужно, их нужно просто исправить. Тест оправдан, когда гипотеза спорная, изменение затрагивает важный этап воронки и есть реальный риск ухудшить результат. Например: убрать обязательную регистрацию — очевидно; заменить пошаговое оформление заказа одностраничным — стоит протестировать.
Гипотеза: с чего начинается любой тест
Тест без чёткой гипотезы превращается в перебор случайных вариантов. Хорошая гипотеза опирается на данные и формулируется по схеме: «Если мы изменим X, то метрика Y изменится, потому что Z». Пример: «Если показать срок и стоимость доставки прямо в карточке товара, конверсия в добавление в корзину вырастет, потому что по записям сессий 30% посетителей ищут эту информацию и уходят, не найдя её».
Источники гипотез — аналитика воронки, записи сессий, тепловые карты, опросы посетителей, вопросы клиентов к менеджерам, результаты UX-аудита. Чем сильнее гипотеза подкреплена данными, тем выше шанс, что тест покажет результат. Мы ведём для клиентов реестр гипотез с оценкой по трём параметрам: ожидаемый эффект, уверенность в нём и трудоёмкость внедрения. Первыми тестируются гипотезы с высоким произведением этих оценок.
Тестируйте изменения, которые способны повлиять на решение посетителя, а не косметику. Смена оттенка кнопки с синего на голубой почти никогда не даёт значимого эффекта на реальных объёмах трафика. Изменение оффера, порядка шагов оформления, состава информации на карточке — даёт.

Сколько нужно трафика и сколько длится тест
Это самый важный и самый недооценённый вопрос. Конверсия по своей природе случайна: даже если две версии страницы абсолютно одинаковы, в один день у одной будет 2,1%, а у другой 2,4%. Чтобы отличить реальный эффект от случайного колебания, нужна достаточная выборка. И чем меньше эффект, который вы хотите обнаружить, тем больше нужно посетителей.
| Базовая конверсия | Ожидаемый прирост | Посетителей на каждый вариант | Длительность при 1 000 визитов в день |
|---|---|---|---|
| 2% | +50% (до 3%) | около 3 800 | 8 дней, но не меньше 2 недель |
| 2% | +20% (до 2,4%) | около 21 000 | около 6 недель |
| 2% | +10% (до 2,2%) | около 80 000 | более 5 месяцев |
| 10% | +20% (до 12%) | около 3 800 | 2 недели |
| 10% | +10% (до 11%) | около 14 700 | около месяца |
Расчёты сделаны для стандартных параметров: уровень значимости 5% и мощность 80%. Вывод из таблицы важный: при конверсии в заказ около 2% и тысяче визитов в день обнаружить прирост меньше 20% практически нереально. Поэтому небольшим сайтам стоит тестировать смелые изменения с потенциально большим эффектом или измерять конверсию в промежуточный шаг — добавление в корзину, начало оформления, — где базовая конверсия выше и выборка нужна меньше.
Отдельное правило о длительности: тест должен идти полными неделями, минимум две. Поведение посетителей в понедельник и в субботу заметно различается, и тест, запущенный в среду и остановленный в пятницу, даст смещённый результат. Также стоит избегать периодов с аномалиями — крупных распродаж, праздников, резкого изменения рекламы.
Как провести тест: пошагово
Корректный тест требует дисциплины на каждом этапе. Порядок действий, которого мы придерживаемся на проектах, выглядит так.
Сформулировать гипотезу и метрику
Записать заранее, что меняем, какая основная метрика (одна!) и какие вспомогательные метрики будем смотреть, чтобы не навредить, например средний чек.
Рассчитать выборку и срок
По базовой конверсии и минимальному интересующему эффекту определить нужное число посетителей и дату окончания. Записать их и не менять по ходу.
Реализовать вариант
Сделать изменение так, чтобы оно не замедляло страницу и не вызывало мерцания исходной версии. Проверить вариант на всех устройствах и в браузерах.
Проверить разделение
Убедиться, что посетители распределяются поровну, один человек всегда видит один и тот же вариант, а события корректно попадают в аналитику.
Дождаться окончания
Не смотреть результаты каждый день с намерением остановить тест при первом «успехе». Это главная ошибка, о ней ниже.
Проанализировать и задокументировать
Оценить значимость, посмотреть сегменты, записать вывод — в том числе для неудачных тестов. Отрицательный результат тоже знание.
Техническая реализация
Есть два подхода. Клиентский — изменения вносит скрипт в браузере после загрузки страницы. Его проще запустить, но он может вызывать мерцание: посетитель на долю секунды видит исходную версию, и это само по себе влияет на результат. Серверный — сайт сразу отдаёт нужный вариант. Он надёжнее и не влияет на скорость, но требует участия разработчика. Для изменений в логике, например в шагах оформления заказа или расчёте доставки, мы используем только серверные тесты. Посмотреть, как подобные доработки встраиваются в процесс, можно на странице технической поддержки.
Типичные ошибки, которые дают ложный результат
Большинство «успешных» тестов, результаты которых потом не подтверждаются после внедрения, страдают от одних и тех же ошибок. Знать их важно даже тем, кто не проводит тесты сам, а лишь принимает решения по их итогам.
Почему нельзя остановить тест, как только вариант B вырвался вперёд?
Это так называемое «подглядывание». В начале теста колебания огромные, и почти любой вариант в какой-то момент выглядит победителем. Если проверять результат каждый день и остановиться при первой значимой разнице, вероятность ложного вывода вырастает с 5% до 20–30% и выше. Тест останавливают только по достижении заранее рассчитанной выборки.
Можно ли смотреть сразу на десять метрик и выбрать ту, где есть эффект?
Нет. Чем больше метрик и сегментов вы проверяете, тем выше шанс найти случайную «значимую» разницу. Основная метрика выбирается заранее, остальные — только для контроля побочных эффектов.
Можно ли тестировать сразу пять вариантов?
Можно, но выборка на каждый вариант должна быть такой же, как при двух, то есть общий трафик нужен в разы больше. Кроме того, требуется поправка на множественные сравнения. Для небольших сайтов лучше A/B, а не A/B/C/D/E.
Почему результат после внедрения оказался хуже, чем в тесте?
Возможные причины: тест был остановлен рано, на результат повлиял эффект новизны — постоянные посетители кликают на новое просто потому, что оно новое, — или тест шёл в нетипичный период. Иногда это просто регрессия к среднему: выигравший вариант был удачлив.
Можно ли запускать несколько тестов одновременно?
Можно, если они затрагивают разные страницы или разные шаги, которые слабо влияют друг на друга. Два теста на одной и той же карточке товара одновременно смешают эффекты.
Что делать, если трафика мало
У многих корпоративных сайтов и небольших магазинов трафика недостаточно для классических тестов на конверсию в заказ. Это не значит, что нужно отказаться от проверки гипотез. Есть несколько рабочих подходов.
Первый — тестировать на промежуточной метрике с высокой базовой конверсией: клик по кнопке, добавление в корзину, переход к форме. Выборка нужна в разы меньше. Второй — тестировать смелые изменения: полностью другой первый экран, другой оффер, другая структура страницы — у них потенциальный эффект 30–50%, и его можно обнаружить на скромном трафике. Третий — качественные методы: юзабилити-тестирование на 5–7 респондентах из целевой аудитории находит основные проблемы интерфейса без всякой статистики. Об этом подробнее — в статье про UX-аудит сайта.
И наконец, для небольших сайтов бывает разумнее внедрять изменения последовательно и сравнивать сопоставимые периоды, принимая более высокий риск ошибки. Главное — делать это осознанно, учитывать сезонность и не приписывать изменению эффект, который мог быть вызван рекламой или внешними событиями.
Выводы
A/B-тестирование — мощный инструмент, но только при соблюдении правил. Начинайте с гипотезы, подкреплённой данными, выбирайте одну основную метрику, заранее рассчитывайте выборку и длительность и не останавливайте тест раньше срока, даже если результат выглядит убедительно. Тесты идут полными неделями, вне аномальных периодов, а изменения в логике лучше реализовывать на сервере.
Если трафика мало, тестируйте смелые изменения и промежуточные метрики либо используйте качественные исследования. И фиксируйте результаты всех тестов, включая неудачные: со временем этот архив становится ценным знанием о ваших клиентах, которое не купить ни у одного подрядчика.
Нужен сайт или интернет-магазин?
Обсудим задачу, подскажем подходящую платформу и оценим сроки и бюджет — бесплатно и без обязательств.
Обсудить проект
