База знаний · разбор

A/B-тестирование сайта: как проверить гипотезу и не обмануться цифрами

Понятное руководство по A/B-тестированию: основные виды экспериментов, расчёт выборки, примеры, ошибки и критерии принятия решений.

Метафорическая иллюстрация A/B-тестирования: весы сравнивают два варианта страницы на тёплом бумажном фоне.

A/B-тестирование — это контролируемый эксперимент, в котором случайно выбранным группам посетителей показывают разные версии страницы, интерфейса или предложения. Затем сравнивают заранее выбранный показатель: покупку, заявку, регистрацию, добавление в корзину или другой полезный для бизнеса результат.

Задача метода не в том, чтобы найти «красивый» дизайн. Он помогает проверить конкретную гипотезу: например, станет ли больше заявок, если сократить форму с шести полей до трёх. Важно отличать подтверждённый эффект от обычных колебаний данных.

Принцип работы и где применять

В классическом A/B-тесте аудиторию случайным образом делят на две группы. Группа A видит текущую версию — контрольную. Группа B — вариант с одним или несколькими изменениями. Один пользователь должен оставаться в своей группе до конца эксперимента: иначе он может увидеть оба варианта, а результаты исказятся.

Обычно принадлежность фиксируют в cookie или пользовательском идентификаторе. Если человек заходит с разных устройств без авторизации, обеспечить идеальную связку сложнее — это нужно учитывать при интерпретации результата.

Базовая формула конверсии:

```text CR = C / N × 100% ```

Где `C` — число целевых действий, а `N` — число пользователей, которым показали вариант. Если из 10 000 посетителей вариант A принёс 400 заказов, его конверсия равна `400 / 10 000 × 100% = 4%`.

Относительное изменение конверсии считают так:

```text Uplift = (CR_B / CR_A − 1) × 100% ```

Если у B конверсия 4,4%, а у A — 4%, то рост составляет `(4,4% / 4% − 1) × 100% = 10%`. Но сам по себе рост на 10% ещё не означает, что вариант B действительно лучше: нужна проверка статистической значимости.

Тестирование уместно, когда есть достаточный трафик, измеримая цель и возможность стабильно показать варианты аудитории. Его применяют для посадочных страниц, карточек товаров, корзины, форм, поиска, онбординга, email-рассылок и продуктовых сценариев.

Основные варианты A/B-тестирования

Классический A/B-тест. Сравниваются две версии одного элемента или целой страницы. Например, на странице услуги меняют текст кнопки с «Отправить» на «Получить расчёт». Это самый понятный формат для проверки одной приоритетной гипотезы.

A/B/n-тест. Контрольный вариант A сравнивают сразу с несколькими версиями: B, C, D и далее. Например, проверяют три варианта первого экрана лендинга: с акцентом на цену, скорость внедрения или кейсы. Формат экономит время на последовательных запусках, но требует больше трафика: посетители распределяются между большим числом групп.

Split URL-тест. Пользователей направляют на разные URL: например, на текущую страницу `/tarif` и полностью переработанную `/tarif-new`. Такой подход удобен, когда меняются шаблон, CMS, архитектура страницы или серверная логика. Критично корректно настроить распределение трафика и не смешивать эксперимент с SEO-изменениями: поисковые роботы и обычные пользователи не должны получать противоречивые сигналы.

Мультивариантный тест, или MVT. Одновременно проверяют комбинации нескольких элементов. Допустим, есть два заголовка и три варианта кнопки — получится `2 × 3 = 6` комбинаций. MVT отвечает не только на вопрос, какой вариант сильнее, но и показывает взаимодействие элементов: например, работает ли конкретная кнопка именно с определённым заголовком. Цена этой детализации — очень большой необходимый объём трафика.

Тест с неравным распределением трафика. Группы не всегда делят 50/50. Схема 90/10 может быть оправдана для рискованного изменения на коммерчески важной странице: большинство посетителей остаётся на проверенном варианте. Однако при равных условиях распределение 50/50 быстрее набирает данные и даёт наиболее эффективное сравнение.

Отдельно стоит упомянуть многоруких бандитов — алгоритмы, которые по ходу эксперимента начинают чаще показывать перспективный вариант. Это полезно для непрерывной оптимизации и снижения потерь, но хуже подходит для строгого вывода о причинности: правила распределения трафика меняются в процессе.

Как рассчитать выборку и длительность

До запуска нужно выбрать одну основную метрику. Для интернет-магазина это может быть оплаченный заказ, для B2B-сайта — квалифицированная заявка, для медиа — регистрация. Клики по кнопке можно использовать как диагностическую метрику, но не стоит подменять ею бизнес-результат.

Размер выборки зависит от текущей конверсии, минимального эффекта, который имеет смысл заметить, уровня значимости и статистической мощности. Для грубой оценки числа пользователей на вариант при сравнении двух конверсий можно использовать формулу:

```text n ≈ 2 × (Zα/2 + Zβ)² × p̄ × (1 − p̄) / (p_B − p_A)² ```

Где `p_A` — текущая конверсия, `p_B` — ожидаемая конверсия, `p̄ = (p_A + p_B) / 2`; `Zα/2 = 1,96` для уровня значимости 5%, а `Zβ = 0,84` для мощности 80%.

Пример: текущая конверсия — 4%, а бизнесу важен минимум 10% относительного роста, то есть до 4,4%. Подстановка значений даёт примерно 40 тысяч пользователей на каждый вариант. Точный расчёт лучше делать в калькуляторе выборки или статистическом сервисе: формула выше — ориентир, а не замена проверке условий.

Длительность теста рассчитывают так:

```text Дни = (n × число вариантов) / среднее число участников в день ```

Если нужны 40 тысяч пользователей на вариант, вариантов два, а в эксперимент ежедневно попадает 8 тысяч посетителей, потребуется около 10 дней. На практике тест стоит проводить полными недельными циклами, чтобы захватить различия между буднями и выходными. Не останавливайте его только потому, что на третий день график стал приятным глазу.

Порядок запуска: от наблюдения к решению

Сначала изучите поведение пользователей в веб-аналитике: воронки, точки выхода, ошибки форм, поиск по сайту, записи сессий при соблюдении требований к персональным данным. Найдите проблему, а не просто элемент, который «давно хочется обновить».

Далее сформулируйте гипотезу в проверяемом виде: «Если вынести срок доставки рядом с кнопкой покупки, конверсия в заказ вырастет, потому что посетителю не придётся искать важное условие». Укажите аудиторию, основную метрику, ожидаемый эффект и ограничения.

После приоритизации создайте варианты, настройте случайное распределение и проверьте технику до старта: события, цели, оплату, отображение на мобильных устройствах, скорость загрузки. В эксперимент не должны попадать внутренние сотрудники и боты, если их поведение заметно влияет на метрику.

Результат оценивают не только по конверсии. Посмотрите на выручку, средний чек, отмены, возвраты, ошибки и скорость страницы. Вариант, который увеличил отправку формы, но привёл больше нецелевых обращений, нельзя автоматически назвать победителем.

На мой взгляд, хороший A/B-тест заканчивается не фразой «кнопка победила», а решением, которое можно объяснить через поведение аудитории и экономику продукта.

Частые ошибки и связанные понятия

Первая ошибка — запускать много изменений без понятной причины. Если вместе поменять оффер, дизайн, цену и форму, будет трудно понять источник эффекта. Для простых гипотез предпочтительнее последовательные A/B-тесты; MVT имеет смысл только при достаточной аудитории.

Вторая — подглядывать в результаты каждый день и завершать тест при первом «значимом» числе. Это повышает риск ложной победы. Заранее зафиксируйте размер выборки, срок, метрики и правило принятия решения.

Третья — смешивать тест с внешними изменениями: рекламной кампанией, распродажей, изменением цен, проблемами колл-центра или редизайном соседнего шага воронки. Если эти факторы нельзя исключить, хотя бы зафиксируйте их в отчёте.

Четвёртая — делать выводы по усреднённым данным без сегментов. Полезно отдельно проверить новых и возвращающихся пользователей, мобильный и десктопный трафик, каналы привлечения. Но сегментный анализ лучше планировать заранее: поиск случайных «побед» после завершения теста тоже создаёт ложные находки.

С A/B-тестированием связаны понятия гипотеза, контрольная группа, статистическая значимость, мощность теста, минимально обнаружимый эффект и инкрементальность. Вместе они помогают отвечать на главный вопрос: вызвало ли изменение измеримый полезный результат, а не просто совпало с ним.

Практический вывод: начинайте не с цвета кнопки, а с узкого бизнес-вопроса. Выберите одну основную метрику, рассчитайте выборку до старта, сохраните стабильные условия и внедряйте вариант только после того, как оцените и статистику, и качество результата.

Обсудить выводы

В Telegram-канале «Влад ПРО» публикую короткие разборы новостей SEO, аналитики и digital-маркетинга.

Перейти в Telegram →

Консультация

Разберём вашу задачу.

Опишите сайт и вопрос. Отвечу в Telegram, уточню вводные и предложу подходящий формат.

✓ Общение после заявки — в Telegram