Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 6 «Эксперименты: A/B»

A/B-тест: проверяем изменение честно

На сайте пиццерии Вы поменяли кнопку «Заказать», и конверсия выросла с 10% до 12%. Это заслуга кнопки — или просто повезло с посетителями? A/B-тест отвечает честно: показываем вариант A одной случайной половине пользователей, вариант B — другой, и сравниваем.

0%5%10%15%20%25%A10.6%B11.8%
Интервалы перекрываются — разницу пока нельзя отличить от случайности.жёлтая засечка — истинная конверсия

Две группы пользователей, случайно поделённые пополам. У каждой своя конверсия — доля совершивших целевое действие. Точка — наблюдаемая конверсия, отрезок вокруг неё — доверительный интервал: куда правдоподобно попадает истинная конверсия с учётом случайности.

Что это значит
Какое решение это меняет

A/B нужен ровно тогда, когда цена ошибки выше цены теста. Катить без теста — тоже решение, просто со ставкой на интуицию.

Грамотный тест: до запуска считают нужный размер выборки (чтобы хватило мощности поймать эффект), не подглядывают в результат каждый час и не останавливают тест на первой красивой цифре.

Решение принимают по интервалам и значимости, а не по голым точкам — иначе легко принять случайный всплеск за победу.

Где это встречается

A/B-тесты — стандарт в продуктах: цвет и текст кнопки, тема письма, цена, порядок ленты. Везде сравнивают варианты на живых пользователях, а не на интуиции.

В медицине это рандомизированные контролируемые испытания — золотой стандарт доказательности. В агрономии так сравнивают обработку полей. Принцип один: случайно поделить и честно сравнить.

Определения
A/B-тест
сравнение двух вариантов на случайно поделённых группах пользователей.
По-простому: делим случайно пополам, меняем одно, сравниваем честно.
Рандомизация
случайное распределение по группам — чтобы группы отличались только вариантом, а не составом.
По-простому: случайное распределение — щит от скрытых различий групп.
Конверсия
доля пользователей, совершивших целевое действие (покупку, клик, регистрацию).
По-простому: доля дошедших до целевого действия.
Доверительный интервал
диапазон, в котором правдоподобно лежит истинное значение с учётом случайности выборки.
По-простому: вилка, в которой правдоподобно живёт истинный эффект.
Когда метод врёт (допущения)

A/B честен при настоящей случайной рандомизации, отсутствии пересечений с другими тестами и независимости пользователей. Сетевые эффекты (соцсети, маркетплейсы, доставка) нарушают независимость: группы влияют друг на друга, и наивное сравнение врёт.

Нужны заранее зафиксированные метрика, размер выборки и срок. Подглядывание, остановка на первой «значимости» и выбор метрики задним числом обесценивают результат.

Подробный разбор: математика и механизм (необязательно)

У того, что измеряет A/B, есть имя: средний эффект воздействия, ATE (Average Treatment Effect) — средняя разница исхода между «увидел B» и «увидел A» по всем пользователям. Разница средних в группах и есть оценка ATE, а рандомизация — то, что делает эту оценку честной.

Почему именно СРЕДНИЙ, а не для каждого: один пользователь не может одновременно увидеть и A, и B, поэтому индивидуальный эффект ненаблюдаем (фундаментальная проблема причинности). Эффект внутри сегмента — это CATE; о нём и о том, как ATE прячет разнородность, — в уроке про сегменты.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»