A/B-тест: проверяем изменение честно
На сайте пиццерии Вы поменяли кнопку «Заказать», и конверсия выросла с 10% до 12%. Это заслуга кнопки — или просто повезло с посетителями? A/B-тест отвечает честно: показываем вариант A одной случайной половине пользователей, вариант B — другой, и сравниваем.
Две группы пользователей, случайно поделённые пополам. У каждой своя конверсия — доля совершивших целевое действие. Точка — наблюдаемая конверсия, отрезок вокруг неё — доверительный интервал: куда правдоподобно попадает истинная конверсия с учётом случайности.
A/B нужен ровно тогда, когда цена ошибки выше цены теста. Катить без теста — тоже решение, просто со ставкой на интуицию.
Грамотный тест: до запуска считают нужный размер выборки (чтобы хватило мощности поймать эффект), не подглядывают в результат каждый час и не останавливают тест на первой красивой цифре.
Решение принимают по интервалам и значимости, а не по голым точкам — иначе легко принять случайный всплеск за победу.
A/B-тесты — стандарт в продуктах: цвет и текст кнопки, тема письма, цена, порядок ленты. Везде сравнивают варианты на живых пользователях, а не на интуиции.
В медицине это рандомизированные контролируемые испытания — золотой стандарт доказательности. В агрономии так сравнивают обработку полей. Принцип один: случайно поделить и честно сравнить.
Определения
A/B честен при настоящей случайной рандомизации, отсутствии пересечений с другими тестами и независимости пользователей. Сетевые эффекты (соцсети, маркетплейсы, доставка) нарушают независимость: группы влияют друг на друга, и наивное сравнение врёт.
Нужны заранее зафиксированные метрика, размер выборки и срок. Подглядывание, остановка на первой «значимости» и выбор метрики задним числом обесценивают результат.
Подробный разбор: математика и механизм (необязательно)
У того, что измеряет A/B, есть имя: средний эффект воздействия, ATE (Average Treatment Effect) — средняя разница исхода между «увидел B» и «увидел A» по всем пользователям. Разница средних в группах и есть оценка ATE, а рандомизация — то, что делает эту оценку честной.
Почему именно СРЕДНИЙ, а не для каждого: один пользователь не может одновременно увидеть и A, и B, поэтому индивидуальный эффект ненаблюдаем (фундаментальная проблема причинности). Эффект внутри сегмента — это CATE; о нём и о том, как ATE прячет разнородность, — в уроке про сегменты.