Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 6 «Эксперименты: A/B»

Доказательная сила: зачем вообще нужен A/B

«Мы обновили меню на сайте пиццерии, и заказы выросли» — это доказательство? И да, и нет: всё зависит от того, КАК получено наблюдение. У свидетельств есть иерархия силы. Прежде чем разбирать механику A/B, поймём, почему именно он стоит на вершине этой пирамиды. Кликайте по уровням.

↑ сильнееслабее ↓
A/B-тест (рандомизированный)
Случайное деление на группы уравнивает все прочие факторы → видимая разница вызвана именно изменением. Золотой стандарт причинности.

Не все доводы равны. Внизу пирамиды — самые слабые: мнение, единичный случай, отзыв («мне кажется, так лучше»). Они легко поддаются искажениям и ошибке выжившего. Чем выше уровень, тем надёжнее вывод и тем труднее объяснить его случайностью или посторонней причиной.

Что это значит
Какое решение это меняет

Уровень доказательств определяет, какие решения на них можно опирать: наблюдений хватает для гипотез, крупные ставки требуют эксперимента.

Практический навык — спрашивать про любой вывод: «на каком уровне пирамиды он получен?». «Менеджер уверен» — низ. «В данных есть корреляция» — чуть выше. «Сделали до/после» — ещё выше. «Прогнали честный A/B» — вершина. Это сразу калибрует доверие к решению.

A/B дорог: нужны трафик, время, инфраструктура. Поэтому его берут для важных и спорных решений, а очевидные мелочи катят и без него. Но когда цена ошибки высока — только рандомизированный эксперимент даёт надёжный ответ.

Где это встречается

В медицине та же пирамида: мнение эксперта внизу, рандомизированные контролируемые испытания и их мета-анализы — наверху. Лекарство не одобрят на основании наблюдений — нужен RCT, прямой аналог A/B.

В продукте громкие провалы часто рождаются из низа пирамиды: «всем очевидно, что так лучше» — выкатили без теста — метрика просела. A/B существует ровно для того, чтобы такие «очевидности» проверять.

Определения
Доказательная сила
насколько надёжно свидетельство устанавливает причинно-следственную связь, а не случайное совпадение.
По-простому: насколько дизайн исследования защищает от самообмана.
Рандомизация
случайное распределение по группам; уравнивает все прочие факторы и потому даёт право на причинный вывод.
По-простому: монетка решает, кто в тест, — и уравнивает всё остальное.
Квази-эксперимент
сравнение без рандомизации (до/после, разные регионы). Слабее A/B: эффект можно спутать с посторонними изменениями.
По-простому: почти эксперимент: сравнение без монетки, с оговорками.
Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»