Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 6 «Эксперименты: A/B»

Подглядывание: как испортить честный тест

Тест новой кнопки «Заказать» идёт третий день, и p-value уже мигнул ниже 0.05. Остановить и праздновать? A/B-тест честен, только если играть по правилам, а самая частая ошибка — подглядывать в результат и останавливать тест, как только увидели «значимо». Покажем на A/A-тесте, где разницы заведомо нет, почему это ломает всё.

порог 0.05план (дизайн)день теста (выборка копится) →p-value ↑нужный размер по дизайну (1760)день теста →накоплено наблюдений ↑
Один тест — одна случайная траектория (её видно жирной линией, прошлые — бледным «облаком»). Чтобы увидеть, КАК ЧАСТО подглядывание даёт ложную «победу», нужно прогнать много тестов — для этого и кнопка «+50».
хоть раз ныряли под порог до срока: —%значимы строго на плановом дне: —%(тестов: 0)

Верхний график — p-value по дням, пока копится выборка (снизу — как она копится к нужному размеру). Без эффекта p-value случайно блуждает и почти наверняка хоть раз нырнёт под 0.05 — но это ложный повод остановиться. Честное правило: смотреть результат на плановом дне (чёрный пунктир), а не «как только стало значимо».

Запускаем A/A-тест: оба варианта на самом деле одинаковы, настоящей разницы нет. Верхняя линия — p-value одного эксперимента по дням, пока копится выборка; снизу видно, как она копится к нужному по дизайну размеру. Жёлтая черта — порог 0.05, чёрный пунктир — плановый день окончания. Нажмите «запустить 1 эксперимент».

Что это значит
Какое решение это меняет

Дефолт — ждать запланированного конца теста. Каждая ранняя остановка «по значимости» повышает шанс купить шум вместо эффекта.

Продуктовые команды фиксируют длительность теста и не трогают его раньше срока. «Давай выключим, уже значимо на третий день» — классический способ внедрить то, что на самом деле не работает.

Это прямое следствие урока про размер выборки: тест нужно довести до запланированного объёма, а не останавливать на первом удобном всплеске.

Где это встречается

В науке у этого есть имя — p-hacking: данные и способы анализа перебирают, пока не выскочит p < 0.05. Из-за этого часть громких результатов потом не воспроизводится.

Тот же соблазн в трейдинге и маркетинге: проверить достаточно «стратегий», и одна случайно покажет отличный результат на прошлом — а на будущем рассыплется.

Определения
Подглядывание (peeking)
многократная проверка результата по ходу теста с остановкой на первом «значимо».
По-простому: останавливать тест на первой «значимости» — верный способ купить шум.
A/A-тест
тест двух одинаковых вариантов. Любая «разница» в нём — чистая случайность, удобно для проверки методики.
По-простому: пустой тест: показывает, как часто система зря кричит «эффект!».
Последовательный тест
метод, позволяющий честно подглядывать: он заранее учитывает многократные проверки и не раздувает ложные срабатывания.
По-простому: честный способ смотреть в процессе — с платой за каждый взгляд.
Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»