Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 6 «Эксперименты: A/B»

Последовательные тесты: как подглядывать честно

В прошлом уроке мы увидели: подглядывать в обычный A/B и останавливаться на первом «значимо» — значит раздувать ложные победы. Но бизнес хочет останавливать тесты раньше. Есть честный способ — последовательные методы, которые заранее закладывают цену многократных проверок.

последовательная граница (α-spending)план (дизайн)день теста (выборка копится) →p-value ↑
Правило остановки:
Данные:
Доля A/A-тестов с ложной остановкой (правило сработало хоть раз, хотя эффекта нет). Честная цель — ≤5%. Прогоняйте «эффекта нет» кнопкой «+50».
наивный 0.05: α-spending: счётчик улик ×20 (SPRT): (A/A-тестов: 0)

Тот же вид по дням, что в уроке про подглядывание, но правило остановки теперь честное. Наивный плоский 0.05 проверяется каждый день → под A/A p-value то и дело ныряет под него (красные ложные остановки), куда больше 5%. Граница α-spending строгая в начале и мягче к плановому дню → ложных остановок около 5% (семейство group sequential: Pocock, O’Brien–Fleming). Переключите на «счётчик улик (SPRT)», чтобы увидеть второе семейство.

Главная идея — это тот же график p-value по дням, что и в прошлом уроке про подглядывание, только граница остановки теперь честная. Выберите «наивный порог 0.05», сценарий «эффекта нет (A/A)» и прогоните «+50 тестов»: линии то и дело ныряют под плоский порог — доля ложных остановок далеко за 5% (это и есть подглядывание из прошлого урока). Теперь переключите на «последовательную границу (α-spending)»: под тем же A/A доля возвращается к честным ~5%, потому что в начале теста порог строгий и смягчается лишь к плановому дню. В этом и фокус: цену многократных проверок закладывают заранее. Pocock и O'Brien–Fleming — конкретные семейства таких границ.

Что это значит
Какое решение это меняет

Хотите смотреть в процессе — выберите последовательный дизайн до старта. Менять правила остановки по ходу теста нельзя.

Если команде важно следить за тестом и останавливать рано — это не повод нарушать статистику, а повод включить последовательный режим в A/B-платформе. Тогда ранняя остановка честная, а не самообман.

Без таких методов правило простое и жёсткое: размер выборки и срок фиксируют заранее, решение — один раз в конце. Любое «давайте выключим, уже значимо на третий день» в фиксированном тесте раздувает ложные победы.

Где это встречается

Клинические испытания десятилетиями используют group sequential: промежуточные анализы позволяют этично остановить испытание, если лекарство явно работает или явно вредит.

Современные продуктовые A/B-платформы (в т.ч. крупных техкомпаний) предлагают always-valid статистику именно для того, чтобы продакты могли честно подглядывать в дашборд.

Определения
Последовательный тест
метод, допускающий многократные проверки по ходу с контролем общей ошибки 1 рода.
По-простому: дизайн, в котором промежуточные взгляды разрешены заранее.
Отношение правдоподобия (SPRT)
накопленный «счётчик улик»: во сколько раз данные вероятнее при наличии эффекта, чем при его отсутствии. Без эффекта он в среднем не растёт (честная игра), поэтому редко доходит до высоких значений.
По-простому: счётчик улик за эффект; правило «стоп на 20×» держит ошибку 5% при любом числе взглядов.
Group sequential
запланированные промежуточные срезы с ужесточёнными порогами (O'Brien–Fleming, Pocock) и опцией ранней остановки.
По-простому: несколько запланированных точек остановки с раздельным бюджетом ошибки.
Always-valid p-value
p-значение/интервал, на который можно смотреть в любой момент сколько угодно раз без раздувания ошибки.
По-простому: p-value, которому можно верить в любой момент взгляда.
Бюджет ошибки (alpha spending)
распределение допустимой ошибки 1 рода по нескольким проверкам так, чтобы сумма осталась 5%.
По-простому: 5% ошибки — это бюджет: тратим по кусочку на каждую проверку.
Когда метод врёт (допущения)

Выигрыш в скорости не бесплатен: последовательные методы в худшем случае требуют не меньшую, а иногда большую максимальную выборку — экономия в среднем, а не гарантированно.

Применять нужно именно предназначенный метод. Брать обычный фиксированный p-value и смотреть на него каждый день — это не «последовательный тест», а то самое подглядывание.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»