Последовательные тесты: как подглядывать честно
В прошлом уроке мы увидели: подглядывать в обычный A/B и останавливаться на первом «значимо» — значит раздувать ложные победы. Но бизнес хочет останавливать тесты раньше. Есть честный способ — последовательные методы, которые заранее закладывают цену многократных проверок.
Тот же вид по дням, что в уроке про подглядывание, но правило остановки теперь честное. Наивный плоский 0.05 проверяется каждый день → под A/A p-value то и дело ныряет под него (красные ложные остановки), куда больше 5%. Граница α-spending строгая в начале и мягче к плановому дню → ложных остановок около 5% (семейство group sequential: Pocock, O’Brien–Fleming). Переключите на «счётчик улик (SPRT)», чтобы увидеть второе семейство.
Главная идея — это тот же график p-value по дням, что и в прошлом уроке про подглядывание, только граница остановки теперь честная. Выберите «наивный порог 0.05», сценарий «эффекта нет (A/A)» и прогоните «+50 тестов»: линии то и дело ныряют под плоский порог — доля ложных остановок далеко за 5% (это и есть подглядывание из прошлого урока). Теперь переключите на «последовательную границу (α-spending)»: под тем же A/A доля возвращается к честным ~5%, потому что в начале теста порог строгий и смягчается лишь к плановому дню. В этом и фокус: цену многократных проверок закладывают заранее. Pocock и O'Brien–Fleming — конкретные семейства таких границ.
Хотите смотреть в процессе — выберите последовательный дизайн до старта. Менять правила остановки по ходу теста нельзя.
Если команде важно следить за тестом и останавливать рано — это не повод нарушать статистику, а повод включить последовательный режим в A/B-платформе. Тогда ранняя остановка честная, а не самообман.
Без таких методов правило простое и жёсткое: размер выборки и срок фиксируют заранее, решение — один раз в конце. Любое «давайте выключим, уже значимо на третий день» в фиксированном тесте раздувает ложные победы.
Клинические испытания десятилетиями используют group sequential: промежуточные анализы позволяют этично остановить испытание, если лекарство явно работает или явно вредит.
Современные продуктовые A/B-платформы (в т.ч. крупных техкомпаний) предлагают always-valid статистику именно для того, чтобы продакты могли честно подглядывать в дашборд.
Определения
Выигрыш в скорости не бесплатен: последовательные методы в худшем случае требуют не меньшую, а иногда большую максимальную выборку — экономия в среднем, а не гарантированно.
Применять нужно именно предназначенный метод. Брать обычный фиксированный p-value и смотреть на него каждый день — это не «последовательный тест», а то самое подглядывание.