Размер выборки и мощность
В прошлом уроке мы увидели: чем больше данных, тем меньше ошибок. Но сколько именно нужно? Это не угадывают — это считают заранее. Иначе рискуете провести эксперимент, который физически не способен заметить эффект.
Метрика — средний чек, 1000 ₽. Управляем не разницей средних напрямую (её задаёт бизнес-цель), а MDE — минимальным приростом в %, который хотим уверенно ловить; он и задаёт центр синей H1 (+30 ₽). Верхний график — два распределения оценки: серое при «эффекта нет» (H0), синее при «эффект есть» (H1). Порог делит ось на решения: красное справа от порога под H0 — α (приняли шум за эффект), жёлтое слева под H1 — β (проглядели реальный эффект). Меньше σ или больше n сужают колокола → β падает, мощность растёт. Нижний график собирает это в кривую «мощность от n»: под заданный MDE подбирают n, а не наоборот.
Сначала разберёмся, откуда вообще берётся мощность. Верхний график — это два распределения нашей оценки разницы между группами. Серый колокол слева — мир, где эффекта НЕТ (H0): разница в среднем нулевая, но из-за случайности оценка гуляет вокруг нуля. Синий колокол справа — мир, где эффект ЕСТЬ (H1): оценка гуляет вокруг настоящей разницы. По горизонтали — какую разницу мы могли бы намерить.
Размер выборки — решение, которое принимается до запуска. Запустить недобранный тест — значит заранее согласиться не заметить эффект и потратить трафик впустую.
Перед запуском A/B-теста продуктовые аналитики считают размер выборки: «чтобы заметить прирост конверсии на 1 процентный пункт с мощностью 80%, нужно столько-то пользователей на вариант». Без этого расчёта тест легко оказывается бессмысленным.
И наоборот: на огромной выборке статистически значимой становится даже ничтожная, бесполезная для бизнеса разница. Поэтому смотрят не только на значимость, но и на размер эффекта.
Клинические испытания планируют число пациентов именно так — недобор означает, что рабочее лекарство могут забраковать просто из-за нехватки данных.
Социологи рассчитывают размер опроса под нужную точность; инженеры — число прогонов нагрузочного теста. Везде сначала считают, сколько данных нужно, и только потом собирают.
Определения
Расчёт размера выборки честен ровно настолько, насколько честна оценка ожидаемого эффекта. Её обычно берут оптимистично; реальный эффект меньше — и «рассчитанный» тест оказывается недобранным по мощности.
Дисперсию метрики берут из истории, а она меняется: сезон, состав трафика, акции. Закладывайте запас и пересчитывайте на свежих данных — σ из прошлого квартала может подвести.