Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 5 «Проверка гипотез»

Размер выборки и мощность

В прошлом уроке мы увидели: чем больше данных, тем меньше ошибок. Но сколько именно нужно? Это не угадывают — это считают заранее. Иначе рискуете провести эксперимент, который физически не способен заметить эффект.

критич. значение0MDE = +30 ₽ (3%)оценка разницы средних между группами, ₽ →
H0: эффекта нет H1: эффект есть■ α — ложное срабатывание (5%)■ β — пропуск эффекта (83%)■ мощность = 1−β (17%)
цель 80%n = 20мощность ↑размер выборки n →
При текущем n = 20 мощность 17%. Для цели 80% нужно n ≈ 275 на группу (стандартизованный эффект d = 0.15).

Метрика — средний чек, 1000 ₽. Управляем не разницей средних напрямую (её задаёт бизнес-цель), а MDE — минимальным приростом в %, который хотим уверенно ловить; он и задаёт центр синей H1 (+30 ₽). Верхний график — два распределения оценки: серое при «эффекта нет» (H0), синее при «эффект есть» (H1). Порог делит ось на решения: красное справа от порога под H0 — α (приняли шум за эффект), жёлтое слева под H1 — β (проглядели реальный эффект). Меньше σ или больше n сужают колокола → β падает, мощность растёт. Нижний график собирает это в кривую «мощность от n»: под заданный MDE подбирают n, а не наоборот.

Сначала разберёмся, откуда вообще берётся мощность. Верхний график — это два распределения нашей оценки разницы между группами. Серый колокол слева — мир, где эффекта НЕТ (H0): разница в среднем нулевая, но из-за случайности оценка гуляет вокруг нуля. Синий колокол справа — мир, где эффект ЕСТЬ (H1): оценка гуляет вокруг настоящей разницы. По горизонтали — какую разницу мы могли бы намерить.

Что это значит
Какое решение это меняет

Размер выборки — решение, которое принимается до запуска. Запустить недобранный тест — значит заранее согласиться не заметить эффект и потратить трафик впустую.

Перед запуском A/B-теста продуктовые аналитики считают размер выборки: «чтобы заметить прирост конверсии на 1 процентный пункт с мощностью 80%, нужно столько-то пользователей на вариант». Без этого расчёта тест легко оказывается бессмысленным.

И наоборот: на огромной выборке статистически значимой становится даже ничтожная, бесполезная для бизнеса разница. Поэтому смотрят не только на значимость, но и на размер эффекта.

Где это встречается

Клинические испытания планируют число пациентов именно так — недобор означает, что рабочее лекарство могут забраковать просто из-за нехватки данных.

Социологи рассчитывают размер опроса под нужную точность; инженеры — число прогонов нагрузочного теста. Везде сначала считают, сколько данных нужно, и только потом собирают.

Определения
Мощность
вероятность обнаружить эффект, если он действительно есть (1 минус вероятность пропуска).
По-простому: шанс поймать эффект, который правда существует.
Размер эффекта
насколько велика разница, которую мы хотим заметить. Маленький эффект требует большой выборки.
По-простому: насколько велика разница, которую ищем.
Планирование выборки
расчёт нужного n заранее, чтобы теста хватило сил заметить важный эффект.
По-простому: сколько данных нужно для честного теста — считается ДО старта.
Чувствительностьd = разница / σ
способность теста замечать малые эффекты. Растёт с размером эффекта и выборки и падает с разбросом σ.
По-простому: чем меньше искомый эффект, тем больше нужно данных.
Когда метод врёт (допущения)

Расчёт размера выборки честен ровно настолько, насколько честна оценка ожидаемого эффекта. Её обычно берут оптимистично; реальный эффект меньше — и «рассчитанный» тест оказывается недобранным по мощности.

Дисперсию метрики берут из истории, а она меняется: сезон, состав трафика, акции. Закладывайте запас и пересчитывайте на свежих данных — σ из прошлого квартала может подвести.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»