Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 5 «Проверка гипотез»

Статистические критерии: какой тест выбрать

Проверка гипотез — это общая идея. Но чтобы превратить «разницу в данных» в число «насколько это случайно» (p-value), нужен конкретный инструмент — статистический критерий. Их несколько, и выбор зависит от того, что за метрика и какие у неё данные. Разберём три рабочих критерия аналитика и условия их применения.

Шаг 1 · что за метрика?

непрерывная метрика, симметричный разброс — например, время на сайте

ABзначение метрики → (палочки — средние групп)
группа A группа B
Шаг 2 · какой критерий примените?

Сначала выберите тип метрики — увидите, как выглядят её данные у двух групп. Затем выберите критерий: виджет покажет его эталонное (нулевое) распределение, скажет, подходит ли он и почему. Критерий подбирают под метрику ДО эксперимента.

Сразу уточним важное, что часто путают. A/B-тест — это МЕТОД проведения эксперимента: честно поделить пользователей и сравнить. А статистический критерий (t-тест, z-тест и др.) — это математический ИНСТРУМЕНТ, который внутри A/B считает, значима ли разница. То есть критерий применяется внутри A/B, а не вместо него — это разные уровни, не синонимы. Справа — тренажёр выбора: позже вернёмся к нему, а сначала разберём три критерия.

Что это значит
Какое решение это меняет

Выбор критерия — это решение, каким допущениям вы доверяете: сомневаетесь в форме данных — берите непараметрический и осознанно жертвуйте мощностью.

На практике выбор критерия — часть дизайна теста. Конверсияz-тест (доли). Средний чек или время — t-тест, но осторожно: эти метрики скошены, и при выбросах сначала обрабатывают хвост (винзоризация, логарифм, удаление явных ошибок), а t применяют к среднему; Манна–Уитни оставляют для случая, когда важен сдвиг распределения, а не среднее. Подбирать критерий после взгляда на данные — способ подкрутить результат, поэтому его фиксируют заранее.

У всех критериев общий каркас: H0/H1, ошибки 1 и 2 рода, p-value и порог значимости. Меняется только формула статистики и условия применимости. Понимаете каркас — легко осваиваете новый критерий (χ², дисперсионный анализ и далее).

Где это встречается

Продуктовая аналитика почти всегда сводит выбор к двум веткам: метрика-доля (конверсия, retention-флаг) → z-тест/χ²; метрика-среднее (выручка, время) → t-тест или непараметрика при тяжёлых хвостах.

Медицина и наука выбирают критерий по тем же правилам: нормальные измерения — t-тест, порядковые шкалы и малые выборкиранговые тесты. Неверно выбранный критерий даёт неверный p — и неверное решение.

У t-теста пивная родословная: Уильям Госсет придумал его на пивоварне Guinness, чтобы сравнивать сорта ячменя на крошечных выборках. Публиковаться компания разрешила только под псевдонимом — Student. Отсюда «критерий Стьюдента».

Определения
Статистический критерий
инструмент, превращающий наблюдаемую разницу в p-value. Применяется внутри метода (например, A/B).
По-простому: готовый рецепт: какую статистику посчитать и с чем сравнить.
t-тестt=(xˉAxˉB)/SEt = (x̄_A − x̄_B) / SE
сравнение средних. Условия: нормальность или большая выборка.
По-простому: сравниваем средние двух групп с поправкой на шум.
z-тест для долейz=(p^Ap^B)/SEz = (p̂_A − p̂_B) / SE
сравнение конверсий на больших выборках. Основной критерий A/B по доле.
По-простому: тот же принцип, но для конверсий.
Манна–Уитни (U)
непараметрический тест на рангах: не требует нормальности, устойчив к выбросам. Оценивает P(A > B).
По-простому: сравниваем не значения, а порядок — выбросы не страшны.
Параметрический vs непараметрический
первый опирается на форму распределения (нормальность), второй — нет, работая с рангами.
По-простому: доверяем форме распределения — или только порядку значений.
Когда метод врёт (допущения)

t-тест: нужна приближённая нормальность или большой n; чувствителен к выбросам и тяжёлым хвостам. z-тест долей: большие выборки (достаточно успехов и неуспехов в каждой группе). Манна–Уитни: независимые наблюдения; сравнивает сдвиг распределений, а не сами средние.

Общее для всех: независимость наблюдений и заранее выбранный критерий. Подбор теста уже после взгляда на данные («а на этом критерии p меньше») раздувает ложные срабатывания.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»