Статистические критерии: какой тест выбрать
Проверка гипотез — это общая идея. Но чтобы превратить «разницу в данных» в число «насколько это случайно» (p-value), нужен конкретный инструмент — статистический критерий. Их несколько, и выбор зависит от того, что за метрика и какие у неё данные. Разберём три рабочих критерия аналитика и условия их применения.
непрерывная метрика, симметричный разброс — например, время на сайте
Сначала выберите тип метрики — увидите, как выглядят её данные у двух групп. Затем выберите критерий: виджет покажет его эталонное (нулевое) распределение, скажет, подходит ли он и почему. Критерий подбирают под метрику ДО эксперимента.
Сразу уточним важное, что часто путают. A/B-тест — это МЕТОД проведения эксперимента: честно поделить пользователей и сравнить. А статистический критерий (t-тест, z-тест и др.) — это математический ИНСТРУМЕНТ, который внутри A/B считает, значима ли разница. То есть критерий применяется внутри A/B, а не вместо него — это разные уровни, не синонимы. Справа — тренажёр выбора: позже вернёмся к нему, а сначала разберём три критерия.
Выбор критерия — это решение, каким допущениям вы доверяете: сомневаетесь в форме данных — берите непараметрический и осознанно жертвуйте мощностью.
На практике выбор критерия — часть дизайна теста. Конверсия → z-тест (доли). Средний чек или время — t-тест, но осторожно: эти метрики скошены, и при выбросах сначала обрабатывают хвост (винзоризация, логарифм, удаление явных ошибок), а t применяют к среднему; Манна–Уитни оставляют для случая, когда важен сдвиг распределения, а не среднее. Подбирать критерий после взгляда на данные — способ подкрутить результат, поэтому его фиксируют заранее.
У всех критериев общий каркас: H0/H1, ошибки 1 и 2 рода, p-value и порог значимости. Меняется только формула статистики и условия применимости. Понимаете каркас — легко осваиваете новый критерий (χ², дисперсионный анализ и далее).
Продуктовая аналитика почти всегда сводит выбор к двум веткам: метрика-доля (конверсия, retention-флаг) → z-тест/χ²; метрика-среднее (выручка, время) → t-тест или непараметрика при тяжёлых хвостах.
Медицина и наука выбирают критерий по тем же правилам: нормальные измерения — t-тест, порядковые шкалы и малые выборки — ранговые тесты. Неверно выбранный критерий даёт неверный p — и неверное решение.
У t-теста пивная родословная: Уильям Госсет придумал его на пивоварне Guinness, чтобы сравнивать сорта ячменя на крошечных выборках. Публиковаться компания разрешила только под псевдонимом — Student. Отсюда «критерий Стьюдента».
Определения
t-тест: нужна приближённая нормальность или большой n; чувствителен к выбросам и тяжёлым хвостам. z-тест долей: большие выборки (достаточно успехов и неуспехов в каждой группе). Манна–Уитни: независимые наблюдения; сравнивает сдвиг распределений, а не сами средние.
Общее для всех: независимость наблюдений и заранее выбранный критерий. Подбор теста уже после взгляда на данные («а на этом критерии p меньше») раздувает ложные срабатывания.