Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 5 «Проверка гипотез»

Проверка гипотез: p-value и две ошибки

Вы провели эксперимент и увидели разницу. Но реальна ли она — или это просто случайность выборки? Проверка гипотез отвечает на этот вопрос. И у любого ответа есть два типа ошибок.

H0: эффекта нетH1: истинный эффект = +60 ₽критич. значениеαβ
критич. значение = 55 ₽ (расчётное)α (ложное срабатывание): 5%β (пропуск): 43.8%Мощность (1−β): 56.2%

Оба колокола — выборочные распределения оценки (разницы средних), они неподвижны: серый H0 всегда центрирован на 0, синий H1 — на истинном эффекте (+60 ₽). Двигается только порог: критическое значение зависит лишь от H0 и α (crit = z·SE, SE = σ/√n), а не от эффекта. Меняя α, вы двигаете порог и видите баланс двух ошибок: жёлтая площадь — α (ошибка 1 рода), красная — β (пропуск эффекта). n и σ меняют только ширину колоколов. Сколько нужно наблюдений под нужный эффект — в следующем уроке про размер выборки.

Вид теста:

Метрика — средний чек, 1000 ₽; истинный эффект фиксирован (+60 ₽), колокола не двигаются. α задаёт критическое значение (выше α — порог ближе к нулю, α растёт, а β падает — вот он, баланс двух ошибок). Мощность (1−β) поднимают НЕ порогом, а размером выборки n или меньшим σ — они сужают колокола, не сдвигая их центры; кнопка подбирает n под мощность 80%. Двусторонний тест ловит отклонение в любую сторону, поэтому при той же α его порог дальше от нуля.

Две кривые — два возможных мира, и каждая из них — то самое выборочное распределение из урока про оценку, только для РАЗНИЦЫ средних. Серая (H0) стоит на нуле — эффекта нет. Синяя (H1) — на истинном эффекте (для наглядности он зафиксирован). Оба колокола НЕПОДВИЖНЫ. Двигается только граница решения — критическое значение: оно зависит лишь от H0 и α, но НЕ от эффекта. Поэтому меняя α, вы двигаете порог и видите, как перетекают друг в друга две ошибки: жёлтая площадь — α (ошибка 1 рода), красная — β (пропуск эффекта). Ползунки n и σ меняют только ширину колоколов, не сдвигая их центры. Покрутите α, чтобы прочувствовать баланс. Если формула crit = z·SE пока не улеглась — не страшно, это самое плотное место урока: саму формулу всегда посчитает софт, а вот компромисс между двумя ошибками стоит унести навсегда. (Как из эффекта считают нужный размер выборки — в следующем уроке; p-value и «наш результат» — на отдельном графике дальше.)

Что это значит
Какое решение это меняет

До теста зафиксируйте действие по умолчанию («не катим») и порог α. Тест меняет решение только в одну сторону: p-value ниже порога — катим. Во всех остальных случаях остаёмся при дефолте — это не «доказали, что эффекта нет».

Представьте испытание лекарства. H0 — «не помогает», H1 — «помогает». Ложное срабатывание: одобрить пустышку. Пропуск: забраковать рабочее лекарство. Цена ошибок разная, поэтому порог (уровень значимости) выбирают осознанно, а не «по привычке 5%».

И помните урок про закон больших чисел: на крошечной выборке любая «разница» может быть шумом. Достаточный размер выборки — часть честной проверки.

Где это встречается

Те же две ошибки повсюду: медицинский тест (здорового объявить больным или больного — здоровым), спам-фильтр (нужное письмо в спам или спам в инбоксе), суд (осудить невиновного или отпустить виновного).

Везде нельзя обнулить обе ошибки разом — можно лишь выбрать баланс под цену каждой.

Самый знаменитый порог в истории — «пять сигм» физики частиц: ЦЕРН объявил об открытии бозона Хиггса, только когда шанс получить такой сигнал случайно упал примерно до одного на 3.5 миллиона (p ≈ 3·10⁻⁷). Логика та же, что в Вашем A/B, — просто цена ложного открытия другая.

Определения
Нулевая гипотеза (H0)
предположение «эффекта нет, разница случайна». Её пытаются опровергнуть.
По-простому: мир, где эффекта нет, а разницу нарисовал случай.
Критическое значение (критический порог)
граница на оси статистики: если наблюдаемый результат заходит за неё, H0 отвергают. Задаётся выбранным уровнем значимости α. Это НЕ минимальный эффект (MDE) — то отдельное понятие про центр H1.
По-простому: планка удивления: выше неё случайности уже не верим.
Ошибка 1 рода (α)
ложное срабатывание: объявить эффект, которого нет. Уровень значимости — это допустимая α (часто 5%).
По-простому: поверили в эффект-призрак.
Ошибка 2 рода (β) и мощность
β — пропустить реальный эффект; мощность = 1−β — вероятность его поймать.
По-простому: проспали настоящий эффект; мощность — шанс не проспать.
p-value
вероятность получить такой (или более сильный) результат, если эффекта на самом деле нет. Маленький p — случайностью объяснить трудно.
По-простому: мера удивления: насколько странны такие данные, если эффекта нет.
Когда метод врёт (допущения)

p-value честен при одном заранее заданном вопросе. Много метрик, сегментов или остановка теста «когда стало значимо» превращают 5% ложных срабатываний в десятки процентов — об этом уроки про множественные сравнения и подглядывание.

Маленький p не означает большой или важный эффект: на огромной выборке значимым станет и +0.01%. Смотрите на размер эффекта и доверительный интервал, а не только на порог 0.05.

Подробный разбор: математика и механизм (необязательно)

Важная эпистемическая тонкость. На графике бирюзовая кривая H1 нарисована как известная — но в реальности истинный эффект нам НЕизвестен (иначе зачем тест). Мы фиксируем её положение как гипотезу — тот размер эффекта, который хотим уметь замечать (в планировании его называют MDE); под него и считают мощность и размер выборки в следующем уроке. Мы всегда живём только в одном мире (эффект либо есть, либо нет) и никогда не знаем, в каком, — мы лишь ограничиваем шансы ошибиться в каждую сторону.

Почему нельзя «доказать H1 напрямую». Мы не можем перечислить все способы, которыми эффект мог бы существовать, но можем точно посчитать, как ведёт себя мир БЕЗ эффекта (H0). Поэтому логика всегда от противного: показать, что наблюдаемое слишком невероятно для мира H0. Это асимметрия — как в суде: отвергаем презумпцию «невиновен» при сильных уликах, но «не отвергли» не значит «доказали невиновность».

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»