Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 5 «Проверка гипотез»

Доверительный интервал против p-value

p-value отвечает «случайна ли разница?», а доверительный интервал — «насколько она велика и насколько мы уверены?». Это две стороны одной монеты: оценивание и проверка. Понять их связь — значит перестать молиться на «p < 0.05» и начать читать результат как взрослый аналитик.

ноль (нет эффекта)2.0 п.п.
95% ДИ: [-0.5; 4.5]накрывает ноль → p ≥ 0.05 (не значимо)p ≈ 0.114

Интервал не накрыл ноль ⟺ тест значим (p<0.05) — это одно и то же утверждение. Но интервал говорит больше: при огромном n даже крошечный эффект «значим», зато интервал покажет, что он мал; при малом n интервал широкий — «данных мало», а не «эффекта нет».

Между ними есть точная связь. На графике — оценка эффекта с её доверительным интервалом относительно нуля. Двигайте эффект и размер выборки: ровно в тот момент, когда интервал перестаёт накрывать ноль, p опускается ниже 0.05. «p < 0.05» и «интервал не содержит ноль» — одно и то же утверждение, сказанное по-разному.

Что это значит
Какое решение это меняет

Если от результата зависит «сколько вложить», решайте по интервалу, а не по «значимо/незначимо»: интервал показывает и лучший, и худший правдоподобный исход.

Привычка докладывать результат интервалом, а не только p, сразу повышает качество решений: видно и направление, и величину, и уверенность. «Прирост 1.8% (ДИ 0.3–3.3%)» — основание для решения; «p = 0.04» — нет.

Это снимает культ порога 0.05: вместо «значимо/не значимо» команда обсуждает, какой эффект правдоподобен и стоит ли он внедрения. Особенно важно на больших выборках, где значимым становится почти всё.

Где это встречается

Медицина давно перешла на доверительные интервалы для размеров эффекта: «снижение риска на 20% (95% ДИ: 5–33%)» информативнее, чем «p < 0.05».

В продукте интервал вокруг эффекта A/B напрямую кормит решение о раскатке: если даже нижняя граница интервала окупает затраты — катим; если интервал широкий и задевает ноль — собираем больше данных.

Определения
Оценивание vs проверка
оценивание отвечает «сколько и насколько точно» (интервал), проверка — «случайно ли» (p-value). Связаны через одно выборочное распределение.
По-простому: интервал отвечает «сколько», тест — «не случайно ли».
Связь CI и теста
95%-интервал не накрывает ноль ⟺ двусторонний тест значим на 5%.
По-простому: 95%-интервал не задел ноль — значит, тест на 5% значим.
Значимо ≠ важно
статзначимый эффект может быть ничтожным по величине; смотрят на интервал/размер эффекта.
По-простому: большая выборка делает «значимым» даже мизерный эффект.
Не значимо ≠ нет эффекта
широкий интервал вокруг нуля означает нехватку данных, а не доказанное отсутствие эффекта.
По-простому: может, эффект и есть — просто не хватило сил его разглядеть.
Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»