Доверительный интервал против p-value
p-value отвечает «случайна ли разница?», а доверительный интервал — «насколько она велика и насколько мы уверены?». Это две стороны одной монеты: оценивание и проверка. Понять их связь — значит перестать молиться на «p < 0.05» и начать читать результат как взрослый аналитик.
Интервал не накрыл ноль ⟺ тест значим (p<0.05) — это одно и то же утверждение. Но интервал говорит больше: при огромном n даже крошечный эффект «значим», зато интервал покажет, что он мал; при малом n интервал широкий — «данных мало», а не «эффекта нет».
Между ними есть точная связь. На графике — оценка эффекта с её доверительным интервалом относительно нуля. Двигайте эффект и размер выборки: ровно в тот момент, когда интервал перестаёт накрывать ноль, p опускается ниже 0.05. «p < 0.05» и «интервал не содержит ноль» — одно и то же утверждение, сказанное по-разному.
Если от результата зависит «сколько вложить», решайте по интервалу, а не по «значимо/незначимо»: интервал показывает и лучший, и худший правдоподобный исход.
Привычка докладывать результат интервалом, а не только p, сразу повышает качество решений: видно и направление, и величину, и уверенность. «Прирост 1.8% (ДИ 0.3–3.3%)» — основание для решения; «p = 0.04» — нет.
Это снимает культ порога 0.05: вместо «значимо/не значимо» команда обсуждает, какой эффект правдоподобен и стоит ли он внедрения. Особенно важно на больших выборках, где значимым становится почти всё.
Медицина давно перешла на доверительные интервалы для размеров эффекта: «снижение риска на 20% (95% ДИ: 5–33%)» информативнее, чем «p < 0.05».
В продукте интервал вокруг эффекта A/B напрямую кормит решение о раскатке: если даже нижняя граница интервала окупает затраты — катим; если интервал широкий и задевает ноль — собираем больше данных.