Как понять, какое распределение у данных
Мы разобрали семейство распределений. Но в реальной работе никто не подписывает данные «это лог-нормальное». Распознавать форму нужно самому — от этого зависит, какими мерами и методами вообще можно пользоваться. Соберём практический чек-лист «чтения» распределения.
PDF — плотность: сама высота это не вероятность; вероятность попасть в интервал = площадь под кривой на нём. Вся площадь = 1.
Симметричный «колокол»: большинство значений толпится у центра, к краям всё реже. μ задаёт, где стоит центр, σ — насколько широко значения расходятся (σ растягивает колокол шире и ниже, μ двигает его по оси). Появляется там, где величина складывается из множества мелких независимых случайностей — рост людей, погрешности измерений, отклонения деталей. Нажмите «насыпать» — гистограмма реальной выборки приближается к теоретической плотности.
Шаг первый — всегда стройте гистограмму (и боксплот). Один взгляд отвечает на главное: один горб или несколько? Симметрично или с хвостом? Есть ли выбросы? Потренируйте глаз прямо здесь: в списке вверху виджета переключайте формы (равномерное, нормальное, экспоненциальное, лог-нормальное, степенное) и каждый раз жмите «насыпать» — жёлтая гистограмма реальной выборки ложится на теоретическую кривую, и силуэт каждой формы запоминается.
Рабочий рефлекс аналитика: открыл новую колонку — построил гистограмму и боксплот, и только потом считаешь что-либо. Это ловит скос, выбросы, бимодальность и подсказывает, можно ли вообще доверять среднему.
Точное имя распределения нужно редко; важнее ответить на три вопроса — симметрично ли, тяжёлый ли хвост, одна ли это группа. От ответов зависит выбор мер (среднее vs медиана) и критериев (t-тест vs непараметрика).
Время ответа сервиса почти всегда с тяжёлым хвостом — поэтому инженеры сразу смотрят перцентили, а не среднее. Распознали форму → выбрали правильную метрику.
Бимодальные распределения постоянно встречаются в продукте: «время до покупки» часто двугорбое (импульсные и обдуманные покупки), и анализировать их как одно целое — ошибка.