Интерактивная статистика
Модуль 3 «Распределения»
Прогресспройдено 0 / 63

Как понять, какое распределение у данных

Мы разобрали семейство распределений. Но в реальной работе никто не подписывает данные «это лог-нормальное». Распознавать форму нужно самому — от этого зависит, какими мерами и методами вообще можно пользоваться. Соберём практический чек-лист «чтения» распределения.

PDF — плотность: сама высота это не вероятность; вероятность попасть в интервал = площадь под кривой на нём. Вся площадь = 1.

значение →
▏ теория (PDF)▮ выборка (гистограмма)Среднее ≈ 0.00 · набрано значений: 0

Симметричный «колокол»: большинство значений толпится у центра, к краям всё реже. μ задаёт, где стоит центр, σ — насколько широко значения расходятся (σ растягивает колокол шире и ниже, μ двигает его по оси). Появляется там, где величина складывается из множества мелких независимых случайностей — рост людей, погрешности измерений, отклонения деталей. Нажмите «насыпать» — гистограмма реальной выборки приближается к теоретической плотности.

Шаг первый — всегда стройте гистограммубоксплот). Один взгляд отвечает на главное: один горб или несколько? Симметрично или с хвостом? Есть ли выбросы? Потренируйте глаз прямо здесь: в списке вверху виджета переключайте формы (равномерное, нормальное, экспоненциальное, лог-нормальное, степенное) и каждый раз жмите «насыпать» — жёлтая гистограмма реальной выборки ложится на теоретическую кривую, и силуэт каждой формы запоминается.

Что это значит

Рабочий рефлекс аналитика: открыли новую колонку — построили гистограмму и боксплот и только потом считаете что-либо. Это ловит асимметрию, выбросы, бимодальность и подсказывает, можно ли вообще доверять среднему.

Точное имя распределения нужно редко; важнее ответить на три вопроса — симметрично ли, тяжёлый ли хвост, одна ли это группа. От ответов зависит выбор мер (среднее vs медиана) и критериев (t-тест vs непараметрика).

Где это встречается

Время ответа сервиса почти всегда с тяжёлым хвостом — поэтому инженеры сразу смотрят перцентили, а не среднее. Распознали форму → выбрали правильную метрику.

Бимодальные распределения постоянно встречаются в продукте: «время до покупки» часто двугорбое (импульсные и обдуманные покупки), и анализировать их как одно целое — ошибка.

Определения

Бимодальность
два горба в распределении — почти всегда признак смеси двух разных групп; повод разрезать данные.
По-простому: два горба — обычно две разные группы слиплись в одних данных.
Q-Q график
сравнение квантилей данных с квантилями эталона (нормального): прямая линия — форма совпадает, изгибы на концах — тяжёлые хвосты.
По-простому: легли на прямую — форма как у эталона; изогнулись на концах — хвосты.
Признак Пуассона
у счётных данных дисперсия ≈ среднему — подсказка, что это поток редких событий.
По-простому: у потока редких событий разброс примерно равен среднему.
Лог-преобразование
логарифм сжимает длинный правый хвост; если после него получается колокол — исходное было лог-нормальным.
По-простому: логарифм подрезает длинный хвост; стал колокол — было лог-нормальным.
Дальше →
Такие разборы — в канале

Пишу про аналитику простыми словами: как считать метрики, не наврать в A/B, что спрашивают на собесах и как я собираю этот сайт. Без воды.

Подписаться на канал