Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 3 «Распределения»

Как понять, какое распределение у данных

Мы разобрали семейство распределений. Но в реальной работе никто не подписывает данные «это лог-нормальное». Распознавать форму нужно самому — от этого зависит, какими мерами и методами вообще можно пользоваться. Соберём практический чек-лист «чтения» распределения.

PDF — плотность: сама высота это не вероятность; вероятность попасть в интервал = площадь под кривой на нём. Вся площадь = 1.

значение →
▏ теория (PDF)▮ выборка (гистограмма)Среднее ≈ 0.00 · набрано значений: 0

Симметричный «колокол»: большинство значений толпится у центра, к краям всё реже. μ задаёт, где стоит центр, σ — насколько широко значения расходятся (σ растягивает колокол шире и ниже, μ двигает его по оси). Появляется там, где величина складывается из множества мелких независимых случайностей — рост людей, погрешности измерений, отклонения деталей. Нажмите «насыпать» — гистограмма реальной выборки приближается к теоретической плотности.

Шаг первый — всегда стройте гистограммубоксплот). Один взгляд отвечает на главное: один горб или несколько? Симметрично или с хвостом? Есть ли выбросы? Потренируйте глаз прямо здесь: в списке вверху виджета переключайте формы (равномерное, нормальное, экспоненциальное, лог-нормальное, степенное) и каждый раз жмите «насыпать» — жёлтая гистограмма реальной выборки ложится на теоретическую кривую, и силуэт каждой формы запоминается.

Что это значит

Рабочий рефлекс аналитика: открыл новую колонку — построил гистограмму и боксплот, и только потом считаешь что-либо. Это ловит скос, выбросы, бимодальность и подсказывает, можно ли вообще доверять среднему.

Точное имя распределения нужно редко; важнее ответить на три вопроса — симметрично ли, тяжёлый ли хвост, одна ли это группа. От ответов зависит выбор мер (среднее vs медиана) и критериев (t-тест vs непараметрика).

Где это встречается

Время ответа сервиса почти всегда с тяжёлым хвостом — поэтому инженеры сразу смотрят перцентили, а не среднее. Распознали форму → выбрали правильную метрику.

Бимодальные распределения постоянно встречаются в продукте: «время до покупки» часто двугорбое (импульсные и обдуманные покупки), и анализировать их как одно целое — ошибка.

Определения
Бимодальность
два горба в распределении — почти всегда признак смеси двух разных групп; повод разрезать данные.
По-простому: два горба — обычно две разные группы слиплись в одних данных.
Q-Q график
сравнение квантилей данных с квантилями эталона (нормального): прямая линия — форма совпадает, изгибы на концах — тяжёлые хвосты.
По-простому: легли на прямую — форма как у эталона; изогнулись на концах — хвосты.
Признак Пуассона
у счётных данных дисперсия ≈ среднему — подсказка, что это поток редких событий.
По-простому: у потока редких событий разброс примерно равен среднему.
Лог-преобразование
логарифм сжимает длинный правый хвост; если после него получается колокол — исходное было лог-нормальным.
По-простому: логарифм подрезает длинный хвост; стал колокол — было лог-нормальным.
Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»