Дискретные распределения: Бернулли, биномиальное, Пуассон
Нормальное распределение описывает измеряемые величины — рост, вес, время. Но огромная часть данных аналитика — это СЧЁТ: кликнул или нет, сколько покупок, сколько ошибок за час. Для счётных величин есть свои распределения. Разберём три главных — и где каждое встречается. Нажимайте «насыпать»: гистограмма реальной выборки ложится на теоретическую PMF.
PMF — функция вероятности: высота столбика = вероятность получить ровно это значение. Сумма всех столбиков = 1.
Один опыт с двумя исходами «успех/неудача»: купил/не купил, орёл/решка, кликнул/нет. Единственный параметр p — вероятность успеха (высоты столбиков p и 1−p). Это кирпич, из которого складываются биномиальное распределение и доли-конверсии в A/B. Нажмите «насыпать» — гистограмма реальной выборки приближается к теоретической PMF.
В списке вверху виджета можно выбрать любое из трёх дискретных распределений. Начнём с самого простого опыта «да/нет»: кликнул / не кликнул, купил / не купил, орёл / решка. Это распределение Бернулли (выбрано по умолчанию): всего два столбика, их высоты — p и 1−p. Двигайте p — вес перетекает между «да» и «нет». Это кирпич, из которого собрано почти всё остальное.
Для аналитика это не абстракция, а ежедневный инструмент. Конверсия (купил/не купил) — Бернулли на одного пользователя и биномиальное на группу; именно поэтому доверительные интервалы для конверсии в A/B считают по биномиальной модели.
Пуассон описывает нагрузку и потоки: сколько запросов придёт в секунду, сколько обращений в поддержку за день, сколько дефектов в партии. Зная λ, можно прикинуть вероятность перегрузки и спланировать мощности.
Страховые и кол-центры планируют ресурсы по Пуассону: среднее число событий известно, а распределение даёт вероятность «пиковых» дней.
Контроль качества считает число брака на партию (Пуассон/биномиальное) и решает, бить ли тревогу. А любая метрика вида «доля» в основе — биномиальная.