Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 3 «Распределения»

Непрерывные распределения: равномерное, экспоненциальное, степенное

Колокол — не единственная форма непрерывных данных. Время ожидания, деньги, размеры файлов, длительности сессий устроены иначе. Разберём ещё три важные формы и поймём, по каким признакам узнавать каждую в реальных данных. «Насыпайте» выборкугистограмма ложится на плотность.

PDF — плотность: сама высота это не вероятность; вероятность попасть в интервал = площадь под кривой на нём. Вся площадь = 1.

значение →
▏ теория (PDF)▮ выборка (гистограмма)Среднее ≈ 0.00 · набрано значений: 0

Все значения в диапазоне [a, b] равновероятны — плотность это ровная «полка», у неё нет выделенного центра. Параметры a и b задают границы. Модель полного незнания: случайный момент прихода в течение часа, генератор случайных чисел, «где-то между a и b, и всё». Нажмите «насыпать» — гистограмма реальной выборки приближается к теоретической плотности.

В списке вверху можно выбрать любую из непрерывных форм. Начнём с равномерного распределения (выбрано по умолчанию): все значения в диапазоне равновероятны, плотность — ровная «полка». Это модель полного незнания: случайный момент прихода в течение часа, генератор случайных чисел, «где-то между a и b, и всё». Двигайте границы a и b.

Что это значит

Распознавание формы — первый практический навык. Увидели длинный правый хвост в выручке или времени ответа? Среднее обманет — берите медиану и перцентили (p95, p99). Это прямое продолжение урока про скос.

Экспоненциальное и Пуассон — основа моделей очередей и нагрузки: зная интенсивность потока, можно оценить и среднее ожидание, и вероятность перегрузки. А равномерное — основа симуляций и A/A-проверок, где нужна «честная» случайность.

Где это встречается

Время до отказа оборудования, между запросами к серверу, между приходами клиентов — классические экспоненциальные величины, на которых строят SLA и планируют мощности.

Степенные законы повсюду в «социальных» данных: размеры городов, доходы, популярность товаров, число подписчиков. Везде горстка гигантов и длинный хвост мелочи — и везде среднее вводит в заблуждение.

Определения
Равномерноеf(x)=1/(b−a)
все значения в [a, b] равновероятны. Модель «полного незнания».
По-простому: любое значение из отрезка одинаково вероятно — как честная рулетка.
Экспоненциальноеf(x)=λe⁻λx
время между редкими событиями. Свойство «без памяти». Пара к Пуассону.
По-простому: сколько ждать до следующего редкого события.
Степенное (Парето)f(x)∝ x⁻(α+1)
тяжёлый хвост, правило 80/20. Среднее неустойчиво, опираются на медиану.
По-простому: немного гигантов и длинный хвост мелочи — то самое 80/20.
Тяжёлый хвост
редкие, но огромные значения вносят непропорционально большой вклад — ломают среднее и «правило ±2σ».
По-простому: редкие огромные значения, которые перекашивают среднее.
PDF (плотность)
для непрерывных величин: высота кривой — не вероятность; вероятность интервала = площадь под кривой на нём. Вся площадь = 1.
По-простому: вероятность — площадь под кривой на участке, а не высота.
CDF
функция распределения (накопленная вероятность): значение в точке x = вероятность получить результат ≤ x. Растёт от 0 до 1.
По-простому: сколько данных накопилось левее точки — от 0 до 100%.
Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»