Непрерывные распределения: равномерное, экспоненциальное, степенное
Колокол — не единственная форма непрерывных данных. Время ожидания, деньги, размеры файлов, длительности сессий устроены иначе. Разберём ещё три важные формы и поймём, по каким признакам узнавать каждую в реальных данных. «Насыпайте» выборку — гистограмма ложится на плотность.
PDF — плотность: сама высота это не вероятность; вероятность попасть в интервал = площадь под кривой на нём. Вся площадь = 1.
Все значения в диапазоне [a, b] равновероятны — плотность это ровная «полка», у неё нет выделенного центра. Параметры a и b задают границы. Модель полного незнания: случайный момент прихода в течение часа, генератор случайных чисел, «где-то между a и b, и всё». Нажмите «насыпать» — гистограмма реальной выборки приближается к теоретической плотности.
В списке вверху можно выбрать любую из непрерывных форм. Начнём с равномерного распределения (выбрано по умолчанию): все значения в диапазоне равновероятны, плотность — ровная «полка». Это модель полного незнания: случайный момент прихода в течение часа, генератор случайных чисел, «где-то между a и b, и всё». Двигайте границы a и b.
Распознавание формы — первый практический навык. Увидели длинный правый хвост в выручке или времени ответа? Среднее обманет — берите медиану и перцентили (p95, p99). Это прямое продолжение урока про скос.
Экспоненциальное и Пуассон — основа моделей очередей и нагрузки: зная интенсивность потока, можно оценить и среднее ожидание, и вероятность перегрузки. А равномерное — основа симуляций и A/A-проверок, где нужна «честная» случайность.
Время до отказа оборудования, между запросами к серверу, между приходами клиентов — классические экспоненциальные величины, на которых строят SLA и планируют мощности.
Степенные законы повсюду в «социальных» данных: размеры городов, доходы, популярность товаров, число подписчиков. Везде горстка гигантов и длинный хвост мелочи — и везде среднее вводит в заблуждение.