Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 2 «Вероятность»

Случайная величина, математическое ожидание и дисперсия

Мы говорили про вероятности событий. Но в данных нас обычно интересуют ЧИСЛА: сколько штук, сколько денег, как долго. Случайная величина — это и есть «число, зависящее от случая». У неё два главных описания: математическое ожидание (где её центр) и дисперсия (как широко она гуляет вокруг центра). Эти два понятия — фундамент, на котором стоит весь дальнейший вывод.

12345E[X] = 3.00
E[X] = 3.00 (точка баланса)Var[X] = 1.20σ = 1.10
Вероятности исходов (двигайте веса):

E[X] — «центр тяжести» значений с весами-вероятностями. Var[X] = E[(X−E[X])²] — средний квадрат отклонения. У суммы НЕЗАВИСИМЫХ величин и E, и Var складываются — это и даёт σ/√n у среднего и колокол в ЦПТ.

Случайная величина приписывает каждому случайному исходу число. Бросок кубика → выпавшее число; пользователь → потратил ли он рубли; запрос → сколько миллисекунд отвечал сервер. Перед Вами величина с пятью исходами; высота столбика — вероятность каждого значения. Двигайте веса — меняется распределение.

Зачем это аналитику

Ожидание и дисперсия — рабочий язык аналитика. «Сколько в среднем принесёт пользователь» — это E[X]. «Насколько непредсказуема выручка» — это σ. А расчёты размера выборки, доверительных интервалов и мощности — это арифметика дисперсий оценок.

Правило сложения дисперсий объясняет, почему усреднение успокаивает шум: сложили n независимых наблюдений, разделили на n — дисперсия среднего вышла в n раз меньше дисперсии одного наблюдения. Отсюда и σ/√n, которое будет преследовать нас весь курс.

Где это встречается

Портфель акций: ожидаемая доходность — это E[X], риск — σ. Диверсификация работает именно через сложение дисперсий: некоррелированные активы гасят общий разброс.

Инженерия надёжности и очереди: ожидаемое число событий и его дисперсия (Пуассон) позволяют спланировать мощности и оценить риск перегрузки.

Определения
Случайная величина
число, которое принимает то или иное значение в зависимости от случайного исхода.
По-простому: число, которое выдаёт случай: бросок, заказ, время ожидания.
Математическое ожидание E[X]E[X]=xipiE[X] = \sum x_i\, p_i
среднее значение величины на длинной серии повторений: каждое значение xᵢ умножаем на его вероятность pᵢ и складываем. Это центр распределения.
По-простому: среднее по-честному: каждое значение с весом своего шанса.
Дисперсия Var[X]Var(X)=E[(XE[X])2]\mathrm{Var}(X) = E\big[(X - E[X])^2\big]
средний квадрат отклонения от ожидания; σ = √Var — разброс в исходных единицах.
По-простому: насколько широко значения гуляют вокруг ожидания.
Сложение дисперсийVar(X+Y)=Var(X)+Var(Y)\mathrm{Var}(X+Y) = \mathrm{Var}(X) + \mathrm{Var}(Y)
у суммы независимых величин дисперсии складываются. Фундамент σ/√n, ЦПТ и ANOVA.
По-простому: складываешь независимые величины — складываются и их разбросы.
Независимость
исход одной величины не влияет на распределение другой. Без неё сложение дисперсий не работает.
По-простому: одна величина ничего не говорит про другую.
Подробный разбор: математика и механизм (необязательно)

Откуда берётся σ/√n — точность среднего. Сложим n независимых наблюдений: их дисперсии складываются, поэтому у суммы дисперсия равна n·σ². Среднее — это та же сумма, но делённая на n. А при делении величины на константу c её дисперсия делится на c² (разброс сжимается сильнее самого значения). Значит дисперсия среднего = n·σ² / n² = σ²/n, а стандартное отклонение среднего (его называют стандартной ошибкой) = σ/√n. Вот почему чем больше выборка, тем точнее среднее — и почему точность растёт не как n, а как √n.

Важная асимметрия двух правил. Математическое ожидание линейно ВСЕГДА: E[aX + b] = a·E[X] + b, и E[X + Y] = E[X] + E[Y] даже для зависимых величин. А вот дисперсии складываются ТОЛЬКО у независимых величин. В общем случае Var(X + Y) = Var(X) + Var(Y) + 2·Cov(X, Y), где Cov(X, Y) — ковариация, мера их совместного отклонения. Именно эту ковариацию используют методы снижения дисперсии: подобрав вспомогательную величину, тесно связанную с метрикой, из дисперсии оценки вычитают лишний разброс.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»