Случайная величина, математическое ожидание и дисперсия
Мы говорили про вероятности событий. Но в данных нас обычно интересуют ЧИСЛА: сколько штук, сколько денег, как долго. Случайная величина — это и есть «число, зависящее от случая». У неё два главных описания: математическое ожидание (где её центр) и дисперсия (как широко она гуляет вокруг центра). Эти два понятия — фундамент, на котором стоит весь дальнейший вывод.
E[X] — «центр тяжести» значений с весами-вероятностями. Var[X] = E[(X−E[X])²] — средний квадрат отклонения. У суммы НЕЗАВИСИМЫХ величин и E, и Var складываются — это и даёт σ/√n у среднего и колокол в ЦПТ.
Случайная величина приписывает каждому случайному исходу число. Бросок кубика → выпавшее число; пользователь → потратил ли он рубли; запрос → сколько миллисекунд отвечал сервер. Перед Вами величина с пятью исходами; высота столбика — вероятность каждого значения. Двигайте веса — меняется распределение.
Ожидание и дисперсия — рабочий язык аналитика. «Сколько в среднем принесёт пользователь» — это E[X]. «Насколько непредсказуема выручка» — это σ. А расчёты размера выборки, доверительных интервалов и мощности — это арифметика дисперсий оценок.
Правило сложения дисперсий объясняет, почему усреднение успокаивает шум: сложили n независимых наблюдений, разделили на n — дисперсия среднего вышла в n раз меньше дисперсии одного наблюдения. Отсюда и σ/√n, которое будет преследовать нас весь курс.
Портфель акций: ожидаемая доходность — это E[X], риск — σ. Диверсификация работает именно через сложение дисперсий: некоррелированные активы гасят общий разброс.
Инженерия надёжности и очереди: ожидаемое число событий и его дисперсия (Пуассон) позволяют спланировать мощности и оценить риск перегрузки.
Определения
Подробный разбор: математика и механизм (необязательно)
Откуда берётся σ/√n — точность среднего. Сложим n независимых наблюдений: их дисперсии складываются, поэтому у суммы дисперсия равна n·σ². Среднее — это та же сумма, но делённая на n. А при делении величины на константу c её дисперсия делится на c² (разброс сжимается сильнее самого значения). Значит дисперсия среднего = n·σ² / n² = σ²/n, а стандартное отклонение среднего (его называют стандартной ошибкой) = σ/√n. Вот почему чем больше выборка, тем точнее среднее — и почему точность растёт не как n, а как √n.
Важная асимметрия двух правил. Математическое ожидание линейно ВСЕГДА: E[aX + b] = a·E[X] + b, и E[X + Y] = E[X] + E[Y] даже для зависимых величин. А вот дисперсии складываются ТОЛЬКО у независимых величин. В общем случае Var(X + Y) = Var(X) + Var(Y) + 2·Cov(X, Y), где Cov(X, Y) — ковариация, мера их совместного отклонения. Именно эту ковариацию используют методы снижения дисперсии: подобрав вспомогательную величину, тесно связанную с метрикой, из дисперсии оценки вычитают лишний разброс.