Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 1 «Описательная статистика»

Разброс и стандартное отклонение

Сеть «Мама Джонс» выросла до двух точек. Средняя зарплата в обеих — ровно 35 тысяч: в пиццерии А все получают примерно поровну, а в пиццерии Б кто-то заметно меньше, кто-то заметно больше. Среднее одно — а коллективы совсем разные. Чтобы поймать эту разницу, нужна вторая характеристика: насколько значения разбросаны вокруг центра.

Пиццерия А (ровная)σ = 6.1 тыс ₽263033374044Пиццерия Б (контрастная)σ = 14.5 тыс ₽132333374757
Пиццерия А (ровная): среднее 35.0 тыс ₽, σ 6.1 тыс ₽Пиццерия Б (контрастная): среднее 35.0 тыс ₽, σ 14.5 тыс ₽

Две пиццерии, у обеих средняя зарплата ровно 35 тысяч — пунктир в обоих рядах стоит на одном месте. Но точки Пиццерии Б разбросаны заметно шире, чем у А. Справа от каждого ряда — его σ («сигма»), мера разброса, о которой этот урок.

Что это значит

Вернёмся к нашим двум пиццериям. Средняя зарплата у обеих одна — 35 тысяч, но σ у Пиццерии А около 6, а у Пиццерии Б около 14. Центр совпадает, а жизнь внутри совсем разная: в Пиццерии А зарплаты предсказуемы и держатся близко друг к другу, в Пиццерии Б разрыв между людьми огромен.

Отсюда главный вывод урока: центр почти никогда не смотрят в одиночку. «Среднее плюс разброс» — минимальная честная пара, которая описывает данные: где они сосредоточены и насколько широко расходятся вокруг этого центра.

Где это встречается

Разброс — повсюду, где важна не только величина, но и стабильность. Два курьера доставляют в среднем за 30 минут, но один укладывается в 25–35, а другой скачет от 10 до 60: среднее одно, надёжность разная — и σ это сразу показывает.

На том же стоит волатильность акций (это σ доходностей: чем больше, тем рискованнее) и контроль качества на производстве, где «выход за 3σ» считают браком (почему именно 3 — увидим в уроке про нормальное распределение).

Дальше мы посмотрим, какие формы вообще принимают данные. Там среднее и σ заиграют вместе: у колоколообразного, «нормального» распределения они почти полностью его и задают.

Определения
Отклонениеxixˉx_i - \bar{x}
Разница между отдельным значением и средним. Показывает, насколько это значение отстоит от центра и в какую сторону.
По-простому: насколько конкретное значение отклонилось от среднего.
Дисперсия (variance)σ2=(xixˉ)2N\sigma^2 = \dfrac{\sum (x_i - \bar{x})^2}{N}
Средний квадрат отклонений от среднего. Возведение в квадрат убирает знаки и сильнее штрафует далёкие значения. Измеряется в квадратах исходных единиц, поэтому напрямую её обычно не читают — из неё берут корень. Формула выше — для всей совокупности; для выборки (то есть почти всегда) её слегка поправляют — см. необязательный разбор ниже.
По-простому: средний квадрат отклонения от среднего.
Стандартное отклонение (σ)σ=(xixˉ)2N\sigma = \sqrt{\dfrac{\sum (x_i - \bar{x})^2}{N}}
Мера того, насколько широко значения разбросаны вокруг своего среднего. Это корень из дисперсии, поэтому выражается в тех же единицах, что и сами данные, и читается как «типичное отклонение от среднего».
По-простому: типичное расстояние от точки до среднего, в обычных единицах.
Коэффициент вариацииCV=σxˉCV = \dfrac{\sigma}{\bar{x}}
Стандартное отклонение, поделённое на среднее, — разброс в долях (или процентах) от среднего. Не зависит от единиц измерения, поэтому позволяет сравнивать изменчивость у величин разного масштаба.
По-простому: разброс в процентах от среднего — можно сравнивать разные величины.
Когда метод врёт (допущения)

Стандартное отклонение опирается на среднее, поэтому наследует его слабость: один сильный выброс раздувает σ так, что «типичный разброс» перестаёт описывать типичные данные. Для скошенных величин (доходы, время ответа) на разброс честнее смотреть по перцентилям.

Подробный разбор: математика и механизм (необязательно)

Разбираться в выводе формулы ниже не обязательно. Для практики достаточно запомнить один факт: если считаете дисперсию или σ по выборке (а это почти всегда так), в знаменателе должно быть n−1, а не n.

Формула из определения выше — для генеральной совокупности, где среднее известно заранее и не зависит от самих данных. Но на практике среднее мы каждый раз считаем по той же самой выборке, для которой ищем разброс, и это незаметно подстраивает данные под собственное среднее. Из-за этого сумма квадратов отклонений оказывается чуть меньше, чем должна быть по-честному, и формула /N систематически немного занижает разброс всей совокупности.

Чтобы убрать этот перекос, для выборочной дисперсии в знаменатель ставят n−1 вместо n. Одно из объяснений: как только вы зафиксировали среднее по n значениям, свободно варьироваться могут только n−1 из них — последнее уже жёстко определено, его всегда можно досчитать, зная остальные и само среднее. Отсюда и название — степени свободы.

Именно поэтому одни и те же числа в разных инструментах иногда дают разное σ. Excel и pandas по умолчанию считают по n−1 (расчёт для выборки), а numpy по умолчанию делит на n, и нужно отдельно попросить n−1. Это не баг и не разночтение, а два разных вопроса: какой разброс в этих самых данных (n) или что эти данные говорят о разбросе во всей совокупности (n−1). В аналитике почти всегда нужен второй ответ.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»