Разброс и стандартное отклонение
Сеть «Мама Джонс» выросла до двух точек. Средняя зарплата в обеих — ровно 35 тысяч: в пиццерии А все получают примерно поровну, а в пиццерии Б кто-то заметно меньше, кто-то заметно больше. Среднее одно — а коллективы совсем разные. Чтобы поймать эту разницу, нужна вторая характеристика: насколько значения разбросаны вокруг центра.
Две пиццерии, у обеих средняя зарплата ровно 35 тысяч — пунктир в обоих рядах стоит на одном месте. Но точки Пиццерии Б разбросаны заметно шире, чем у А. Справа от каждого ряда — его σ («сигма»), мера разброса, о которой этот урок.
Вернёмся к нашим двум пиццериям. Средняя зарплата у обеих одна — 35 тысяч, но σ у Пиццерии А около 6, а у Пиццерии Б около 14. Центр совпадает, а жизнь внутри совсем разная: в Пиццерии А зарплаты предсказуемы и держатся близко друг к другу, в Пиццерии Б разрыв между людьми огромен.
Отсюда главный вывод урока: центр почти никогда не смотрят в одиночку. «Среднее плюс разброс» — минимальная честная пара, которая описывает данные: где они сосредоточены и насколько широко расходятся вокруг этого центра.
Разброс — повсюду, где важна не только величина, но и стабильность. Два курьера доставляют в среднем за 30 минут, но один укладывается в 25–35, а другой скачет от 10 до 60: среднее одно, надёжность разная — и σ это сразу показывает.
На том же стоит волатильность акций (это σ доходностей: чем больше, тем рискованнее) и контроль качества на производстве, где «выход за 3σ» считают браком (почему именно 3 — увидим в уроке про нормальное распределение).
Дальше мы посмотрим, какие формы вообще принимают данные. Там среднее и σ заиграют вместе: у колоколообразного, «нормального» распределения они почти полностью его и задают.
Определения
Стандартное отклонение опирается на среднее, поэтому наследует его слабость: один сильный выброс раздувает σ так, что «типичный разброс» перестаёт описывать типичные данные. Для скошенных величин (доходы, время ответа) на разброс честнее смотреть по перцентилям.
Подробный разбор: математика и механизм (необязательно)
Разбираться в выводе формулы ниже не обязательно. Для практики достаточно запомнить один факт: если считаете дисперсию или σ по выборке (а это почти всегда так), в знаменателе должно быть n−1, а не n.
Формула из определения выше — для генеральной совокупности, где среднее известно заранее и не зависит от самих данных. Но на практике среднее мы каждый раз считаем по той же самой выборке, для которой ищем разброс, и это незаметно подстраивает данные под собственное среднее. Из-за этого сумма квадратов отклонений оказывается чуть меньше, чем должна быть по-честному, и формула /N систематически немного занижает разброс всей совокупности.
Чтобы убрать этот перекос, для выборочной дисперсии в знаменатель ставят n−1 вместо n. Одно из объяснений: как только вы зафиксировали среднее по n значениям, свободно варьироваться могут только n−1 из них — последнее уже жёстко определено, его всегда можно досчитать, зная остальные и само среднее. Отсюда и название — степени свободы.
Именно поэтому одни и те же числа в разных инструментах иногда дают разное σ. Excel и pandas по умолчанию считают по n−1 (расчёт для выборки), а numpy по умолчанию делит на n, и нужно отдельно попросить n−1. Это не баг и не разночтение, а два разных вопроса: какой разброс в этих самых данных (n) или что эти данные говорят о разбросе во всей совокупности (n−1). В аналитике почти всегда нужен второй ответ.