Форма данных: гистограмма
Точки на прямой удобны, пока чисел немного. Но сеть «Мама Джонс» разрослась, сотрудников уже полсотни — по отдельным точкам ничего не разглядеть. Нужно увидеть форму целиком: где зарплат много, где мало, тянется ли куда-то хвост. Для этого данные раскладывают по «корзинам» — диапазонам — и считают, сколько человек попало в каждую. Получается гистограмма.
Высота столбика — сколько человек получает зарплату из этого диапазона. Сразу видно главное: есть «горб», где людей больше всего (около 33–37 тысяч), и редкие края. Это и есть форма данных — одним взглядом.
Форма — это первый диагноз данных. По гистограмме зарплат «Мама Джонс» сразу виден и типичный уровень (горб около 33–37 тысяч), и перекос, когда справа появляется одинокий столбик директора.
Поэтому прежде чем считать средние и строить модели, аналитик всегда смотрит на форму: она подсказывает, симметричны ли данные, есть ли длинный хвост и одинокие значения, способные исказить выводы.
Гистограммы вокруг нас: распределение оценок в классе, времени загрузки приложения, возрастов аудитории, чеков в магазине. По форме сразу видно, «ровные» данные или с длинным хвостом.
Форма подсказывает и метод: у симметричного «колокола» хорошо работают среднее и σ, а у скошенных данных с хвостом честнее медиана и перцентили.
Мы то и дело упоминаем «горб» и «длинный хвост». Но описывать данные удобно не только формой, но и краями — какая доля значений лежит ниже заданного порога. Этим и займёмся в следующем уроке.