Капстоун: разбор реального датасета от и до
Пора собрать всё вместе. Перед Вами один датасет — 2400 пользователей с выручкой, устройством, группой A/B и фактом покупки. Пройдём по нему весь путь аналитика: от первого взгляда до честного решения. Виджет — пошаговый: нажимайте этапы 1–6 и следите, как каждый инструмент курса включается в работу.
2400 пользователей, выручка на пользователя. Распределение скошено вправо: среднее (19) заметно выше медианы (11). Вывод: типичного пользователя честнее описывать медианой, а не средним.
Шаг 1–2 в виджете — знакомство с данными. Первое, что делает аналитик: смотрит распределение, а не считает среднее вслепую. Выручка скошена, среднее выше медианы → описываем медианой. Выбросы реальны (крупные покупки) → не удаляем, но среднее используем осторожно. Это модули «Описательная» и «Распределения» в действии.
Главный навык аналитика — не знать формулы, а вести данные по всему циклу: посмотреть форму, очистить, разрезать по сегментам, выбрать уместный метод, проверить допущения и сформулировать честный вывод. Любой отдельный метод бесполезен в отрыве от этой цепочки.
Возьмите свои данные (расходы, статистику игры, рабочий датасет) и пройдите этот же маршрут: распределение → выбросы → сегменты → связь/сравнение → вывод. Понимание закрепляется, когда ползунки и шаги — на ваших собственных вопросах к реальным числам.
Так устроена ежедневная работа продуктового и data-аналитика: 80% времени — осмотр, очистка и разведка данных, и только потом метод. Пропуск EDA — самая частая причина неверных выводов.
И так же устроены сильные разборы в реальной работе: не «я знаю t-тест», а «вот как я провёл данные от вопроса до решения, что проверил и где честно оговорил неопределённость».