Глоссарий
Термины статистики и бизнес-метрики — в одном месте.
Статистика
- Среднее→ разобрано в уроке
- Сумма всех значений, делённая на их количество. Показывает «центр тяжести» данных: если бы все наблюдения были одинаковыми, каждое равнялось бы среднему.
- Медиана→ разобрано в уроке
- Значение, которое делит упорядоченный ряд пополам: половина наблюдений меньше него, половина больше. При чётном числе значений берут полусумму двух центральных.
- Мода→ разобрано в уроке
- Значение, встречающееся в данных чаще всего. Единственная мера центра, применимая к категориям: самый популярный товар, самый частый способ оплаты.
- Дисперсия→ разобрано в уроке
- Средний квадрат отклонения значений от их среднего: чем сильнее данные разбросаны, тем она больше. Измеряется в квадратах исходных единиц — рубли², минуты².
- Стандартное отклонение (σ)→ разобрано в уроке
- Корень из дисперсии: типичное расстояние от среднего до отдельного наблюдения, в тех же единицах, что и данные. Для нормального распределения около 68% значений лежат в пределах ±1σ от среднего и 95% — в пределах ±2σ.
- Перцентиль / квартиль→ разобрано в уроке
- Значение, ниже которого лежит заданная доля данных: p95 — порог, который не превышают 95% наблюдений. Квартили — это перцентили 25, 50 и 75 (Q1, медиана, Q3).
- Нормальное распределение→ разобрано в уроке
- Симметричное колоколообразное распределение, полностью заданное двумя числами: средним μ (где пик) и стандартным отклонением σ (насколько колокол широкий). Правило 68-95-99.7: в ±1σ, ±2σ и ±3σ попадает соответственно 68%, 95% и 99.7% значений.
- Асимметрия распределения→ разобрано в уроке
- Мера несимметричности распределения: один хвост длиннее другого. При правосторонней асимметрии редкие большие значения тянут среднее вверх, и оно оказывается выше медианы.
- Вероятность→ разобрано в уроке
- Число от 0 до 1, показывающее, насколько ожидаемо событие: 0 — невозможно, 1 — происходит всегда. В частотной трактовке это доля случаев, в которых событие наступает, если повторять опыт много раз.
- Закон больших чисел→ разобрано в уроке
- С ростом числа испытаний наблюдаемая доля сходится к истинной вероятности. Закон описывает поведение среднего на длинной серии и ничего не утверждает об отдельном испытании.
- Условная вероятность→ разобрано в уроке
- Вероятность события A при условии, что событие B уже произошло; записывается P(A|B). От обратной величины P(B|A) отличается — это разные числа.
- Теорема Байеса→ разобрано в уроке
- Правило пересчёта вероятности после появления новых данных: P(A|B) = P(B|A)·P(A) / P(B). Учитывает базовую ставку P(A) — распространённость явления до измерений.
- ЦПТ→ разобрано в уроке
- Центральная предельная теорема: если брать выборки из почти любого распределения и считать в каждой среднее, распределение этих средних стремится к нормальному, а его разброс сокращается как σ/√n.
- Стандартная ошибка→ разобрано в уроке
- Стандартное отклонение самой оценки, а не данных: насколько среднее меняется от одной выборки к другой. Для среднего SE = σ/√n.
- Доверительный интервал→ разобрано в уроке
- Диапазон правдоподобных значений оцениваемой величины. Трактовка относится к методу: если много раз повторять эксперимент и каждый раз строить 95%-й интервал, около 95% таких интервалов накроют истинное значение.
- Бутстреп→ разобрано в уроке
- Оценка неопределённости без формул: из имеющейся выборки много раз случайно набирают новую выборку того же размера с возвратом и смотрят, как меняется интересующая статистика.
- Нулевая гипотеза (H0)→ разобрано в уроке
- Утверждение «эффекта нет, а разница объясняется случайностью». Проверка идёт от противного: считают, насколько наблюдаемые данные неправдоподобны для мира без эффекта.
- p-value→ разобрано в уроке
- Вероятность увидеть такой же или ещё более выраженный результат, если эффекта на самом деле нет. Это не вероятность того, что гипотеза верна, и не размер эффекта.
- Ошибка 1 рода (α)→ разобрано в уроке
- Ложноположительный результат: критерий отверг верную нулевую гипотезу, то есть объявил эффект, которого в действительности нет. Уровень α выбирают заранее — это доля таких ошибок, которую допускают (обычно 0.05).
- Ошибка 2 рода (β)→ разобрано в уроке
- Ложноотрицательный результат: эффект в действительности есть, но критерий его не обнаружил. Вероятность обратного — обнаружить существующий эффект — называется мощностью и равна 1−β.
- Мощность→ разобрано в уроке
- Вероятность обнаружить эффект заданного размера при условии, что он действительно есть. Зависит от размера эффекта, разброса данных, размера выборки и выбранного α.
- t-тест→ разобрано в уроке
- Критерий сравнения средних двух групп: соотносит наблюдаемую разницу со стандартной ошибкой этой разницы. Требует независимости наблюдений и примерно нормального распределения средних.
- Множественные сравнения→ разобрано в уроке
- Одновременная проверка многих гипотез — нескольких метрик, сегментов или вариантов. Риски ложноположительного результата при этом накапливаются: при 20 независимых тестах с α=0.05 хотя бы одно ложное «значимо» появится примерно в 64% случаев.
- Корреляция (r)→ разобрано в уроке
- Число от −1 до +1, описывающее силу и направление линейной связи двух величин. Ноль означает отсутствие линейной связи, но не отсутствие связи вообще.
- Регрессия / МНК→ разобрано в уроке
- Метод, подбирающий прямую (или более сложную зависимость) так, чтобы сумма квадратов отклонений точек от неё была наименьшей. Коэффициент наклона показывает, на сколько в среднем меняется y при росте x на единицу.
- Парадокс Симпсона→ разобрано в уроке
- Зависимость, видимая по данным в целом, меняется на противоположную внутри каждой группы. Причина — скрытый фактор, по-разному распределённый между группами.
- Переобучение→ разобрано в уроке
- Модель выучила не закономерность, а случайный шум обучающих данных: на них результат отличный, на новых — плохой. Проявляется как разрыв качества между обучающей и отложенной выборкой.
- Precision / Recall→ разобрано в уроке
- Точность (precision) — какая доля объектов, отнесённых моделью к классу, отнесена верно. Полнота (recall) — какую долю объектов этого класса модель обнаружила.
- ROC / AUC→ разобрано в уроке
- ROC-кривая показывает, как соотносятся доли верно обнаруженных и ложноположительных результатов при переборе всех порогов классификатора. AUC — площадь под этой кривой: 1.0 — идеал, 0.5 — уровень случайного угадывания.
- Ошибка выжившего→ разобрано в уроке
- Искажение, при котором выводы делают только по объектам, «дожившим» до данных, не видя тех, кто из них выпал.
- Закон Гудхарта→ разобрано в уроке
- Как только показатель становится целью, его начинают оптимизировать напрямую — и он перестаёт отражать то, ради чего вводился.
- Временной ряд→ разобрано в уроке
- Последовательность значений метрики, упорядоченная по времени с постоянным шагом. Соседние наблюдения в нём зависимы, поэтому обычные методы, рассчитанные на независимые данные, применять к ряду нельзя без оговорок.
- Тренд и сезонность→ разобрано в уроке
- Две регулярные составляющие ряда: тренд — медленное направленное движение, сезонность — колебание с известным периодом (день недели, месяц года). Остаток после их вычитания считают шумом.
- y = T + S + E
- Автокорреляция→ разобрано в уроке
- Корреляция ряда с самим собой, сдвинутым на несколько шагов назад. Нарушает предпосылку независимости наблюдений: стандартные ошибки занижаются, а доверительные интервалы оказываются уже, чем следует.
- Стационарность→ разобрано в уроке
- Свойство ряда, у которого среднее, разброс и структура связи между наблюдениями не меняются со временем. Требование большинства прогнозных моделей: только при нём выученное на прошлом переносимо в будущее.
- Дифференцирование ряда→ разобрано в уроке
- Переход от значений ряда к их приростам. Убирает тренд и делает ряд стационарным; сезонная разность (вычитание значения на период раньше) убирает цикл. Буква I в названии ARIMA.
- Экспоненциальное сглаживание→ разобрано в уроке
- Прогноз по взвешенному прошлому, где вес наблюдений убывает геометрически с возрастом. Расширение Хольта — Уинтерса хранит уровень, тренд и сезонность отдельными компонентами и продлевает каждую.
- ARIMA / SARIMA / SARIMAX→ разобрано в уроке
- Семейство моделей, описывающих ряд через его прошлое: AR — зависимость от прошлых значений, I — дифференцирование, MA — поправка на прошлые ошибки. S добавляет те же механизмы на сезонном лаге, X — внешние признаки (промо, праздники), будущие значения которых известны заранее.
- (p,d,q)(P,D,Q)ₘ
- Бэктест прогноза→ разобрано в уроке
- Проверка прогноза на истории: обучение только на данных до точки отсечения и сравнение с фактом после неё. Точку сдвигают несколько раз, потому что оценка по одному разрезу — это оценка по одному наблюдению.
- MAE / RMSE / MAPE→ разобрано в уроке
- Метрики ошибки прогноза: MAE — средний промах в единицах метрики, RMSE — с усиленным штрафом за крупные промахи, MAPE — ошибка в процентах от факта. MAPE не определена при нулевых значениях и несимметрична; для таких рядов берут MASE — ошибку, делённую на ошибку наивного прогноза.
- MAE = (1/n)·Σ|y − ŷ|
Бизнес-метрики
- North Star Metric
- Метрика, выбранная главной для всей команды: отражает ценность, которую получает пользователь, и опережает выручку. Занимает вершину дерева метрик, остальные разбираются как её драйверы.
- DAU / MAU→ формула и SQL
- Число уникальных пользователей, совершивших целевое действие за день (DAU) и за месяц (MAU). Их отношение называют stickiness и читают как «сколько дней в месяце пользователь заходит»: 0.2 — примерно 6 дней из 30.
- stickiness = DAU / MAU
- Retention→ формула и SQL
- Доля пользователей из когорты, вернувшихся к продукту спустя заданное время после первого контакта. Считается по когортам — группам, пришедшим в один период.
- retention = вернувшиеся из когорты / размер когорты
- Churn→ формула и SQL
- Доля клиентов или выручки, потерянная за период. При месячном оттоке 5% средняя жизнь клиента около 20 месяцев (1 / 0.05).
- churn = ушедшие за период / клиенты на начало периода
- ARPU / ARPPU→ формула и SQL
- Средний доход на пользователя (ARPU) и отдельно на платящего пользователя (ARPPU). Разрыв между ними показывает, какая доля аудитории платит.
- ARPU = выручка / все пользователи; ARPPU = выручка / платящие
- LTV→ формула и SQL
- Суммарная прибыль, которую приносит клиент за всё время жизни с продуктом. Простая оценка для подписки: средний чек × маржинальность / отток.
- LTV = средний чек × маржинальность / отток
- CAC→ формула и SQL
- Полная стоимость привлечения одного нового клиента: маркетинговый и коммерческий бюджет, делённый на число привлечённых. Считается по платным каналам.
- CAC = расходы на привлечение / число новых клиентов
- GMV→ формула и SQL
- Суммарная стоимость всех товаров, проданных через платформу за период, до вычета комиссий, скидок, отмен и возвратов. Это оборот, а не выручка: платформа зарабатывает лишь свою комиссию от GMV.
- Take Rate→ формула и SQL
- Доля GMV, остающаяся платформе в виде комиссий и платных сервисов. GMV 10 млрд при take rate 5% даёт 500 млн выручки.
- take rate = выручка платформы / GMV
- Conversion Rate (CR)→ формула и SQL
- Доля пользователей, дошедших до целевого действия, от числа тех, кто имел возможность его совершить. Требует уточнения базы: конверсия «из визита в заказ» и «из корзины в заказ» — разные величины.
- CR = целевые действия / все, кто мог их совершить
- AOV→ формула и SQL
- Средняя стоимость одного заказа: выручка, делённая на число заказов. Как всякое среднее, чувствителен к выбросам.
- AOV = выручка / число заказов
- NRR→ формула и SQL
- Net Revenue Retention — во что превратилась выручка от когорты клиентов через год с учётом расширений, даунгрейдов и оттока, но без новых клиентов. Значение выше 100% означает рост без новых продаж.
- NRR = (MRR начала + расширение − сжатие − отток) / MRR начала
- MRR→ формула и SQL
- Регулярная месячная выручка от подписок, приведённая к месяцу: годовой контракт делят на 12, разовые платежи не включают. Раскладывается на новые подписки, расширение, сжатие и отток.
- Fulfillment / Match Rate
- Доля запросов, доведённых до успешного результата: заказ доставлен, поездка состоялась, спрос нашёл предложение. Метрика баланса спроса и предложения на площадке.
- match rate = успешно закрытые запросы / все запросы
- Same-store sales→ формула и SQL
- Продажи сопоставимых точек: сравнивают только те магазины или рестораны, которые работали в обоих сравниваемых периодах. Отсекает эффект открытия новых точек. В отчётности встречается как LFL (like-for-like).
- Контр-метрики (Guardrails)→ разобрано в уроке
- Метрики-ограничители, которые следят, чтобы рост целевого показателя не достигался ценой ущерба в другом месте. Фиксируются до начала эксперимента и проверяются вместе с целевой метрикой.
- ACV
- Annual Contract Value — стоимость контракта в пересчёте на год: трёхлетний контракт на 300 тысяч даёт ACV 100 тысяч. В отличие от TCV, который считает всю сумму за срок контракта.
- ACV = полная сумма контракта / срок в годах
- ARR
- Annual Recurring Revenue — годовая регулярная выручка от действующих подписок, обычно MRR × 12. Описывает текущий темп: сколько бизнес заработает за следующие 12 месяцев, если ничего не изменится.
- ARR = MRR × 12
- KYC
- Know Your Customer — обязательная идентификация клиента перед открытием счёта или проведением операций; требование регуляторов для борьбы с отмыванием денег.
- Interchange
- Межбанковская комиссия: банк-эквайер платит её банку-эмитенту с каждой карточной транзакции. Ставку задаёт платёжная система, а получает комиссию эмитент.
- TPV→ формула и SQL
- Total Payment Volume — общий объём платежей, прошедших через платформу за период. Для финтеха играет ту же роль, что GMV для маркетплейса: это оборот, а не доход.
- SKU
- Stock Keeping Unit — отдельная товарная позиция с уникальным набором характеристик: красная футболка размера M и та же футболка размера L это два разных SKU. Числом SKU описывают ширину ассортимента.
- FBO
- Схема продаж, при которой товар заранее лежит на складе маркетплейса, и площадка сама хранит его, собирает заказ и доставляет. Противоположная схема — FBS, когда товар хранится у продавца и отгружается им по факту заказа.
- GBV
- Gross Booking Value — общая стоимость забронированных услуг за период: перелётов, отелей, туров. Для трэвел-сервисов то же, что GMV для маркетплейса.
- TAC
- Traffic Acquisition Cost — сколько площадка платит за приходящий трафик: партнёрам за установку поиском по умолчанию и сайтам-партнёрам за показ её рекламы.
- ROAS / ДРР→ формула и SQL
- Return on Ad Spend — сколько выручки приносит каждый рубль, вложенный в рекламу: ROAS 4 означает 4 рубля выручки на рубль расходов. ДРР — обратная величина, доля рекламных расходов в выручке.
- ROAS = выручка от рекламы / расходы на рекламу; ДРР = 1 / ROAS
- NPS→ формула и SQL
- Net Promoter Score — индекс лояльности на основе вопроса «насколько вероятно, что вы нас порекомендуете» по шкале 0–10. Из доли промоутеров (9–10) вычитают долю критиков (0–6); нейтральные 7–8 не учитываются. Результат лежит от −100 до +100.
- NPS = %промоутеров (9–10) − %критиков (0–6)
- CPI
- Cost Per Install — стоимость одной установки приложения. Базовая метрика закупки трафика в мобильных продуктах.
- CPI = расходы на привлечение / число установок
- UA
- User Acquisition — направление, отвечающее за платное привлечение пользователей: бюджеты, каналы, креативы и закупка трафика.
- F2P
- Free-to-Play — модель, в которой продукт бесплатен для всех, а выручку приносит небольшая доля платящих, обычно 1–5%.
- D1 / D7 / D30→ формула и SQL
- Удержание на 1-й, 7-й и 30-й день после установки: доля пользователей когорты, вернувшихся в продукт в этот день. Стандартные контрольные точки мобильной аналитики.
- Dn = вернувшиеся на n-й день / размер когорты
- ETA
- Estimated Time of Arrival — прогноз времени прибытия курьера, водителя или заказа. Метрикой служит не только сама длительность, но и точность прогноза.
- LMS
- Learning Management System — платформа, на которой размещают курсы, ведут учеников и собирают статистику прохождения.
- RPM
- Revenue Per Mille — доход автора или площадки на тысячу просмотров, уже после вычета доли платформы. В отличие от CPM, который показывает, сколько за тысячу показов платит рекламодатель.
- RPM = доход / просмотры × 1000
- CPC→ формула и SQL
- Cost Per Click — цена одного клика по рекламному объявлению. Формируется в аукционе и зависит не только от ставки, но и от качества объявления.
- CPC = расходы / число кликов
- SEM
- Search Engine Marketing — платное продвижение в поисковой выдаче, то есть контекстная реклама по запросам. В отличие от SEO, работает только пока есть бюджет.
- Look-to-Book
- Отношение числа бронирований к числу поисковых сессий в трэвел-сервисах. Низкие значения для отрасли нормальны: перед покупкой люди подолгу сравнивают варианты, даты и цены.
- look-to-book = бронирования / поисковые сессии
- Contribution margin→ формула и SQL
- Маржинальная прибыль — выручка за вычетом переменных затрат, напрямую связанных с конкретной единицей: заказом, поездкой, подпиской. Показывает, сколько остаётся на покрытие постоянных расходов.
- маржинальная прибыль = выручка − переменные затраты
- Bookings→ формула и SQL
- Сумма всех платежей пользователей за период — то, что они фактически заплатили, до признания выручки по бухгалтерским правилам. В играх расходится с выручкой, потому что внутриигровая валюта признаётся выручкой по мере расходования.
- Trial → Paid
- Конверсия из пробного периода в платную подписку. Заметно зависит от условий входа: триал с привязкой карты конвертирует лучше, но приводит меньше людей.
- конверсия = оплатившие / начавшие пробный период
- CTR→ формула и SQL
- Click-Through Rate — доля кликов от числа показов объявления, письма или ссылки. Измеряет привлекательность, а не результат.
- CTR = клики / показы
- SEO→ формула и SQL
- Search Engine Optimization — работа над тем, чтобы страницы попадали выше в бесплатной поисковой выдаче: через содержание, техническое состояние сайта и ссылки.
- B2B / B2C
- Business-to-business и business-to-consumer — продажи компаниям и напрямую конечным потребителям. В B2B мало сделок и длинный цикл с групповым решением, в B2C сделок много и они быстрые.
Такие разборы — в канале
Пишу про аналитику простыми словами: как считать метрики, не наврать в A/B, что спрашивают на собесах и как я собираю этот сайт. Без воды.