Глоссарий

Термины статистики и бизнес-метрики — в одном месте.

Статистика

Среднее→ разобрано в уроке
Сумма всех значений, делённая на их количество. Показывает «центр тяжести» данных: если бы все наблюдения были одинаковыми, каждое равнялось бы среднему.
xˉ=1ni=1nxi\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i
Медиана→ разобрано в уроке
Значение, которое делит упорядоченный ряд пополам: половина наблюдений меньше него, половина больше. При чётном числе значений берут полусумму двух центральных.
Мода→ разобрано в уроке
Значение, встречающееся в данных чаще всего. Единственная мера центра, применимая к категориям: самый популярный товар, самый частый способ оплаты.
Дисперсия→ разобрано в уроке
Средний квадрат отклонения значений от их среднего: чем сильнее данные разбросаны, тем она больше. Измеряется в квадратах исходных единиц — рубли², минуты².
σ2=1n(xixˉ)2\sigma^2 = \frac{1}{n}\sum (x_i - \bar{x})^2
Стандартное отклонение (σ)→ разобрано в уроке
Корень из дисперсии: типичное расстояние от среднего до отдельного наблюдения, в тех же единицах, что и данные. Для нормального распределения около 68% значений лежат в пределах ±1σ от среднего и 95% — в пределах ±2σ.
σ=1n(xixˉ)2\sigma = \sqrt{\frac{1}{n}\sum (x_i - \bar{x})^2}
Перцентиль / квартиль→ разобрано в уроке
Значение, ниже которого лежит заданная доля данных: p95 — порог, который не превышают 95% наблюдений. Квартили — это перцентили 25, 50 и 75 (Q1, медиана, Q3).
Нормальное распределение→ разобрано в уроке
Симметричное колоколообразное распределение, полностью заданное двумя числами: средним μ (где пик) и стандартным отклонением σ (насколько колокол широкий). Правило 68-95-99.7: в ±1σ, ±2σ и ±3σ попадает соответственно 68%, 95% и 99.7% значений.
Асимметрия распределения→ разобрано в уроке
Мера несимметричности распределения: один хвост длиннее другого. При правосторонней асимметрии редкие большие значения тянут среднее вверх, и оно оказывается выше медианы.
Вероятность→ разобрано в уроке
Число от 0 до 1, показывающее, насколько ожидаемо событие: 0 — невозможно, 1 — происходит всегда. В частотной трактовке это доля случаев, в которых событие наступает, если повторять опыт много раз.
Закон больших чисел→ разобрано в уроке
С ростом числа испытаний наблюдаемая доля сходится к истинной вероятности. Закон описывает поведение среднего на длинной серии и ничего не утверждает об отдельном испытании.
Условная вероятность→ разобрано в уроке
Вероятность события A при условии, что событие B уже произошло; записывается P(A|B). От обратной величины P(B|A) отличается — это разные числа.
P(AB)=P(AB)P(B)P(A|B) = \frac{P(A \cap B)}{P(B)}
Теорема Байеса→ разобрано в уроке
Правило пересчёта вероятности после появления новых данных: P(A|B) = P(B|A)·P(A) / P(B). Учитывает базовую ставку P(A) — распространённость явления до измерений.
P(AB)=P(BA)P(A)P(B)P(A|B) = \frac{P(B|A)\cdot P(A)}{P(B)}
ЦПТ→ разобрано в уроке
Центральная предельная теорема: если брать выборки из почти любого распределения и считать в каждой среднее, распределение этих средних стремится к нормальному, а его разброс сокращается как σ/√n.
σxˉ=σn\sigma_{\bar{x}} = \frac{\sigma}{\sqrt{n}}
Стандартная ошибка→ разобрано в уроке
Стандартное отклонение самой оценки, а не данных: насколько среднее меняется от одной выборки к другой. Для среднего SE = σ/√n.
SE=σnSE = \frac{\sigma}{\sqrt{n}}
Доверительный интервал→ разобрано в уроке
Диапазон правдоподобных значений оцениваемой величины. Трактовка относится к методу: если много раз повторять эксперимент и каждый раз строить 95%-й интервал, около 95% таких интервалов накроют истинное значение.
xˉ±zSE\bar{x} \pm z \cdot SE
Бутстреп→ разобрано в уроке
Оценка неопределённости без формул: из имеющейся выборки много раз случайно набирают новую выборку того же размера с возвратом и смотрят, как меняется интересующая статистика.
Нулевая гипотеза (H0)→ разобрано в уроке
Утверждение «эффекта нет, а разница объясняется случайностью». Проверка идёт от противного: считают, насколько наблюдаемые данные неправдоподобны для мира без эффекта.
p-value→ разобрано в уроке
Вероятность увидеть такой же или ещё более выраженный результат, если эффекта на самом деле нет. Это не вероятность того, что гипотеза верна, и не размер эффекта.
Ошибка 1 рода (α)→ разобрано в уроке
Ложноположительный результат: критерий отверг верную нулевую гипотезу, то есть объявил эффект, которого в действительности нет. Уровень α выбирают заранее — это доля таких ошибок, которую допускают (обычно 0.05).
Ошибка 2 рода (β)→ разобрано в уроке
Ложноотрицательный результат: эффект в действительности есть, но критерий его не обнаружил. Вероятность обратного — обнаружить существующий эффект — называется мощностью и равна 1−β.
мощность=1β\text{мощность} = 1 - \beta
Мощность→ разобрано в уроке
Вероятность обнаружить эффект заданного размера при условии, что он действительно есть. Зависит от размера эффекта, разброса данных, размера выборки и выбранного α.
1β1 - \beta
t-тест→ разобрано в уроке
Критерий сравнения средних двух групп: соотносит наблюдаемую разницу со стандартной ошибкой этой разницы. Требует независимости наблюдений и примерно нормального распределения средних.
t=xˉ1xˉ2SEразнt = \frac{\bar{x}_1 - \bar{x}_2}{SE_{\text{разн}}}
Множественные сравнения→ разобрано в уроке
Одновременная проверка многих гипотез — нескольких метрик, сегментов или вариантов. Риски ложноположительного результата при этом накапливаются: при 20 независимых тестах с α=0.05 хотя бы одно ложное «значимо» появится примерно в 64% случаев.
P(хотя бы одна ошибка)=1(1α)mP(\text{хотя бы одна ошибка}) = 1 - (1-\alpha)^m
Корреляция (r)→ разобрано в уроке
Число от −1 до +1, описывающее силу и направление линейной связи двух величин. Ноль означает отсутствие линейной связи, но не отсутствие связи вообще.
Регрессия / МНК→ разобрано в уроке
Метод, подбирающий прямую (или более сложную зависимость) так, чтобы сумма квадратов отклонений точек от неё была наименьшей. Коэффициент наклона показывает, на сколько в среднем меняется y при росте x на единицу.
y=b0+b1xy = b_0 + b_1 x
Парадокс Симпсона→ разобрано в уроке
Зависимость, видимая по данным в целом, меняется на противоположную внутри каждой группы. Причина — скрытый фактор, по-разному распределённый между группами.
Переобучение→ разобрано в уроке
Модель выучила не закономерность, а случайный шум обучающих данных: на них результат отличный, на новых — плохой. Проявляется как разрыв качества между обучающей и отложенной выборкой.
Precision / Recall→ разобрано в уроке
Точность (precision) — какая доля объектов, отнесённых моделью к классу, отнесена верно. Полнота (recall) — какую долю объектов этого класса модель обнаружила.
precision=TPTP+FP,recall=TPTP+FN\text{precision} = \frac{TP}{TP+FP},\quad \text{recall} = \frac{TP}{TP+FN}
ROC / AUC→ разобрано в уроке
ROC-кривая показывает, как соотносятся доли верно обнаруженных и ложноположительных результатов при переборе всех порогов классификатора. AUC — площадь под этой кривой: 1.0 — идеал, 0.5 — уровень случайного угадывания.
Ошибка выжившего→ разобрано в уроке
Искажение, при котором выводы делают только по объектам, «дожившим» до данных, не видя тех, кто из них выпал.
Закон Гудхарта→ разобрано в уроке
Как только показатель становится целью, его начинают оптимизировать напрямую — и он перестаёт отражать то, ради чего вводился.
Временной ряд→ разобрано в уроке
Последовательность значений метрики, упорядоченная по времени с постоянным шагом. Соседние наблюдения в нём зависимы, поэтому обычные методы, рассчитанные на независимые данные, применять к ряду нельзя без оговорок.
Тренд и сезонность→ разобрано в уроке
Две регулярные составляющие ряда: тренд — медленное направленное движение, сезонность — колебание с известным периодом (день недели, месяц года). Остаток после их вычитания считают шумом.
y = T + S + E
Автокорреляция→ разобрано в уроке
Корреляция ряда с самим собой, сдвинутым на несколько шагов назад. Нарушает предпосылку независимости наблюдений: стандартные ошибки занижаются, а доверительные интервалы оказываются уже, чем следует.
rk=corr(yt,ytk)r_k = corr(y_t, y_{t-k})
Стационарность→ разобрано в уроке
Свойство ряда, у которого среднее, разброс и структура связи между наблюдениями не меняются со временем. Требование большинства прогнозных моделей: только при нём выученное на прошлом переносимо в будущее.
Дифференцирование ряда→ разобрано в уроке
Переход от значений ряда к их приростам. Убирает тренд и делает ряд стационарным; сезонная разность (вычитание значения на период раньше) убирает цикл. Буква I в названии ARIMA.
Δyt=ytyt1Δy_t = y_t − y_{t−1}
Экспоненциальное сглаживание→ разобрано в уроке
Прогноз по взвешенному прошлому, где вес наблюдений убывает геометрически с возрастом. Расширение Хольта — Уинтерса хранит уровень, тренд и сезонность отдельными компонентами и продлевает каждую.
Lt=αyt+(1α)Lt1L_t = α·y_t + (1−α)·L_{t−1}
ARIMA / SARIMA / SARIMAX→ разобрано в уроке
Семейство моделей, описывающих ряд через его прошлое: AR — зависимость от прошлых значений, I — дифференцирование, MA — поправка на прошлые ошибки. S добавляет те же механизмы на сезонном лаге, X — внешние признаки (промо, праздники), будущие значения которых известны заранее.
(p,d,q)(P,D,Q)ₘ
Бэктест прогноза→ разобрано в уроке
Проверка прогноза на истории: обучение только на данных до точки отсечения и сравнение с фактом после неё. Точку сдвигают несколько раз, потому что оценка по одному разрезу — это оценка по одному наблюдению.
MAE / RMSE / MAPE→ разобрано в уроке
Метрики ошибки прогноза: MAE — средний промах в единицах метрики, RMSE — с усиленным штрафом за крупные промахи, MAPE — ошибка в процентах от факта. MAPE не определена при нулевых значениях и несимметрична; для таких рядов берут MASE — ошибку, делённую на ошибку наивного прогноза.
MAE = (1/n)·Σ|y − ŷ|

Бизнес-метрики

North Star Metric
Метрика, выбранная главной для всей команды: отражает ценность, которую получает пользователь, и опережает выручку. Занимает вершину дерева метрик, остальные разбираются как её драйверы.
DAU / MAU→ формула и SQL
Число уникальных пользователей, совершивших целевое действие за день (DAU) и за месяц (MAU). Их отношение называют stickiness и читают как «сколько дней в месяце пользователь заходит»: 0.2 — примерно 6 дней из 30.
stickiness = DAU / MAU
Retention→ формула и SQL
Доля пользователей из когорты, вернувшихся к продукту спустя заданное время после первого контакта. Считается по когортам — группам, пришедшим в один период.
retention = вернувшиеся из когорты / размер когорты
Churn→ формула и SQL
Доля клиентов или выручки, потерянная за период. При месячном оттоке 5% средняя жизнь клиента около 20 месяцев (1 / 0.05).
churn = ушедшие за период / клиенты на начало периода
ARPU / ARPPU→ формула и SQL
Средний доход на пользователя (ARPU) и отдельно на платящего пользователя (ARPPU). Разрыв между ними показывает, какая доля аудитории платит.
ARPU = выручка / все пользователи; ARPPU = выручка / платящие
LTV→ формула и SQL
Суммарная прибыль, которую приносит клиент за всё время жизни с продуктом. Простая оценка для подписки: средний чек × маржинальность / отток.
LTV = средний чек × маржинальность / отток
CAC→ формула и SQL
Полная стоимость привлечения одного нового клиента: маркетинговый и коммерческий бюджет, делённый на число привлечённых. Считается по платным каналам.
CAC = расходы на привлечение / число новых клиентов
GMV→ формула и SQL
Суммарная стоимость всех товаров, проданных через платформу за период, до вычета комиссий, скидок, отмен и возвратов. Это оборот, а не выручка: платформа зарабатывает лишь свою комиссию от GMV.
Take Rate→ формула и SQL
Доля GMV, остающаяся платформе в виде комиссий и платных сервисов. GMV 10 млрд при take rate 5% даёт 500 млн выручки.
take rate = выручка платформы / GMV
Conversion Rate (CR)→ формула и SQL
Доля пользователей, дошедших до целевого действия, от числа тех, кто имел возможность его совершить. Требует уточнения базы: конверсия «из визита в заказ» и «из корзины в заказ» — разные величины.
CR = целевые действия / все, кто мог их совершить
AOV→ формула и SQL
Средняя стоимость одного заказа: выручка, делённая на число заказов. Как всякое среднее, чувствителен к выбросам.
AOV = выручка / число заказов
NRR→ формула и SQL
Net Revenue Retention — во что превратилась выручка от когорты клиентов через год с учётом расширений, даунгрейдов и оттока, но без новых клиентов. Значение выше 100% означает рост без новых продаж.
NRR = (MRR начала + расширение − сжатие − отток) / MRR начала
MRR→ формула и SQL
Регулярная месячная выручка от подписок, приведённая к месяцу: годовой контракт делят на 12, разовые платежи не включают. Раскладывается на новые подписки, расширение, сжатие и отток.
Fulfillment / Match Rate
Доля запросов, доведённых до успешного результата: заказ доставлен, поездка состоялась, спрос нашёл предложение. Метрика баланса спроса и предложения на площадке.
match rate = успешно закрытые запросы / все запросы
Same-store sales→ формула и SQL
Продажи сопоставимых точек: сравнивают только те магазины или рестораны, которые работали в обоих сравниваемых периодах. Отсекает эффект открытия новых точек. В отчётности встречается как LFL (like-for-like).
Контр-метрики (Guardrails)→ разобрано в уроке
Метрики-ограничители, которые следят, чтобы рост целевого показателя не достигался ценой ущерба в другом месте. Фиксируются до начала эксперимента и проверяются вместе с целевой метрикой.
ACV
Annual Contract Value — стоимость контракта в пересчёте на год: трёхлетний контракт на 300 тысяч даёт ACV 100 тысяч. В отличие от TCV, который считает всю сумму за срок контракта.
ACV = полная сумма контракта / срок в годах
ARR
Annual Recurring Revenue — годовая регулярная выручка от действующих подписок, обычно MRR × 12. Описывает текущий темп: сколько бизнес заработает за следующие 12 месяцев, если ничего не изменится.
ARR = MRR × 12
KYC
Know Your Customer — обязательная идентификация клиента перед открытием счёта или проведением операций; требование регуляторов для борьбы с отмыванием денег.
Interchange
Межбанковская комиссия: банк-эквайер платит её банку-эмитенту с каждой карточной транзакции. Ставку задаёт платёжная система, а получает комиссию эмитент.
TPV→ формула и SQL
Total Payment Volume — общий объём платежей, прошедших через платформу за период. Для финтеха играет ту же роль, что GMV для маркетплейса: это оборот, а не доход.
SKU
Stock Keeping Unit — отдельная товарная позиция с уникальным набором характеристик: красная футболка размера M и та же футболка размера L это два разных SKU. Числом SKU описывают ширину ассортимента.
FBO
Схема продаж, при которой товар заранее лежит на складе маркетплейса, и площадка сама хранит его, собирает заказ и доставляет. Противоположная схема — FBS, когда товар хранится у продавца и отгружается им по факту заказа.
GBV
Gross Booking Value — общая стоимость забронированных услуг за период: перелётов, отелей, туров. Для трэвел-сервисов то же, что GMV для маркетплейса.
TAC
Traffic Acquisition Cost — сколько площадка платит за приходящий трафик: партнёрам за установку поиском по умолчанию и сайтам-партнёрам за показ её рекламы.
ROAS / ДРР→ формула и SQL
Return on Ad Spend — сколько выручки приносит каждый рубль, вложенный в рекламу: ROAS 4 означает 4 рубля выручки на рубль расходов. ДРР — обратная величина, доля рекламных расходов в выручке.
ROAS = выручка от рекламы / расходы на рекламу; ДРР = 1 / ROAS
NPS→ формула и SQL
Net Promoter Score — индекс лояльности на основе вопроса «насколько вероятно, что вы нас порекомендуете» по шкале 0–10. Из доли промоутеров (9–10) вычитают долю критиков (0–6); нейтральные 7–8 не учитываются. Результат лежит от −100 до +100.
NPS = %промоутеров (9–10) − %критиков (0–6)
CPI
Cost Per Install — стоимость одной установки приложения. Базовая метрика закупки трафика в мобильных продуктах.
CPI = расходы на привлечение / число установок
UA
User Acquisition — направление, отвечающее за платное привлечение пользователей: бюджеты, каналы, креативы и закупка трафика.
F2P
Free-to-Play — модель, в которой продукт бесплатен для всех, а выручку приносит небольшая доля платящих, обычно 1–5%.
D1 / D7 / D30→ формула и SQL
Удержание на 1-й, 7-й и 30-й день после установки: доля пользователей когорты, вернувшихся в продукт в этот день. Стандартные контрольные точки мобильной аналитики.
Dn = вернувшиеся на n-й день / размер когорты
ETA
Estimated Time of Arrival — прогноз времени прибытия курьера, водителя или заказа. Метрикой служит не только сама длительность, но и точность прогноза.
LMS
Learning Management System — платформа, на которой размещают курсы, ведут учеников и собирают статистику прохождения.
RPM
Revenue Per Mille — доход автора или площадки на тысячу просмотров, уже после вычета доли платформы. В отличие от CPM, который показывает, сколько за тысячу показов платит рекламодатель.
RPM = доход / просмотры × 1000
CPC→ формула и SQL
Cost Per Click — цена одного клика по рекламному объявлению. Формируется в аукционе и зависит не только от ставки, но и от качества объявления.
CPC = расходы / число кликов
SEM
Search Engine Marketing — платное продвижение в поисковой выдаче, то есть контекстная реклама по запросам. В отличие от SEO, работает только пока есть бюджет.
Look-to-Book
Отношение числа бронирований к числу поисковых сессий в трэвел-сервисах. Низкие значения для отрасли нормальны: перед покупкой люди подолгу сравнивают варианты, даты и цены.
look-to-book = бронирования / поисковые сессии
Contribution margin→ формула и SQL
Маржинальная прибыль — выручка за вычетом переменных затрат, напрямую связанных с конкретной единицей: заказом, поездкой, подпиской. Показывает, сколько остаётся на покрытие постоянных расходов.
маржинальная прибыль = выручка − переменные затраты
Bookings→ формула и SQL
Сумма всех платежей пользователей за период — то, что они фактически заплатили, до признания выручки по бухгалтерским правилам. В играх расходится с выручкой, потому что внутриигровая валюта признаётся выручкой по мере расходования.
Trial → Paid
Конверсия из пробного периода в платную подписку. Заметно зависит от условий входа: триал с привязкой карты конвертирует лучше, но приводит меньше людей.
конверсия = оплатившие / начавшие пробный период
CTR→ формула и SQL
Click-Through Rate — доля кликов от числа показов объявления, письма или ссылки. Измеряет привлекательность, а не результат.
CTR = клики / показы
SEO→ формула и SQL
Search Engine Optimization — работа над тем, чтобы страницы попадали выше в бесплатной поисковой выдаче: через содержание, техническое состояние сайта и ссылки.
B2B / B2C
Business-to-business и business-to-consumer — продажи компаниям и напрямую конечным потребителям. В B2B мало сделок и длинный цикл с групповым решением, в B2C сделок много и они быстрые.
Такие разборы — в канале

Пишу про аналитику простыми словами: как считать метрики, не наврать в A/B, что спрашивают на собесах и как я собираю этот сайт. Без воды.

Подписаться на канал