Оценка — это случайная величина (главная идея вывода)
Это, возможно, самый важный урок всего курса — его стоит держать в голове во всех следующих. У нас есть лишь выборка, и по ней мы что-то ОЦЕНИВАЕМ: среднее, долю, разницу. Ключевое прозрение: любая такая оценка — сама случайная величина. Возьми другую выборку — получишь другое число. И у этого «гуляния» есть своё распределение, на котором держится весь статистический вывод.
Какую бы оценку вы ни выбрали — она своя у каждой выборки, то есть сама случайна. Её разброс падает с ростом n. Это и есть выборочное распределение — объект, на котором держатся ЦПТ, интервалы и проверка гипотез.
Различим две вещи, которые легко спутать. Истина (оцениваемое) — это число про всю совокупность: настоящее среднее μ, настоящая доля p. Оно одно и фиксировано, но нам неизвестно. Оценка (оцениватель) — то, что мы считаем по выборке: x̄, p̂. Оно нам известно, но меняется от выборки к выборке. Жёлтая линия — истина (одна), бирюзовая гистограмма внизу — как пляшет оценка.
Эта рамка меняет то, как читаешь любую цифру в отчёте. «Конверсия 12%» звучит как факт, но это не истина, а одна реализация случайной оценки: собрали бы данные за другую неделю — получили бы 11% или 13%, хотя настоящая конверсия не менялась. Поэтому само число без представления о его разбросе почти бесполезно: 12% на выборке из 50 человек и 12% на выборке из 50 000 — это две совершенно разные степени уверенности, хотя цифра одна. Правильный вопрос к любой оценке — не «чему равна?», а «насколько широко она могла бы разброситься?».
Отсюда два практических вывода. Первый: оценку судят как инструмент — хорошая оценка несмещённая (в среднем попадает в истину, а не мажет всё время в одну сторону) и узкая (мало гуляет от выборки к выборке). Второй: этим гулянием можно управлять — чем больше выборка, тем теснее оценки жмутся к истине. Поэтому «сколько собрать данных» — не технический вопрос, а главный рычаг точности.
Опросы, рейтинги, замеры качества, продуктовые метрики — везде на руках лишь оценка по выборке. Профессионал автоматически держит в уме её выборочное распределение и не путает «получившееся число» с «истиной».
Именно поэтому серьёзные отчёты показывают не голую точку, а оценку с интервалом — честное признание, что это случайная величина, а не приговор.
Определения
Формула стандартной ошибки σ/√n (с ней познакомимся в следующем уроке) предполагает независимые наблюдения. Если строки кластеризованы (несколько визитов одного человека, города, рекламные кампании), эффективный n меньше числа строк — настоящая ошибка больше формульной.
Стандартная ошибка описывает только случайный разброс. Систематическую ошибку — нерепрезентативную выборку, смещённый замер — √n не лечит: с ростом n вы всё увереннее сходитесь к неправильному ответу.
Подробный разбор: математика и механизм (необязательно)
Формально оценка — это функция от случайной выборки, поэтому она сама случайная величина. У неё есть математическое ожидание (куда она целится в среднем) и дисперсия (как сильно гуляет). Несмещённость — это «ожидание оценки = оцениваемое»; эффективность — «при той же выборке дисперсия меньше».
Дальше мы увидим, что для среднего это распределение имеет ширину σ/√n и стремится к нормальному (ЦПТ) — но сама идея «оценка случайна и имеет распределение» верна для любой статистики, даже когда формулы нет (тогда выручает бутстреп).