Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 4 «От выборки к миру»

От выборки к миру: центральная предельная теорема

В прошлом уроке мы поняли: оценка (например, среднее) — случайная величина со своим выборочным распределением. Теперь узнаем форму этого распределения для среднего — и это окажется удивительно простым фактом, на котором держится весь дальнейший вывод.

истинное среднее 11.01 · генеральная совокупность (скошена)2 · одна выборка (n = 10) и её среднееx̄ = 8.63 · распределение выборочных средних → колокол
Выборок собрано: 0n: 10Стандартная ошибка σ/√n ≈ 3.29отклонение x̄ от истины: -2.4

Перед Вами три панели. Сверху — генеральная совокупность: скошенная, например время ответа сервиса (много быстрых запросов, редкие очень долгие). В середине — одна случайная выборка из неё: её точки и зелёная линия — выборочное среднее x̄. Снизу копится распределение этих средних. Нажмите «взять выборку» и заметьте: x̄ почти никогда не равно истинному среднему — оно чуть промахивается (отклонение показано справа).

Что это значит

Главное следствие ЦПТ кажется чудом: по крошечной части можно судить о целом. Одна выборка, конечно, врёт — в неё случайно попадут то люди побогаче, то победнее, и её среднее не совпадёт с истинным. Но врёт она предсказуемо: средние разных выборок разбросаны вокруг настоящего значения аккуратным колоколом, а не как попало. Раз мы знаем форму этого разброса, мы знаем и насколько наша единственная выборка могла промахнуться. Поэтому опрос 1500 человек надёжно оценивает настроения целой страны: важна не доля охваченных, а то, что случайная выборка достаточного размера промахивается предсказуемо мало.

Насколько мало — задаёт стандартная ошибка σ/√n, и в ней спрятана обидная деталь: точность растёт как корень из размера выборки, а не пропорционально ему. Чтобы уменьшить ошибку вдвое, данных нужно вчетверо больше. Первые сотни наблюдений сбивают неопределённость резко, а дальше каждая новая тысяча добавляет всё меньше — поэтому в опросах и останавливаются на ~1500: ошибка уже около 2–3%, а дальше дорого и почти без толку.

Где это встречается

Контроль качества проверяет среднее по 30 деталям, а не по всей партии. Рейтинги и индексы усредняют выборки. Всё это работает, потому что средние ведут себя предсказуемо.

A/B-тесты сравнивают средние двух групп пользователей — и опираются ровно на этот факт о поведении средних.

Определения
Генеральная совокупность
все объекты, о которых мы хотим сделать вывод (например, все пользователи).
По-простому: все, о ком делаем вывод, — хоть вся страна.
Выборка
случайно отобранная часть совокупности, которую мы реально наблюдаем.
По-простому: случайная горстка из совокупности, которую реально измерили.
Центральная предельная теорема (ЦПТ)
распределение средних случайных выборок стремится к нормальному (колоколу) — даже если сами данные не нормальны.
По-простому: среднее по выборке ложится в колокол, даже если сами данные — нет.
Стандартная ошибкаσ / √n
ширина распределения выборочных средних: насколько типично среднее выборки отклоняется от истинного. Падает как √n.
По-простому: насколько типично среднее выборки промахивается мимо истинного.
Когда метод врёт (допущения)

ЦПТ требует независимых наблюдений и конечной дисперсии. При сверхтяжёлых хвостах (степенной закон с α ≤ 2) дисперсия бесконечна — колокол не складывается, а среднее не стабилизируется даже на больших n.

При сильной скошенности и маленьком n распределение среднего ещё не успевает стать нормальным — нужна выборка побольше. Зависимые или кластеризованные данные (один пользователь даёт много наблюдений) эффективно уменьшают реальный n.

Подробный разбор: математика и механизм (необязательно)

Почему именно колокол? Среднее — это сумма n независимых вкладов, делённая на n. Каждое наблюдение тянет среднее то вверх, то вниз; при сложении эти случайные отклонения частично гасят друг друга, и крайние комбинации (все наблюдения разом большие) астрономически редки — поэтому результат кучкуется у центра симметрично. Удивительно то, что форма исходных данных при этом почти не важна: складывая много независимых вкладов, мы всегда приходим к нормальной форме.

Откуда √n: дисперсии независимых складываются (из прошлого урока), поэтому Var(суммы) = n·σ², а деление на n уменьшает дисперсию в n² раз → Var(среднего) = σ²/n, и σ(среднего) = σ/√n. Корень — прямое следствие того, что складываются именно дисперсии (квадраты), а не сами разбросы.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»