От выборки к миру: центральная предельная теорема
В прошлом уроке мы поняли: оценка (например, среднее) — случайная величина со своим выборочным распределением. Теперь узнаем форму этого распределения для среднего — и это окажется удивительно простым фактом, на котором держится весь дальнейший вывод.
Перед Вами три панели. Сверху — генеральная совокупность: скошенная, например время ответа сервиса (много быстрых запросов, редкие очень долгие). В середине — одна случайная выборка из неё: её точки и зелёная линия — выборочное среднее x̄. Снизу копится распределение этих средних. Нажмите «взять выборку» и заметьте: x̄ почти никогда не равно истинному среднему — оно чуть промахивается (отклонение показано справа).
Главное следствие ЦПТ кажется чудом: по крошечной части можно судить о целом. Одна выборка, конечно, врёт — в неё случайно попадут то люди побогаче, то победнее, и её среднее не совпадёт с истинным. Но врёт она предсказуемо: средние разных выборок разбросаны вокруг настоящего значения аккуратным колоколом, а не как попало. Раз мы знаем форму этого разброса, мы знаем и насколько наша единственная выборка могла промахнуться. Поэтому опрос 1500 человек надёжно оценивает настроения целой страны: важна не доля охваченных, а то, что случайная выборка достаточного размера промахивается предсказуемо мало.
Насколько мало — задаёт стандартная ошибка σ/√n, и в ней спрятана обидная деталь: точность растёт как корень из размера выборки, а не пропорционально ему. Чтобы уменьшить ошибку вдвое, данных нужно вчетверо больше. Первые сотни наблюдений сбивают неопределённость резко, а дальше каждая новая тысяча добавляет всё меньше — поэтому в опросах и останавливаются на ~1500: ошибка уже около 2–3%, а дальше дорого и почти без толку.
Контроль качества проверяет среднее по 30 деталям, а не по всей партии. Рейтинги и индексы усредняют выборки. Всё это работает, потому что средние ведут себя предсказуемо.
A/B-тесты сравнивают средние двух групп пользователей — и опираются ровно на этот факт о поведении средних.
Определения
ЦПТ требует независимых наблюдений и конечной дисперсии. При сверхтяжёлых хвостах (степенной закон с α ≤ 2) дисперсия бесконечна — колокол не складывается, а среднее не стабилизируется даже на больших n.
При сильной скошенности и маленьком n распределение среднего ещё не успевает стать нормальным — нужна выборка побольше. Зависимые или кластеризованные данные (один пользователь даёт много наблюдений) эффективно уменьшают реальный n.
Подробный разбор: математика и механизм (необязательно)
Почему именно колокол? Среднее — это сумма n независимых вкладов, делённая на n. Каждое наблюдение тянет среднее то вверх, то вниз; при сложении эти случайные отклонения частично гасят друг друга, и крайние комбинации (все наблюдения разом большие) астрономически редки — поэтому результат кучкуется у центра симметрично. Удивительно то, что форма исходных данных при этом почти не важна: складывая много независимых вкладов, мы всегда приходим к нормальной форме.
Откуда √n: дисперсии независимых складываются (из прошлого урока), поэтому Var(суммы) = n·σ², а деление на n уменьшает дисперсию в n² раз → Var(среднего) = σ²/n, и σ(среднего) = σ/√n. Корень — прямое следствие того, что складываются именно дисперсии (квадраты), а не сами разбросы.