Бутстреп: интервал без формул
Доверительный интервал мы строили, опираясь на формулы и нормальность. Но что, если данные странные, а нужной формулы под рукой нет? Есть гениально простой трюк — бутстреп: пересоставлять выборку из самой себя.
Сверху — наша единственная выборка из 15 значений (скошенная вправо). Бутстреп работает по шагам: 1) берём из неё столько же значений случайно С ВОЗВРАТОМ (одно может попасть несколько раз, другое — ни разу), 2) считаем их среднее, 3) кладём это среднее в нижнее распределение. Нажмите «1 ресэмпл (шаг)» — вверху зелёными точками насыплются вытянутые значения, появится зелёная точка их среднего, и по диагональной связке это среднее «упадёт» в нижнюю гистограмму.
Идея бутстрепа поначалу кажется жульничеством: как узнать про надёжность оценки, ничего не добирая, а лишь тасуя те же данные? Секрет в том, что сама выборка — это наша лучшая (и единственная) карта генеральной совокупности. Если тянуть из неё значения наугад с возвратом, получается «псевдовыборка» — такая, какую мы могли бы собрать в параллельной попытке. Посчитав нужную метрику на тысяче таких псевдовыборок, мы своими глазами видим, насколько она гуляет от выборки к выборке, — ту самую неопределённость, ради которой раньше выводили формулы.
Отсюда и главная польза: бутстреп — рабочая лошадка, когда формул нет или данные не нормальны. Доверительный интервал к медианной выручке, к конверсии при малых числах, к любой нестандартной метрике в дашборде — везде, где аналитическая формула сложна или неизвестна, а данные на руках есть.
Тот же принцип лежит в основе многих методов машинного обучения (бэггинг, случайный лес): обучать модели на пересэмплированных выборках и усреднять.
Аналитику нужно оценить, насколько надёжна медианная длительность звонка — формулы для медианы громоздкие, а бутстреп даёт интервал в пару строк кода.
В науке бутстреп выручает, когда распределение неизвестно: вместо сомнительных допущений данные «сами рассказывают» о своей изменчивости.
Название — от идиомы «вытащить себя за ремешки ботинок» (наш Мюнхгаузен тянул себя за волосы): Брэдли Эфрон в 1979-м предложил ровно это — выборка вытягивает оценку собственной неопределённости из самой себя, без новых данных.
Определения
Бутстреп пересоставляет то, что уже есть в выборке: если в 30 наблюдениях хвост распределения не пойман, он не появится и в 10 000 псевдовыборок. На малых n интервалы выходят слишком узкими — оптимистичными.
Классический бутстреп требует независимых наблюдений: для временных рядов и кластеров нужны специальные варианты (блочный, кластерный). А для крайних статистик — максимума, минимума, редких квантилей — он ненадёжен в принципе.