Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 10 «Байесовский вывод»

Байесовский вывод: обновляем мнение данными

Всё, что было раньше, — частотный подход: истинное значение считается фиксированным, а мы спрашиваем «насколько данные удивительны, если гипотеза верна». Байесовский подход смотрит иначе: наше знание о величине — это распределение уверенности, которое данные ОБНОВЛЯЮТ. Двигайте априорное мнение и данные — смотрите, как рождается апостериорное.

априори 0.50итог 0.6601 · θ (истинная доля/конверсия)
▏ априори (мнение до данных), центр 0.50▏ правдоподобие (только данные 34/50 = 0.68)▏ апостериори (итог), центр 0.66
апостериори(θ) ∝ априори(θ) × правдоподобие(данные | θ) → центр итога 0.66 лежит между 0.50 (априори) и 0.68 (данные)

θ — это неизвестная истинная доля (например, конверсия кнопки). Серая кривая — во что вы верите ДО данных (априори); её центр задаёт «Априорное мнение», а ширину — «Сила априори» (больше сила → уже и увереннее). Жёлтая пунктирная — что говорят ОДНИ данные (k успехов из n): её пик стоит на доле k/n. Синяя — итог (апостериори): он получается перемножением серой и жёлтой и всегда лежит МЕЖДУ ними. Двигайте ползунки: при малых данных итог тянется к априори, при больших n жёлтая кривая становится узкой и перетягивает итог на себя — данные «перебивают» исходное мнение.

Серая кривая — априорное распределение (prior): во что мы верим про долю θ (скажем, конверсию) ДО эксперимента. Это не одно число, а целое распределение правдоподобия разных значений. Поставьте априорное среднее туда, где ждёте конверсию, а «силой априори» задайте, насколько уверены.

Что это значит

Байесовский подход естественно работает при малых данных: вместо «слишком мало, чтобы судить» он честно показывает широкое апостериорное — большую неопределённость, которая сужается по мере накопления наблюдений.

В продуктовых A/B байесовские метрики («вероятность, что B лучше A», «ожидаемые потери») понятнее бизнесу, чем p-value. Но априори нужно выбирать обдуманно: сильное смещённое априори при малых данных может увести вывод.

Где это встречается

Спам-фильтры исторически байесовские: априорная вероятность спама обновляется словами письма (наивный Байес). Тот же механизм — в медицинской диагностике, где база заболевания обновляется результатом теста (это мы видели в уроке про условную вероятность).

Рекомендательные и поисковые системы, A/B-платформы, прогнозы спроса всё чаще используют байесовское обновление: оно изящно соединяет накопленный опыт с новыми данными в реальном времени.

Определения
Априорное (prior)
распределение уверенности о величине ДО наблюдения данных — прежний опыт или нейтральное предположение.
По-простому: во что верили до данных: прежний опыт или нейтральная догадка.
Правдоподобие (likelihood)
насколько вероятны наблюдённые данные при каждом возможном значении величины.
По-простому: насколько наблюдённые данные ожидаемы при каждом значении величины.
Апостериорное (posterior)posterior ∝ prior × likelihood
обновлённое мнение после данных. Им и пользуются для выводов и решений.
По-простому: обновлённое мнение после данных — им и пользуемся для решений.
Байес vs частотный
частотный: величина фиксирована, случайны данные. Байес: данные фиксированы, неопределённость выражена распределением величины.
По-простому: частотный: случайны данные; Байес: неопределённость — это распределение величины.
Когда метод врёт (допущения)

При малых данных апостериорное почти целиком повторяет априорное — вывод честен ровно настолько, насколько честно априори. Проверяйте чувствительность: сильно ли меняется ответ при другом разумном prior.

«Вероятность, что эффект есть» — это вероятность ПРИ ваших предпосылках: модели шума и априори. Кривая модель или зависимые данные ломают байесовский вывод так же беспощадно, как частотный.

Подробный разбор: математика и механизм (необязательно)

Механизм «заострения». Апостериорное в каждой точке θ — это произведение априорного на правдоподобие: posterior(θ) ∝ prior(θ)·L(данные|θ). Правдоподобие L при многих наблюдениях — это произведение вероятностей каждого, поэтому оно остро пикуется около θ, лучше всего объясняющего данные. Перемножение узкого правдоподобия на широкое априори даёт узкое апостериорное у этого пика — вот почему данные «побеждают» и сужают веру.

Почему мало данных → апостериорное близко к априори: при малом n правдоподобие ещё пологое (данные мало что исключают), и форму задаёт априори. С ростом n правдоподобие становится всё острее и подавляет априори — отсюда «данные перебивают предубеждения». Сопряжённые априорные (Beta для долей, как в виджете) удобны тем, что апостериорное остаётся того же семейства — поэтому обновление сводится к простому пересчёту параметров.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»