Байесовский вывод: обновляем мнение данными
Всё, что было раньше, — частотный подход: истинное значение считается фиксированным, а мы спрашиваем «насколько данные удивительны, если гипотеза верна». Байесовский подход смотрит иначе: наше знание о величине — это распределение уверенности, которое данные ОБНОВЛЯЮТ. Двигайте априорное мнение и данные — смотрите, как рождается апостериорное.
θ — это неизвестная истинная доля (например, конверсия кнопки). Серая кривая — во что вы верите ДО данных (априори); её центр задаёт «Априорное мнение», а ширину — «Сила априори» (больше сила → уже и увереннее). Жёлтая пунктирная — что говорят ОДНИ данные (k успехов из n): её пик стоит на доле k/n. Синяя — итог (апостериори): он получается перемножением серой и жёлтой и всегда лежит МЕЖДУ ними. Двигайте ползунки: при малых данных итог тянется к априори, при больших n жёлтая кривая становится узкой и перетягивает итог на себя — данные «перебивают» исходное мнение.
Серая кривая — априорное распределение (prior): во что мы верим про долю θ (скажем, конверсию) ДО эксперимента. Это не одно число, а целое распределение правдоподобия разных значений. Поставьте априорное среднее туда, где ждёте конверсию, а «силой априори» задайте, насколько уверены.
Байесовский подход естественно работает при малых данных: вместо «слишком мало, чтобы судить» он честно показывает широкое апостериорное — большую неопределённость, которая сужается по мере накопления наблюдений.
В продуктовых A/B байесовские метрики («вероятность, что B лучше A», «ожидаемые потери») понятнее бизнесу, чем p-value. Но априори нужно выбирать обдуманно: сильное смещённое априори при малых данных может увести вывод.
Спам-фильтры исторически байесовские: априорная вероятность спама обновляется словами письма (наивный Байес). Тот же механизм — в медицинской диагностике, где база заболевания обновляется результатом теста (это мы видели в уроке про условную вероятность).
Рекомендательные и поисковые системы, A/B-платформы, прогнозы спроса всё чаще используют байесовское обновление: оно изящно соединяет накопленный опыт с новыми данными в реальном времени.
Определения
При малых данных апостериорное почти целиком повторяет априорное — вывод честен ровно настолько, насколько честно априори. Проверяйте чувствительность: сильно ли меняется ответ при другом разумном prior.
«Вероятность, что эффект есть» — это вероятность ПРИ ваших предпосылках: модели шума и априори. Кривая модель или зависимые данные ломают байесовский вывод так же беспощадно, как частотный.
Подробный разбор: математика и механизм (необязательно)
Механизм «заострения». Апостериорное в каждой точке θ — это произведение априорного на правдоподобие: posterior(θ) ∝ prior(θ)·L(данные|θ). Правдоподобие L при многих наблюдениях — это произведение вероятностей каждого, поэтому оно остро пикуется около θ, лучше всего объясняющего данные. Перемножение узкого правдоподобия на широкое априори даёт узкое апостериорное у этого пика — вот почему данные «побеждают» и сужают веру.
Почему мало данных → апостериорное близко к априори: при малом n правдоподобие ещё пологое (данные мало что исключают), и форму задаёт априори. С ростом n правдоподобие становится всё острее и подавляет априори — отсюда «данные перебивают предубеждения». Сопряжённые априорные (Beta для долей, как в виджете) удобны тем, что апостериорное остаётся того же семейства — поэтому обновление сводится к простому пересчёту параметров.