Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 2 «Вероятность»

Условная вероятность и редкие события

Случайность обманывает не только на малых выборках. Есть ловушка хитрее: даже очень точный тест на редкую болезнь выдаёт уйму ложных срабатываний. Разберёмся, почему — это про условную вероятность.

Из 1000 человек больны ≈ 10, тест положителен у ≈ 108.
Все положительные тесты:реально больны: 9ложное срабатывание: 99
P(болен | тест положителен) = 8%
Теорема Байеса (числа подставляются вживую):
P(болен | +) = P(болен)·P(+|болен) / [ P(болен)·P(+|болен) + P(здоров)·P(+|здоров) ]
= (0.010·0.90) / [ 0.010·0.90 + 0.990·0.10 ] = 8%
P(болен) — базовая ставка (распространённость), P(+|болен) — точность теста. Двигайте ползунки — формула пересчитывается.

Возьмём болезнь, которой болеет 1 человек из 100, и тест точностью 90%. Тест положителен у части людей. Полоса — это все, у кого тест сработал: бирюзовое — реально больны, жёлтое — здоровые с ложным срабатыванием.

Почему это важно

Эта ловушка реальна в медицине: при скрининге редких болезней большинство положительных результатов оказываются ложными, поэтому за первым тестом идёт подтверждающий, более точный.

Тот же эффект в антифроде и спам-фильтрах: если мошенничество редко, даже хороший детектор завалит вас ложными срабатываниями, если не учесть базовую ставку.

Где это встречается

Алкотестеры, детекторы лжи, системы распознавания «подозрительных» в толпе — все страдают этим: на редком событии и хорошей точности абсолютное число ложных срабатываний огромно.

Поэтому грамотный вывод всегда учитывает не только «насколько точен тест», но и «насколько редко само событие».

Определения
Условная вероятность
вероятность события при условии, что известно другое. P(болен | тест +) — это не то же, что P(тест + | болен).
По-простому: шанс одного, когда про другое уже знаешь — и порядок здесь важен.
Базовая ставка (prior)
насколько событие распространено вообще, до всякого теста. Редкость сильно меняет смысл положительного результата.
По-простому: как часто событие бывает вообще, ещё до всякого теста.
Теорема БайесаP(AB)=P(A)P(BA)P(B)P(A \mid B) = \dfrac{P(A)\cdot P(B \mid A)}{P(B)}
как обновить вероятность события A после наблюдения B, учитывая и точность теста, и базовую ставку P(A).
По-простому: пересчитать шанс, когда пришла новая улика.
Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»