Интерактивная статистика
Модуль 2 «Вероятность»
Прогресспройдено 0 / 63

Условная вероятность и редкие события

Случайность обманывает не только на малых выборках. Есть ловушка хитрее: даже очень точный тест на редкую болезнь выдаёт уйму ложноположительных результатов. Разберёмся, почему — это про условную вероятность.

Из 1000 человек больны ≈ 10, тест положителен у ≈ 108.
Все положительные тесты:реально больны: 9ложноположительные: 99
P(болен | тест положителен) = 8%
Теорема Байеса (числа подставляются вживую):
P(болен | +) = P(болен)·P(+|болен) / [ P(болен)·P(+|болен) + P(здоров)·P(+|здоров) ]
= (0.010·0.90) / [ 0.010·0.90 + 0.990·0.10 ] = 8%
P(болен) — базовая ставка (распространённость), P(+|болен) — точность теста. Двигайте ползунки — формула пересчитывается.

Возьмём болезнь, которой болеет 1 человек из 100, и тест точностью 90%. Тест положителен у части людей. Полоса — это все, у кого тест сработал: бирюзовое — реально больны, жёлтое — здоровые с ложноположительным результатом.

Почему это важно

Эта ловушка реальна в медицине: при скрининге редких болезней большинство положительных результатов оказываются ложными, поэтому за первым тестом идёт подтверждающий, более точный.

Тот же эффект в антифроде и спам-фильтрах: если мошенничество редко, даже хороший детектор завалит вас ложноположительными результатами, если не учесть базовую ставку.

Где это встречается

Алкотестеры, детекторы лжи, системы распознавания «подозрительных» в толпе — все страдают этим: на редком событии и хорошей точности абсолютное число ложноположительных результатов огромно.

Поэтому грамотный вывод всегда учитывает не только «насколько точен тест», но и «насколько редко само событие».

Определения

Условная вероятность
вероятность события при условии, что известно другое. P(болен | тест +) — это не то же, что P(тест + | болен).
По-простому: шанс одного, когда про другое уже известно, — и порядок здесь важен.
Базовая ставка (prior)
насколько событие распространено вообще, до всякого теста. Редкость сильно меняет смысл положительного результата.
По-простому: как часто событие бывает вообще, ещё до всякого теста.
Теорема БайесаP(AB)=P(A)P(BA)P(B)P(A \mid B) = \dfrac{P(A)\cdot P(B \mid A)}{P(B)}
как обновить вероятность события A после наблюдения B, учитывая и точность теста, и базовую ставку P(A).
По-простому: пересчитать шанс, когда пришла новая улика.
Дальше →
Такие разборы — в канале

Пишу про аналитику простыми словами: как считать метрики, не наврать в A/B, что спрашивают на собесах и как я собираю этот сайт. Без воды.

Подписаться на канал