Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 10 «Байесовский вывод»

Наивный Байес как классификатор

Теорему Байеса можно превратить в рабочий классификатор. Наивный Байес десятилетиями фильтрует спам и до сих пор силён как быстрый базовый метод. Он напрямую применяет всё, что мы знаем про условную вероятность и базовую ставку.

Письмо = выбранные слова. Кликайте, чтобы включить/убрать слово:
шансы = 0.30/0.70 × 15.0(выигрыш) × 5.0(срочно)
P(спам | письмо) = 97.0% → спам

Каждое спам-слово (LR>1) толкает вероятность вверх, «деловое» (LR<1) — вниз. Слова перемножаются независимо — отсюда «наивный». Базовая ставка P(спам) — стартовые шансы: при редком спаме даже сильные слова не делают письмо спамом наверняка.

Задача: письмо со словами — спам или нет? Байес переворачивает вопрос. Нас интересует P(спам | слова), а измеримо обратное: P(слова | спам) — как часто эти слова встречаются в спаме. Теорема Байеса связывает их через базовую ставку P(спам) — насколько спам вообще част.

Что это значит

Наивный Байес — отличная базовая модель для текста (спам, тональность, темы): быстрый, дешёвый, не требует много данных. С него разумно начинать, прежде чем тянуть тяжёлые модели.

Его слабость — те самые коррелированные признаки: вероятности он оценивает смещённо (часто слишком уверенно), поэтому как ИСТОЧНИК вероятностей он хуже, чем как принимающий РЕШЕНИЕ классификатор. Если нужны калиброванные вероятности — их отдельно калибруют.

Где это встречается

Классические спам-фильтры (байесовская фильтрация) — прямое применение: по словам письма обновляется вероятность «спам». Тот же приём — в простой классификации отзывов и новостей по темам.

В медицине и диагностике та же логика «обновить базовую ставку наблюдениями» лежит в основе вероятностных скрининговых правил.

Определения
Наивный Байес
классификатор на теореме Байеса с допущением независимости признаков при известном классе.
По-простому: классификатор по теореме Байеса, считающий признаки независимыми.
Допущение независимости
признаки (слова) считаются независимыми внутри класса — почти всегда ложно, но удобно и часто работает.
По-простому: признаки считаем независимыми — почти всегда неправда, но работает.
Правдоподобие признакаP(слово | класс)
как часто признак встречается в данном классе; оценивается долями по обучающим данным.
По-простому: как часто это слово встречается в текстах данного класса.
Сглаживание
малая добавка к счётчикам, чтобы невиданное в обучении слово не обнуляло всё произведение.
По-простому: маленькая добавка к счётчикам, чтобы новое слово не обнуляло всё.
Когда метод врёт (допущения)

«Наивность» — предположение, что признаки независимы внутри класса. Когда фичи дублируют друг друга (длина письма и число слов), классификатор учитывает одно свидетельство дважды и становится сверхуверенным: его «вероятности» нельзя читать буквально.

Слово, не встречавшееся в классе при обучении, даёт нулевую вероятность и обнуляет всё произведение — нужно сглаживание (добавка Лапласа). И прогнозы зависят от базовых ставок: на новом балансе классов они съезжают.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»