Классификация: как машина относит объект к классу
Регрессия предсказывает число. Но часто нужно предсказать категорию: спам или не спам, болен или здоров, уйдёт клиент или останется. Это задача классификации. Прежде чем считать ошибки, разберёмся в самом принципе — как машина вообще решает, к какому классу отнести объект. Двигайте ползунки и смотрите, как линия делит классы.
Подберите наклон и сдвиг так, чтобы линия разделила классы с наименьшим числом ошибок. Это и делает классификатор — ищет гиперплоскость в пространстве признаков.
Любой объект для модели — это набор чисел-признаков (фич). Письмо описывают, например, две фичи: доля ссылок в тексте (по горизонтали) и сколько в нём слов вроде «срочно», «деньги», «выигрыш» (по вертикали). Каждая точка — одно письмо. Бирюзовые — спам, серые — обычные: видно, что спам сдвинут вправо-вверх.
Подбор хороших фич — половина успеха. Для письма это доля ссылок и «спам-слова»; для оттока клиента — давность последней покупки, частота визитов, средний чек; для антифрода — сумма, время, география операции. Модель сильна ровно настолько, насколько информативны признаки, которые ей дали.
А порог — отдельная ручка, которую крутят уже после обучения, под цену ошибок. Одна и та же модель с разным порогом ведёт себя как «осторожный» или «придирчивый» фильтр.
Классификаторы повсюду: спам-фильтры, антифрод в банках, медицинская диагностика, кредитный скоринг, модерация контента, рекомендации «купят / не купят». Везде объект описывают признаками, а модель проводит границу.
Современные нейросети устроены сложнее линейной границы, но принцип сохраняется: на входе — признаки, на выходе — счёт по классам, а решение даёт порог.