Метрики качества регрессии: MAE, RMSE, MAPE
Линию мы провести умеем. Но любой прогноз промахивается — вопрос, насколько. Чтобы сравнивать модели и понимать, можно ли им доверять, ошибку сворачивают в одно число. Таких чисел несколько, и они отвечают на разные вопросы. Двигайте точки и добавляйте выброс — следите, как реагирует каждая метрика.
Перетаскивайте точки и следите за метриками. RMSE всегда ≥ MAE и реагирует на выброс резче.
У каждой точки есть остаток — расстояние от неё до линии (жёлтые чёрточки). Все метрики качества — это разные способы усреднить эти промахи в одно число. Чем оно меньше, тем точнее модель.
На практике метрику фиксируют до обучения модели — иначе соблазн выбрать ту, на которой результат красивее. И смотрят не одну: MAE и RMSE рядом сразу показывают, есть ли в данных тяжёлые выбросы (если RMSE заметно больше MAE — есть).
Эти же метрики стоят за выбором модели в машинном обучении: из десятка моделей берут ту, у которой ошибка на новых данных меньше. А что именно считать «ошибкой» — MAE, RMSE или что-то ещё — определяет бизнес-смысл задачи.
Прогноз погоды, спроса, цен, времени в пути — всюду качество измеряют именно так. Сервис доставки оптимизирует RMSE предсказанного времени: лучше стабильно ошибаться на пару минут, чем изредка — на полчаса.
Финансовые и продуктовые прогнозы часто оценивают в MAPE: «модель ошибается в среднем на 8%» понятно и руководству, и аналитику, и не зависит от того, в каких единицах считаем.
Определения
MAPE взрывается на значениях около нуля и несимметрична: занижение и завышение штрафуются по-разному. Для метрик с нулями (спрос по дням, редкие заказы) берите MAE/RMSE или взвешенные варианты.
R² растёт от добавления любых переменных и молчит о применимости на новых данных. Высокий R² при нелинейной связи или экстраполяции за диапазон обучающих данных — иллюзия точности.