Допущения регрессии и анализ остатков
Регрессию легко посчитать на любых данных — кнопка не спросит, уместна ли прямая. Но коэффициенты и их «значимость» честны, только если выполнены допущения. Проверяют их не по самому r, а по ОСТАТКАМ — промахам линии. Двигайте точки и смотрите на остатки.
Хорошая регрессия оставляет остатки бесструктурным шумом вокруг нуля. Любая закономерность в остатках — сигнал, что прямой верить нельзя, каким бы ни был R². Поэтому после регрессии всегда смотрят этот график.
Остаток — промах модели (факт минус предсказание). Главный инструмент диагностики — график остатков против x. В режиме «всё ок» они образуют бесструктурное облако вокруг нуля: это значит, что прямая уместна. Любая закономерность в остатках — сигнал, что модели верить нельзя, каким бы ни был R².
Рабочий ритуал: посчитали регрессию — построили график остатков. Дуга → связь нелинейна. Веер → гетероскедастичность. Одинокая точка вдали → проверить влиятельность. Только после этого читают коэффициенты и их значимость.
Высокий R² не спасает от нарушенных допущений: модель может хорошо «подгонять» в среднем и при этом давать неверные интервалы и обманчивый наклон. Картинка остатков честнее единственного числа.
Экономические и финансовые данные почти всегда гетероскедастичны и зависимы во времени — поэтому там по умолчанию используют робастные стандартные ошибки и специальные модели временных рядов.
В продуктовых данных нелинейность повсюду (насыщение, пороги), поэтому слепая линейная регрессия часто занижает или искажает связь — выручает взгляд на остатки и преобразования.
Определения
Сама диагностика по остаткам предполагает, что у вас достаточно данных, чтобы структуру было видно; на горстке точек закономерность в остатках разглядеть трудно.
Исправление одного нарушения (например, лог-преобразование от гетероскедастичности) меняет интерпретацию коэффициентов — теперь они про проценты, а не про абсолютные единицы.