Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 7 «Связи и регрессия»

Регрессия: предсказываем одно число по другому

До сих пор мы описывали одну величину за раз — её центр, разброс, форму. Но самое интересное начинается, когда величин две и между ними есть связь: чем больше расходы на рекламу — тем больше продажи? чем больше площадь — тем дороже квартира? Регрессия отвечает на два вопроса сразу: есть ли связь (и насколько она сильная) и как по одной величине предсказать другую. Двигайте точки на графике — линия и числа пересчитываются вживую.

x (например, расходы на рекламу) →y (продажи)
y = 16.1 + 0.69·xсдвиг b₀ = 16.1наклон b₁ = 0.69r = 0.97

Перетаскивайте точки. Наклон b₁ — на сколько растёт y при +1 по x; r — сила связи от −1 до +1.

Каждая точка — одно наблюдение с двумя числами: по горизонтали x (скажем, расходы на рекламу), по вертикали y (продажи). Облако точек идёт вверх: больше рекламы — обычно больше продаж. Бирюзовая линия — регрессия: одна прямая, которая лучше всего описывает это облако. Перетащите любую точку и посмотрите, как линия подстраивается.

Что это значит

Регрессией предсказывают сплошь и рядом: продажи по рекламному бюджету, цену квартиры по площади, нагрузку на сервер по числу пользователей, время доставки по расстоянию. Везде идея одна — по известному x оценить неизвестный y.

Коэффициенты читаются по-человечески. «b₁ = 3» для зависимости продаж от рекламы значит: каждый вложенный рубль приносит в среднем три рубля продаж. Именно ради таких выводов и строят регрессию — она не только предсказывает, но и показывает, какой рычаг насколько силён.

Но сильная корреляция сама по себе не доказывает, что x вызывает y. Чтобы заявить о причинности, нужен эксперимент — тот самый A/B-тест из прошлого модуля, где мы сами меняем x и смотрим, меняется ли y.

Где это встречается

Связи окружают нас: рост и вес, образование и доход, температура на улице и потребление электричества. Корреляция помогает их замечать и измерять, а регрессия — превращать в прогноз.

Интернет полон «ложных корреляций» — величин, которые годами случайно движутся вместе (потребление сыра и число утонувших, разводы и потребление маргарина). Они смешны именно потому, что связь есть, а причинности нет.

Поэтому грамотный аналитик, увидев корреляцию, первым делом спрашивает: нет ли скрытой общей причины и можно ли это проверить экспериментом? Сама по себе линия на графике — повод для гипотезы, а не доказательство.

Определения
Регрессия
способ предсказать одну числовую величину (y) по другой (x), проведя через данные линию.
По-простому: предсказать одно число по другому, проведя линию через точки.
Уравнение прямойy = b₀ + b₁·x
b₀ — сдвиг (прогноз при x = 0), b₁ — наклон (на сколько меняется y при росте x на единицу).
По-простому: сдвиг b₀ (откуда стартуем) и наклон b₁ (на сколько растёт y за шаг x).
Остаток
ошибка предсказания в точке — разница между настоящим y и тем, что даёт линия.
По-простому: промах в точке: настоящий y минус то, что дала линия.
Метод наименьших квадратов (МНК)
провести линию так, чтобы сумма квадратов остатков была минимальной.
По-простому: линия, у которой сумма квадратов промахов самая маленькая.
Корреляция (r)−1 … +1
сила и направление линейной связи. 0 — связи нет, ±1 — точки лежат точно на прямой.
По-простому: сила и направление прямой связи: 0 — нет, ±1 — точно на прямой.
Когда метод врёт (допущения)

Линейная регрессия предполагает примерно линейную связь, независимые остатки с примерно постоянным разбросом (гомоскедастичность) и слабое влияние выбросов. Нелинейность или один сильный выброс способны развернуть наклон — всегда смотрите на сам график, а не только на r.

Коэффициент — это связь, а не причинность. Без контроля посторонних факторов (множественная регрессия) или эксперимента читать b₁ как «эффект x на y» нельзя.

Подробный разбор: математика и механизм (необязательно)

Почему квадраты — глубже, чем «штраф за большие промахи». Если предсказывать y одним числом без всякого x, то число, минимизирующее сумму квадратов отклонений, — это в точности среднее (а минимизирующее сумму модулей — медиана). То есть МНК — прямое обобщение «среднего» на случай с предиктором: регрессия предсказывает условное среднее y при данном x. Отсюда же связь с дисперсией: R² — это доля дисперсии y, которую объяснила линия.

Практический бонус квадратов: сумма квадратов — гладкая и выпуклая функция от b₀, b₁, поэтому у неё есть единственный минимум с явной формулой (не нужно перебирать). А ещё МНК совпадает с оценкой максимального правдоподобия, если шум вокруг линии нормальный, — поэтому квадраты не произвол, а естественный выбор при колоколообразных ошибках.

Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»