Множественная регрессия и контроль переменных
Парная регрессия смотрит на связь x и y в одиночку — и потому легко обманывается. Настоящая рабочая лошадь аналитика — множественная регрессия: она оценивает эффект x, удерживая прочие факторы постоянными. Именно здесь живёт практический ответ на «корреляция ≠ причинность».
Поставьте истинный эффект = 0 и силу конфаундера побольше: общая красная линия покажет «связь», которой нет. Контроль z (линии внутри групп) её убирает. Это и делает множественная регрессия — оценивает эффект x, удерживая z постоянным.
Перед Вами две группы точек по скрытому фактору z (серые — z=0, бирюзовые — z=1). Сейчас контроля нет: красная линия — общая регрессия y по x. Она идёт вверх — будто x сильно влияет на y.
Множественная регрессия — самый частый инструмент аналитика после описательной статистики. «Влияет ли стаж на зарплату, если учесть должность и город?», «эффект промо на выручку при контроле сезона и канала» — всё это коэффициенты при прочих равных.
Главная сила и главная опасность — одна и та же: что именно вы включили в модель. Забыли важный конфаундер — эффект искажён; включили лишнее (см. коллайдер в следующем уроке) — тоже. Поэтому набор контролей выбирают по смыслу задачи, а не «всё подряд».
Эконометрика и социальные науки почти целиком стоят на множественной регрессии: оценить эффект образования на доход, удерживая возраст, пол, регион постоянными.
В продукте — оценить вклад фичи в удержание при контроле давности регистрации и платформы, когда чистый A/B по этой фиче невозможен.
Определения
Коэффициент «при прочих равных» честен, только если в модель включены нужные конфаундеры и форма связи примерно линейна. Пропущенный важный фактор смещает оценку (omitted variable bias).
Сильно скоррелированные предикторы (мультиколлинеарность) делают отдельные коэффициенты неустойчивыми. И контроль не превращает наблюдательные данные в эксперимент — остаётся риск неучтённых факторов.