Причинность: конфаундеры и коллайдеры
«Корреляция ≠ причинность» — лозунг, который все повторяют. Но что с этим делать? Когда контроль переменной спасает вывод, а когда — портит? Разберём три базовые причинные структуры на трёх узлах X, Y, Z. Это превращает лозунг в рабочий навык.
Один и тот же приём (контроль Z) в разных структурах даёт противоположный результат: для конфаундера — спасает, для коллайдера — портит, для медиатора — убивает эффект. Поэтому «контролировать всё подряд» — ошибка.
Первая структура — конфаундер: Z влияет и на X, и на Y. Тогда между X и Y возникает связь, хотя X не влияет на Y. Жара (Z) повышает и продажи мороженого (X), и утопления (Y). Без контроля Z видна ложная связь.
Нажмите «контролировать Z» при структуре «конфаундер». Что станет с ложной связью X–Y?
Практический навык: прежде чем «добавить контроль», нарисуйте стрелки. Переменная — общая причина? Контролируйте. Общее следствие (коллайдер)? Ни в коем случае. Звено эффекта? Зависит от вопроса. Бездумный контроль «всего» так же опасен, как и отсутствие контроля.
Классический коллайдер в продукте — анализ «только активных пользователей» или «только выживших»: отбор по следствию рождает парадоксальные связи (это и есть ошибка выжившего из модуля про ловушки).
В медицине причинные схемы решают, какие факторы включать в модель эффекта лечения: возраст и тяжесть — конфаундеры (контролируем), а осложнение лечения — коллайдер (не контролируем).
Знаменитые «парадоксы» (почему среди звёзд кино талант и красота будто бы в противоречии) — это эффект коллайдера от отбора, а не реальная связь.
Определения
Любой вывод о причинности из наблюдательных данных опирается на ПРЕДПОЛАГАЕМУЮ схему стрелок, которую нельзя проверить только по данным. Ошиблись в схеме — ошиблись в том, что контролировать.
Контроль убирает лишь УЧТЁННЫЕ конфаундеры. Всегда может остаться неизвестный — поэтому эксперимент сильнее любой наблюдательной поправки.