Сегменты и гетерогенные эффекты (ATE и CATE)
A/B по новинке меню дал итог: «B лучше A на 2%». Но средний результат может скрывать, что новичкам новинка зашла отлично, а постоянным гостям — навредила. Эффект редко одинаков для всех. Разберём, что именно измеряет эксперимент и зачем смотреть по сегментам.
Поставьте истинный эффект = 0 и силу конфаундера побольше: общая красная линия покажет «связь», которой нет. Контроль z (линии внутри групп) её убирает. Это и делает множественная регрессия — оценивает эффект x, удерживая z постоянным.
То, что оценивает A/B, называется ATE — средний эффект воздействия (Average Treatment Effect): насколько в среднем B лучше A по всем пользователям. Это честное и главное число эксперимента. Но «в среднем» — это усреднение по очень разным людям.
Средний эффект решает «катить ли всем», CATE — «кому катить»: таргетированная раскатка может спасти фичу, провалившую общий тест.
Грамотный разбор A/B не заканчивается на ATE: смотрят CATE по заранее заданным сегментам, чтобы не внедрить изменение, которое в среднем плюс, но бьёт по важной группе. Иногда лучшее решение — раскатить только на сегмент, где эффект положителен.
Но сегментный анализ — мина множественных сравнений: десятки срезов почти гарантированно дадут случайный «значимый» сегмент. Поэтому сегменты гипотезируют заранее, поправляют порог и перепроверяют.
Новая фича часто радует новичков и раздражает опытных (ломает привычку). ATE может быть около нуля, а CATE по новизне — резко разный; решение принимают именно по сегментам.
Цена и промо почти всегда дают гетерогенный эффект по странам и платформам — поэтому раскатку нередко делают сегментно, а не «всем сразу».
Определения
Оценка ATE честна при настоящей рандомизации и независимости; CATE по сегменту наследует те же требования плюс достаточный размер каждого сегмента (в мелких срезах оценка очень шумная).
Сегменты, найденные перебором постфактум, — почти наверняка ложные. Без заранее заданных гипотез и поправки на множественность сегментный анализ порождает мнимые эффекты.