Интерактивная статистика

56 бесплатных интерактивных уроков: от среднего и медианы до A/B-тестов и Байеса. Двигайте графики и стройте интуицию. Без регистрации.

Модуль 6 «Эксперименты: A/B»

Процесс A/B по шагам: от гипотезы до раскатки

Гипотеза пиццерии: «новый баннер на главной поднимет заказы». A/B-тест — это не «включил эксперимент и смотришь на цифру». Это процесс из пяти этапов, и большинство провалов случается не в статистике, а в пропущенных шагах дизайна и проверок. Кликайте по этапам — раскроются ключевые вопросы и типовые ошибки каждого.

Этап 1. Бизнес-постановка
  • Обозначена проблема и продуктовая гипотеза
  • Понятны масштаб и направление изменения ключевой метрики
  • Посчитана экономическая целесообразность (точка безубыточности)
  • Оценены риски и ограничения; сформулирован критерий успеха и action-plan

Это сокращённая карта; в реальном чек-листе десятки пунктов. Главное — порядок: сначала бизнес и дизайн, и только потом запуск.

Этап 1 — бизнес-постановка, ещё до всякой статистики. Какую проблему решаем? Какая продуктовая гипотеза? На сколько и куда сдвинется ключевая метрика, и окупится ли это (точка безубыточности)? Какие риски и ограничения? Без внятного критерия успеха и плана действий тест бессмысленен: непонятно, что считать победой.

Что это значит
Какое решение это меняет

Процесс фиксирует решения ДО данных: метрику, MDE, срок. Всё, что решается после взгляда в результаты, — уже не решение, а подгонка.

Зрелые команды относятся к A/B как к чек-листу: проходят этапы по порядку и не пускают тест в запуск, пока не закрыт дизайн. Это не бюрократия — каждый пропущенный пункт оборачивается либо невалидным результатом, либо невнедрённым выводом.

Особое внимание — этапу 2: метрики, размер выборки и критерий фиксируют письменно ДО запуска. Это защищает от соблазна подогнать анализ под желаемый результат (p-hacking) и делает эксперимент воспроизводимым.

Где это встречается

В больших продуктовых компаниях существует «культура экспериментов» с платформой и ревью дизайна теста: коллеги проверяют гипотезу, метрики и расчёт выборки до старта. Это резко снижает долю бесполезных и ошибочных тестов.

Клинические испытания устроены так же строго: протокол (аналог дизайна) регистрируется заранее, метрики и размер выборки зафиксированы, остановка по правилам. Цена ошибки высока — поэтому процесс важнее интуиции.

Определения
Guardrail-метрики
заградительные метрики, которые нельзя просадить ради основной (скорость, ошибки, отписки). Фиксируются на дизайне.
По-простому: сторожа: следят, чтобы «победа» не сломала что-то другое.
MDE
минимальный эффект, который тест должен уметь заметить. Задаёт нужный размер выборки.
По-простому: минимальный эффект, который тест вообще способен разглядеть.
SRM (Sample Ratio Mismatch)
несоответствие фактического соотношения групп ожидаемому — частый признак ошибки сплитования или логирования.
По-простому: группы разъехались по размеру — рандомизация сломана, результату верить нельзя.
A/A-проверка
прогон методики на двух идентичных группах: «значимость» там означает поломку критерия.
По-простому: тест без изменения: если нашёл «эффект» — система врёт.
Дальше →
Понравились материалы?

Эти материалы делает канал «Кусочек пиццы» — аналитика данных простыми словами: разборы реальных кейсов, метрики, карьера. Подпишитесь, чтобы не потерять.

Подписаться на «Кусочек пиццы»