Интерактивная статистика
Модуль 6 «Эксперименты: A/B»
Прогресспройдено 0 / 63

Процесс A/B по шагам: от гипотезы до раскатки

Гипотеза пиццерии: «новый баннер на главной поднимет заказы». A/B-тест — это не «включить эксперимент и посмотреть на цифру». Это процесс из пяти этапов, и большинство провалов случается не в статистике, а в пропущенных шагах дизайна и проверок. Кликайте по этапам — раскроются ключевые вопросы и типовые ошибки каждого.

Этап 1. Бизнес-постановка
  • Обозначена проблема и продуктовая гипотеза
  • Понятны масштаб и направление изменения ключевой метрики
  • Посчитана экономическая целесообразность (точка безубыточности)
  • Оценены риски и ограничения; сформулирован критерий успеха и action-plan

Это сокращённая карта; в реальном чек-листе десятки пунктов. Главное — порядок: сначала бизнес и дизайн, и только потом запуск.

Этап 1 — бизнес-постановка, ещё до всякой статистики. Какую проблему решаем? Какая продуктовая гипотеза? На сколько и куда сдвинется ключевая метрика, и окупится ли это (точка безубыточности)? Какие риски и ограничения? Без внятного критерия успеха и плана действий тест бессмысленен: непонятно, что считать победой.

Что это значит

Какое решение это меняет

Процесс фиксирует решения ДО данных: метрику, MDE, срок. Всё, что решается после взгляда в результаты, — уже не решение, а подгонка.

Зрелые команды относятся к A/B как к чек-листу: проходят этапы по порядку и не пускают тест в запуск, пока не закрыт дизайн. Это не бюрократия — каждый пропущенный пункт оборачивается либо невалидным результатом, либо невнедрённым выводом.

Особое внимание — этапу 2: метрики, размер выборки и критерий фиксируют письменно ДО запуска. Это защищает от соблазна подогнать анализ под желаемый результат (p-hacking) и делает эксперимент воспроизводимым.

Где это встречается

В больших продуктовых компаниях существует «культура экспериментов» с платформой и ревью дизайна теста: коллеги проверяют гипотезу, метрики и расчёт выборки до старта. Это резко снижает долю бесполезных и ошибочных тестов.

Клинические испытания устроены так же строго: протокол (аналог дизайна) регистрируется заранее, метрики и размер выборки зафиксированы, остановка по правилам. Цена ошибки высока — поэтому процесс важнее интуиции.

Определения

Guardrail-метрики
заградительные метрики, которые нельзя просадить ради основной (скорость, ошибки, отписки). Фиксируются на дизайне.
По-простому: сторожа: следят, чтобы «победа» не сломала что-то другое.
MDE
минимальный эффект, который тест должен уметь заметить. Задаёт нужный размер выборки.
По-простому: минимальный эффект, который тест вообще способен разглядеть.
SRM (Sample Ratio Mismatch)
несоответствие фактического соотношения групп ожидаемому — частый признак ошибки сплитования или логирования.
По-простому: группы разъехались по размеру — рандомизация сломана, результату верить нельзя.
A/A-проверка
прогон методики на двух идентичных группах: «значимость» там означает поломку критерия.
По-простому: тест без изменения: если нашёл «эффект» — система врёт.
Дальше →
Такие разборы — в канале

Пишу про аналитику простыми словами: как считать метрики, не наврать в A/B, что спрашивают на собесах и как я собираю этот сайт. Без воды.

Подписаться на канал