A/B‑тесты без боли
A/B-тесты для начинающего аналитика: как спланировать эксперимент, набрать выборку, оценить значимость и не сделать ложных выводов. Понятное введение с примером и ошибками.
Коротко. A/B-тест сравнивает два варианта (A и B) на случайно разделённых пользователях, чтобы понять, какой лучше по метрике. Ключевое — случайное разделение, достаточная выборка и проверка статистической значимости. Без них «B победил» может быть просто случайностью.
Что такое A/B-тест
Это контролируемый эксперимент: одной группе показывают текущий вариант (контроль, A), другой — изменённый (B), и сравнивают целевую метрику (конверсию, средний чек). Так проверяют гипотезы, а не «кажется, стало лучше».
Как провести правильно
- Гипотеза и метрика: что меняем и что измеряем (одна главная метрика).
- Случайное разделение пользователей на группы.
- Размер выборки рассчитать заранее, а не «пока не понравится».
- Длительность зафиксировать заранее, учесть недельную сезонность.
- Оценка значимости и решение.
Статистическая значимость
Значимость (обычно p-value < 0.05) показывает, что разница вряд ли случайна. Но помните: значимость ≠ важность. Разница может быть статистически значимой, но крошечной по влиянию на бизнес — смотрите и на размер эффекта.
Частые ошибки
- ❌ Останавливать тест, как только «B вырвался вперёд» (подглядывание).
- ❌ Слишком маленькая выборка — выводы недостоверны.
- ❌ Менять несколько вещей сразу — непонятно, что сработало.
- ❌ Игнорировать сезонность (день недели, акции).
Частые вопросы
Что такое p-value простыми словами?
Вероятность увидеть такую разницу случайно, если на самом деле её нет. Меньше — увереннее, что эффект реальный.
Сколько длить тест?
До набора запланированной выборки и минимум полную неделю-две, чтобы сгладить сезонность.
Можно ли доверять одному тесту?
Осторожно: важны корректный дизайн, размер эффекта и, по возможности, воспроизведение результата.