Понимать смысл A/B-теста и не делать выводов без достаточной выборки, значимости и без путаницы корреляции с причинностью.
A/B-тесты: как делать выводы правильно
A/B-тесты: как делать выводы правильно
A/B-тест — метод сравнения двух вариантов (A и B) на случайно разделённых группах пользователей. Цель — понять, какой вариант лучше влияет на нужную метрику результата. Например, две версии кнопки «Купить» показываются разным случайным группам, и измеряется, у какой выше конверсия.
Главная ловушка — делать выводы слишком рано. Для корректного вывода нужны: (1) достаточный размер выборки — иначе случайные колебания выглядят как закономерность; (2) статистическая значимость — обычно порог 95% (p < 0.05), то есть вероятность случайного результата не превышает 5%; (3) достаточная длительность — обычно от 1 до 2 недель, потому что поведение пользователей колеблется в зависимости от дня недели, времени суток и сезонности.
Вторая ловушка — путать корреляцию с причинностью. Если конверсия выросла во время теста — это не обязательно заслуга изменения. Возможно, параллельно запустили рекламную акцию, изменилась сезонность или пришёл другой тип трафика. Настоящий A/B-тест изолирует один фактор, но внешние события всё равно могут загрязнить результат.
Связь с выбором метрики: тестировать нужно метрику-результат (например, «число оплаченных заказов»), а не ванильную метрику тщеславия (например, «число кликов на кнопку без проверки, дошли ли до оплаты»). Иначе тест покажет рост, не связанный с реальной ценностью.
Lesson notes
A/B-тесты: как делать выводы правильно
A/B-тест — метод сравнения двух вариантов (A и B) на случайно разделённых группах пользователей. Цель — понять, какой вариант лучше влияет на нужную метрику результата. Например, две версии кнопки «Купить» показываются разным случайным группам, и измеряется, у какой выше конверсия.
Главная ловушка — делать выводы слишком рано. Для корректного вывода нужны: (1) достаточный размер выборки — иначе случайные колебания выглядят как закономерность; (2) статистическая значимость — обычно порог 95% (p < 0.05), то есть вероятность случайного результата не превышает 5%; (3) достаточная длительность — обычно от 1 до 2 недель, потому что поведение пользователей колеблется в зависимости от дня недели, времени суток и сезонности.
Вторая ловушка — путать корреляцию с причинностью. Если конверсия выросла во время теста — это не обязательно заслуга изменения. Возможно, параллельно запустили рекламную акцию, изменилась сезонность или пришёл другой тип трафика. Настоящий A/B-тест изолирует один фактор, но внешние события всё равно могут загрязнить результат.
Связь с выбором метрики: тестировать нужно метрику-результат (например, «число оплаченных заказов»), а не ванильную метрику тщеславия (например, «число кликов на кнопку без проверки, дошли ли до оплаты»). Иначе тест покажет рост, не связанный с реальной ценностью.