⏸️ Досрочно останавливаем A/B: подглядывание или нет? Классика жанра. Тест идет третий день, денежная метрика упала на 8%, p-value уже 0,03. Менеджер давит: «Надо останавливать, мы теряем деньги!» Аналитик отвечает: «Нельзя подглядывать, нужно дождаться выборки!» Но подглядывание ли это? Есть разница между подглядыванием как нарушением методологии проведения A/B-теста и мониторингом как проверкой здоровья эксперимента. Классический Fixed Horizon подход говорит: зафиксируй размер выборки заранее и дождись ее, прежде чем принимать решение о результате эксперимента. Но это не значит, что нужно запустить тест и открыть дашборд только через две недели, когда выборка наберется. Вот тут и проходит грань. Это мониторинг, и тест стоит завершить досрочно, если: 🔹 обнаружен баг – изменение работает не так, как было задумано; 🔹 возник SRM и проверка показала проблему с рандомизацией; 🔹 нарушилась работа логирования или часть данных потерялась; 🔹 коллизия с параллельными экспериментами делает результат неинтерпретируемым; 🔹 метрика пробила заранее установленную красную линию допустимых потерь. Это подглядывание, если: 🔹 каждый час проверять обычный p-value и остановить тест, как только он станет меньше 0,05; 🔹 перебирать вторичные метрики, сегменты и срезы, пока где-нибудь не появится значимый результат; 🔹 менять правила фильтрации выбросов после того, как увидели результат. Что делать в исходном примере с падением денежной метрики на 8%? Если падение на 8% пробивает заранее установленную красную линию, эксперимент останавливаем, чтобы ограничить возможный ущерб. Но такая остановка сама по себе еще не доказывает, что изменение действительно ухудшает метрику. Если обнаружена техническая или методологическая проблема – тоже останавливаем. Если порог не пробит, технических и методологических проблем нет, тест можно продолжать до набора запланированной выборки. Промежуточный p-value 0,03 в Fixed Horizon подходе сам по себе не является основанием для остановки. А если хочется корректно принимать решения по ходу эксперимента, это нужно заранее заложить в дизайн. Например, использовать Sequential Testing или другой подход с формальными правилами досрочной остановки. Смотреть на данные идущего A/B-теста – нормальная практика мониторинга. Ошибка начинается тогда, когда промежуточные результаты заставляют вас менять правила принятия решения, которые не были заложены в дизайн эксперимента.
⏸️ Досрочно останавливаем A/B: подглядывание или нет? Классика жанра. Тест идет…
Источник
https://t.me/nodatanogrowth/1188Канал No Data No Growth | Pavel Bukhtik · опубликовано 31 июл. 2026 г.
Из этого канала
- #1187🤔 Раньше я думал, что понимаю бизнеc Многие идут в продуктовую аналитику, чтобы…
🤔 Раньше я думал, что понимаю бизнеc Многие идут в продуктовую аналитику, чтобы быть ближе к бизнесу.
- #1186📹 «Ты не против, если мы запишем собес?» Работодатель хочет записать собес –…
📹 «Ты не против, если мы запишем собес?» Работодатель хочет записать собес – норм или стрем? На самом деле, может быть и так, и так. Я сам был по обе стороны.
- #1185🎯 В чём идея Uplift-моделирования? Привычные ML-модели отвечают на вопрос: «Кто…
🎯 В чём идея Uplift-моделирования? Привычные ML-модели отвечают на вопрос: «Кто с большой вероятностью купит?» или «Кто может уйти?» Но бизнесу часто нужен…