Почему peeking превращает 5% в 30% FP. mSPRT, Pocock, O'Brien-Fleming. Bayesian early stopping. Симуляция: за 8-15 дней вместо 30. 3 интерактива.
p-value, alpha, beta, power. Sample size. SRM, CUPED, Bonferroni.
Ключевые темы: p-value, alpha, power, MDE, sample size, SRM, CUPED, Bonferroni.
Последовательное тестирование (sequential testing) — это подход к A/B-тестам, который позволяет корректно проверять результат по ходу набора данных, а не только в заранее фиксированный момент. В обычном тесте подглядывание за промежуточными результатами и остановка «как только стало значимо» резко повышают долю ложных срабатываний. Последовательные методы пересчитывают границы значимости так, чтобы многократные проверки не раздували ошибку первого рода.
Где применяется в аналитике: Применяется, когда нужно завершать эксперименты раньше при явном эффекте и не терять контроль над ошибками: продуктовые A/B-тесты с непрерывным мониторингом, эксперименты с дорогим трафиком, ситуации, где важно быстро откатить вредное изменение.
На собеседовании: Спрашивают, чтобы проверить понимание проблемы подглядывания (peeking) и инфляции ложноположительных результатов. Смотрят, осознаёт ли кандидат, почему нельзя останавливать тест на первом «значимом» результате без поправок.
В Pro-подписке по этому конспекту получите: