Прогнозы в A/B-тестах

Добро пожаловать в документацию по предиктивной аналитике Adapty для функции A/B-тестирования. Этот инструмент даёт представление о будущих результатах ваших текущих A/B-тестов и помогает принимать решения на основе данных быстрее 🚀 — с помощью прогнозов Adapty на базе машинного обучения.

Что такое прогнозы A/B-тестов?

Прогнозы A/B-тестов в Adapty используют продвинутые методы машинного обучения (а именно модели градиентного бустинга), чтобы предсказать долгосрочный потенциальный доход от пейволов, сравниваемых в A/B-тесте.

Прогнозная модель позволяет выбрать наиболее эффективный пейвол на основе прогнозируемой выручки за год, а не опираться только на метрики, которые вы наблюдаете в ходе теста. Это помогает быстрее и надёжнее определить победителя — без необходимости ждать неделями, пока накопится достаточно данных.

Как работает модель?

Модель обучена на обширных исторических данных A/B-тестов из множества приложений разных категорий. Она использует широкий набор признаков для прогнозирования выручки, которую пейвол, вероятно, сгенерирует в течение года после начала эксперимента. В числе этих признаков:

  • Транзакции пользователей и конверсии за разные периоды
  • Географическое распределение пользователей
  • Используемая платформа (iOS или Android)
  • Показатели отказов и возвратов
  • Продукты с подписками и их периоды (ежедневные, ежемесячные, ежегодные и т. д.)
  • Другие данные, связанные с транзакциями

Модель также учитывает пробные периоды в пейволах, используя исторические коэффициенты конверсии для прогнозирования дохода так, как если бы пользователи уже конвертировались. Это обеспечивает справедливое сравнение пейволов с пробными периодами и без них, поскольку мы также учитываем, что активные пробные периоды потенциально принесут доход в будущем.

Чем Predicted P2BB отличается от обычного P2BB?

В наших A/B-тестах используется байесовский подход: мы моделируем распределение дохода на пользователя (точнее, «Доход на 1000 пользователей») и затем вычисляем вероятность того, что одно распределение «действительно» лучше другого, а не случайно — это и называется вероятностью быть лучшим, или P2BB (подробнее о нашем подходе можно узнать здесь).

Важно учитывать, что при этом мы опираемся только на выручку, накопленную за время проведения теста. Поэтому если вы сравниваете годовую подписку с еженедельной, вам придётся ждать очень долго, чтобы действительно понять, что работает лучше. Похожая ситуация возникает при сравнении триальных подписок с нетриальными в A/B-тесте — активные триалы, которые потенциально могут изменить расстановку сил, всегда остаются за рамками учитываемой выручки.

Именно здесь в дело вступает наша прогностическая модель. Имея текущее распределение выручки в A/B-тесте и будучи обученной на большом наборе данных, она способна предсказать будущий вид этого распределения (а именно — спустя 1 год). После этого модель вычисляет прогнозируемый P2BB — тот, который вы получили бы, если бы запускали тест в течение целого года.

Обратите внимание, что иногда прогнозируемый P2BB может противоречить текущему P2BB. В таких случаях мы выделяем строки с вариантами жёлтым цветом, вот так:

74577c6-CleanShot_2024-02-15_at_13.08.452x.webp

Мы считаем это сигналом к тому, чтобы накопить больше данных и подтвердить победителя или глубже изучить A/B-тест, чтобы выяснить причину. Как правило, мы рекомендуем доверять прогнозируемому P2BB, а не текущему, поскольку он учитывает больше данных — но окончательное решение, конечно, остаётся за вами.

Точность и достоверность модели

Модель обеспечивает высокий уровень точности: средняя абсолютная процентная ошибка (MAPE) составляет чуть менее 10%. Такая точность позволяет уверенно опираться на прогнозы модели при принятии решений на основе данных.

Для дополнительной стабильности модель использует критерий «достоверности», основанный на трёх факторах:

  • Узкий доверительный интервал прогноза — модель уверена в результате
  • Достаточное количество подписок и выручки в тесте
  • С момента начала теста прошло не менее 2 недель

Прогноз считается надёжным, если выполнены хотя бы два из трёх критериев.

Когда запускается новый A/B-тест, модель формирует прогноз годового дохода на 1000 пользователей (основная метрика A/B-теста) для каждого пейвола. Прогнозы отображаются только при соответствии критериям достоверности. Если данных недостаточно, модель выведет сообщение «insufficient data for prediction».

Ограничения и особенности

Несмотря на то что наша прогностическая модель — мощный инструмент, важно учитывать её ограничения.

Качество работы модели зависит от полноты и репрезентативности доступных данных. Нетипичное поведение когорты или новые приложения, не вошедшие в обучающую выборку, могут снизить точность прогнозов.

Тем не менее прогнозы обновляются ежедневно, отражая актуальные данные и поведение пользователей. Это гарантирует, что получаемые вами сведения всегда основаны на самой свежей информации.

🚧 Примечание: Этот инструмент дополняет, но не заменяет ваши профессиональные суждения и понимание уникальной динамики вашего приложения. Используйте эти прогнозы как ориентир наряду с другими метриками и знанием рынка для принятия взвешенных решений.