Большинство читателей этого блога знакомы с A / B-тестированием. Как быстрое напоминание, A / B-тестирование – это эксперимент, в котором случайный посетитель вашей цифровой собственности показывает версию, отличную от оригинальной (также называемой " контроль ») в поисках оптимизатора, чтобы найти оптимальную версию, которая максимизирует конверсии. Например, может быть, это красная кнопка, которая максимизирует клики, или, может быть, это синяя кнопка. Кто знает? Ну, твой А / Б тест знал бы. Однако в этом стремлении максимизировать конверсию вы понесете издержки: значительная часть вашего трафика направляется в проигрышный вариант, который напрямую снижает показатели вашего бизнеса (например, продажи или конверсии).
В тесте A / B стоимость увеличения конверсии называется конверсией как таковой. Мы говорим, трогательно. "
Возьмите случай Джима в качестве примера. Джим, аналитик UX, работающий с мобильным брендом, который выпустит свой последний и лучший телефон на следующей неделе. Чтобы преувеличивать спрос и инициировать продажи с использованием лесных пожаров, Джим решает запустить флэш-продажи в своем мобильном приложении в течение 3 дней.
Тем не менее, вот один из участников: Джиму известно, что навигация в приложении бренда отсутствует (он провел опрос с активными пользователями, чтобы прийти к выводу), и посетители сталкиваются с трудностями при поиске продукта. Чтобы улучшить навигацию, он решает провести эксперимент, в котором он создает вариант с более интуитивной навигацией, который приводит пользователей непосредственно к воронке флэш-продаж, чтобы проверить, будет ли эта версия решать проблемы с обнаружением для нового телефона. Таким образом, Джим пытается улучшить ключевой KPI: процент сессий, в которых пользователи смогли обнаружить новый телефон.
Посмотрите на входящие данные из эксперимента и обратите внимание, что настройки в навигации в приложении демонстрируют сильное улучшение. Однако Джим слишком счастлив: он хочет поделиться первыми результатами с топ-менеджерами и привести их в восторг. Как только она собирается ворваться в кабину CMO с копией ранних тенденций, чтобы убедить ее направить больше трафика на новую навигацию, ученый данных останавливает ее.
Джим, эти тенденции великолепны, но статистически они достоверны? Где смысл?
«Но у нас нет времени ждать! Распродажа заканчивается через 3 дня!» – простонал Джим.
Кто прав? Джим, которому поручено сделать все возможное за 3 дня, или ученый, который ставит под сомнение статистическую значимость. Ну, они оба, и вот почему. Помните предыдущий комментарий о стоимости увеличения количества конверсий? Ситуация Джима требует подхода, который сводит к минимуму затраты на проведение теста А / В. Потеря конверсий из-за неэффективных изменений называется байесовским сожалением. Минимизация сожаления особенно важна в экстренных ситуациях или когда стоимость плохой дисперсии достаточно высока, чтобы компании не решались запускать тесты А / Б, поскольку Джим использует трехдневное окно для максимизации продажи, не могу дождаться статистической значимости и потерять конверсии, которые иногда занимают недели (или месяцы, на сайтах с низким трафиком). Если вы будете ждать статистической значимости, вы не сможете использовать результаты, так как 3-дневное окно будет закончено.
Если бы у Джима были алгоритмы Multi-Armed Bandit, этой проблемы бы не было. Вот почему.
Что такое многорукие бандиты?
MAB – это тип A / B-теста, в котором машинное обучение используется для изучения данных, собранных во время теста, для динамического увеличения распределения посетителей в пользу более эффективных вариантов. Это означает, что несоответствующие варианты со временем все меньше распределяют трафик. Центральное место в MAB занимает концепция «динамического распределения трафика»: это статистически обоснованный метод постоянного определения степени, в которой одна версия превосходит другие, и направляет большую часть трафика динамически и в режиме реального времени в выигрышный вариант.
MAB гарантирует, что, в отличие от теста A / B, в ходе теста общее число конверсий будет максимальным. Компромисс с тестом A / B заключается в том, что статистическая достоверность находится в фоновом режиме в MAB, потому что основное внимание уделяется конверсиям и нахождению точных коэффициентов конверсии (всех вариаций, включая худшие показатели).
Проблема многорукого бандита
MAB назван в честь мысленного эксперимента, в котором игроку приходится выбирать между несколькими игровыми автоматами с разными выплатами, и задача игрока состоит в том, чтобы максимизировать сумму денег, которую он забирает домой. Представьте на мгновение, что вы игрок. Как бы вы максимизировали свою прибыль?
Поскольку у вас есть на выбор несколько игровых автоматов, вы можете определять выплаты, рискуя всеми компьютерами, собирая достаточно данных, пока не узнаете наверняка, какой из них лучший. Это покажет вам точный коэффициент выплат для всех игровых автоматов, но в процессе вы бы потратили много денег на низкооплачиваемые машины. Это то, что происходит в тесте A / B. Или вы можете сосредоточиться на некоторых игровых автоматах быстрее, оценить прибыль, как в предыдущем случае, и максимизировать свои инвестиции в эти игровые автоматы, чтобы получить более высокую прибыль. Это то, что происходит в MAB.

Источник изображения (1)
Разведка и эксплуатация
Чтобы лучше понять MAB, есть два столпа, которые приводят этот алгоритм в действие: «разведка» и «эксплуатация». Большинство классических A / B-тестов по замыслу всегда находятся в режиме «сканирования»; В конце концов, определение статистически значимых результатов является его смыслом, а следовательно, и постоянным исследованием. В тесте A / B цель состоит в том, чтобы определить точный коэффициент конверсии вариаций. MAB добавляет поворот к A / B-тестированию: эксплуатация. Из-за текстуры «максимизация конверсии и прибыли», разработанной в MAB, проводимой параллельно, похожей на железнодорожную колею, подумайте об алгоритме, который сканирует со скоростью много посетителей в секунду, достигая постоянно меняющихся выигрышных линий и непрерывное динамическое распределение большей части вашего трафика для варианта, который имеет наилучшие шансы на выигрыш в данный момент (эксплуатация).
Может показаться, что MAB использует эвристику для сопоставления большего трафика с лучшей дисперсией производительности. Однако под капотом реализация MAB в VWO является статистически устойчивой. VWO использует математическую модель для постоянного обновления оценочных коэффициентов преобразования дисперсии и назначает разделение трафика прямо пропорционально этим оценкам. По мере улучшения оценки наилучшей дисперсии производительности эта дисперсия получает более высокий процент трафика. Если вы заинтересованы в изучении математики алгоритма VWO MAB, вы можете прочитать больше о концепции, называемой Тэмпсон Сэмплинг (1).
Во время цикла тестирования алгоритм балансирует между фазами исследования и эксплуатации. По мере того как высокопроизводительные пользователи получают больше конверсий, разделение трафика продолжает увеличиваться, достигая точки, когда подавляющее большинство пользователей получают наилучшую дисперсию производительности. Таким образом, MAB позволяет Джиму из нашего предыдущего примера постепенно внедрять лучшую версию своего мобильного приложения, не дожидаясь, пока его тесты достигнут статистической значимости.

Если MAB звучит так удивительно, зачем кому-то делать A / B-тестирование?
Важно понимать, что тесты A / B и MAB обслуживают разные варианты использования, поскольку их подход отличается. A / B-тест проводится для сбора данных с соответствующей статистической достоверностью. Затем компания использует собранные данные, интерпретирует их в более широком контексте и затем принимает решение.
Скорее, MAB – это алгоритм оптимизации, который максимизирует данную метрику (которые являются преобразованиями определенного типа в контексте VWO). Не существует промежуточного этапа интерпретации и анализа, так как алгоритм MAB автоматически корректирует трафик.
Это означает, что A / B-тесты идеально подходят для случаев, когда:
- Цель состоит в том, чтобы собрать данные для принятия важного бизнес-решения. Пример: если вы решаете позиционирование продукта, данные об участии в разных позициях в тесте A / B являются важной точкой данных (но не единственной)
- Цель состоит в том, чтобы узнать влияние всех вариаций со статистической достоверностью. Пример. Если вы усердно работали над созданием нового продукта, вы хотите не только оптимизировать продажи, но и собирать информацию о производительности, чтобы в следующий раз вы могли использовать идеи для разработки лучшего продукта.
Напротив, MAB идеально подходит для случаев, когда:
- Нет необходимости интерпретировать результаты / эффективность вариантов, и все, что вас волнует, – это максимизация конверсий. Пример: если вы тестируете цветовую схему, вы хотите использовать только ту, которая максимизирует конверсию
- Окно возможностей для оптимизации недолговечно, и времени для сбора статистически значимых результатов недостаточно. Пример: оптимизация цены за ограниченное по времени предложение.

В заключение было бы справедливо сказать, что как A / B, так и MAB имеют свои сильные и слабые стороны: динамика между ними является взаимодополняющей, а не конкурентной.
Вот несколько общих реальных сценариев, где MAB показал, что он явно превосходит A / B-тестирование:
1. Альтернативная стоимость потерянных конверсий слишком высока
Представьте, что вы продаете алмазы (или автомобиль) онлайн. Каждое потерянное обращение может стоить вам тысячи долларов. В этом случае фокус MAB на максимизации конверсий идеально подходит для ваших потребностей оптимизации.
2) Оптимизация рейтинга кликов для СМИ, освещающих срочные события
Изначально вызывать броские заголовки было задачей издателя, но это явно не соответствует действительности: спросите наших друзей в The Washington Post (2). Короткая продолжительность жизни новостей означает, что быстрая оптимизация необходима. Они оптимизируют и тестируют заголовки, миниатюры фотографий, миниатюры видео, рекомендуемые новостные статьи и популярные статьи, чтобы генерировать максимальное количество кликов в коротком окне.
3) Непрерывная оптимизация
Оптимизаторы имеют возможность добавлять или вычитать несколько вариантов вариантов и тестировать все одновременно. В традиционном A / B-тесте существует небольшая свобода для организации изменений после активации эксперимента, поскольку святость данных является священной.
4) Низкая оптимизация доходов от трафика
Если трафика недостаточно, A / B-тестирование может занять много времени для получения статистической значимости. В таких случаях компании может быть лучше запустить MAB, так как она может обнаружить потенциально лучшую версию намного раньше и направить на нее больше трафика.
Хотя у MAB есть свои достоинства, существует много сценариев, в которых A / B-тестирование, безусловно, является лучшим вариантом:
1) Когда вы указываете на статистическую значимость
Несмотря на все свои сильные стороны, эксперименты с МАБ – не лучший вариант, если вы хотите получить статистически солидный победитель. A / B-тестирование по-прежнему является самой быстрой формой статистической значимости, хотя оно может потерять некоторые преобразования в процессе.
2) Оптимизация для нескольких метрик
Зрелые экспериментальные команды отслеживают более 4 целей за эксперимент, так как опыт состоит из первичных и вторичных задач. Хотя эксперименты MAB работают очень хорошо за счет оптимизации ключевой метрики, они не работают хорошо для нескольких целей, поскольку они учитывают только главную цель при распределении входящего трафика.
3) Анализ после эксперимента
Большинству экспериментаторов нравится вырезать и разрезать данные, собранные во время эксперимента, чтобы проверить, как разные сегменты реагировали на изменения своих веб-свойств. Этот анализ возможен при A / B-тестировании, но может быть невозможен в MAB, так как может быть недостаточно данных для недостаточно эффективных изменений.
4. Включите обучение из всех вариантов (в том числе бедных) в другие бизнес-решения.
В ходе теста MAB назначает большую часть трафика наилучшей дисперсии производительности. Это означает, что неэффективные варианты не получают достаточно трафика для достижения статистической достоверности. Таким образом, в то время как вы можете с уверенностью знать коэффициент конверсии для лучшей дисперсии производительности, аналогичная достоверность может быть недоступна для недостаточной производительности. Если получение этих знаний важно для делового решения (вы, возможно, захотите узнать, насколько плохая дисперсия проигрыша по сравнению с лучшей), лучше использовать A / B-тест.
суммирующий
Если вы новичок в мире конверсии и оптимизации, и еще не запускаете тесты, начните прямо сейчас. Согласно Bain & Co (3), компании, которые постоянно улучшают качество обслуживания клиентов, растут на 4-8% быстрее, чем их конкуренты. И A / B, и MAB-тесты являются эффективными методологиями оптимизации: MAB является отличной альтернативой для оптимизаторов, которые испытывают нехватку времени и могут участвовать со статистической значимостью в обмен на большее количество конверсий в коротком окне. Пожалуйста, свяжитесь с нами по [email protected], если вам нужна кисть MAB. Кроме того, вы можете зарегистрироваться здесь для теста.
