Зачем задают этот вопрос
Формулы проверяют отдельной секцией. Вопрос «расскажите про самый сложный тест» проверяет другое: встречались ли вы с реальностью, в которой формулы ломаются. Junior знает, как посчитать размер выборки. Middle знает, что делать, когда честный расчёт выдаёт «тест займёт восемь месяцев».
Ответ «у меня все тесты проходили гладко» — худший из возможных. Он означает одно из двух: тестов было мало или кандидат не замечал проблем.
Каркас ответа на 3 минуты
1. Контекст и гипотеза — 20 секунд
Формулировка «если — то — метрика»: «если проактивно показывать статус заявки, клиенты перестанут звонить с вопросом "где моя карта", contact rate снизится, конверсия не пострадает». Гипотеза без целевой метрики — не гипотеза.
2. Дизайн — 30 секунд
Юнит рандомизации, целевая метрика, guardrail-метрики, MDE и расчётный срок. Одной фразой: «считали на пользователях, целевая — обращения на заявку, guardrails — конверсия и CSAT, MDE закладывали такой-то».
3. Сложность — минута, это ядро ответа
Одна-две сложности с решением. Не каталог всех проблем индустрии, а то, что случилось у вас и что вы с этим сделали.
4. Что сработало и что нет — 30 секунд
Честный пункт про неудачу поднимает доверие ко всему рассказу: «первый заход без пред-обработки не дал значимости», «первая версия изменения не сработала, гипотезу уточнили».
5. Результат и вывод — 30 секунд
Эффект в деньгах или метрике и один вывод, который вы забрали в следующие тесты.
Библиотека сложностей
Сложности, которые встречаются в реальных тестах и звучат убедительно, потому что за каждой стоит конкретный метод. Берите те, что были у вас.
Метрика — отношение
Обращения на заявку, клики на показ: числитель и знаменатель зависимы, дисперсию «в лоб» считать нельзя. Решения: delta-method или бакетизация. Тренировка: Ratio-метрика и delta-method.
Редкое событие и шумная метрика
Целевое событие случается у меньшинства пользователей, дисперсия огромная, честный MDE требует месяцев. Решение — CUPED: ковариата из предпериода срезает дисперсию и сокращает срок теста в разы. Тренировка: CUPED.
Метрика дозревает
Событие может прийти через недели после воздействия. Нужно окно атрибуции и терпение: ранний результат систематически врёт в пользу теста. Родственная проблема — peeking: подглядывание в тест до конца раздувает ошибку первого рода.
Guardrail-метрики
Снизить обращения в поддержку легко — спрячьте телефон поддержки. Целевая метрика без guardrails (конверсия, CSAT, выручка) — способ купить локальную победу ценой продукта.
SRM
Если в группы попало не то количество пользователей, которое ожидалось по дизайну, результат теста нельзя интерпретировать до выяснения причины. Тренировка: SRM-детекция.
Значимо, но бесполезно
Эффект статистически значим, а размер эффекта не окупает внедрение. Решение принимается по величине и доверительному интервалу, а не по p-value. Тренировка: значимость без аплифта.
Красные флаги, за которые снижают грейд
- «Всё прошло гладко» — см. выше.
- Нет расчёта MDE и срока до запуска: «держали тест, пока не появилась значимость» — это peeking.
- Целевая метрика без guardrails.
- Решение «по значимости»: p < 0.05 как единственный аргумент за внедрение.
- «Мы» на каждом шаге: интервьюер нанимает вас, а не вашу бывшую команду.
Как подготовиться
Выпишите свои тесты за последние год-два. Выберите один, где была реальная борьба: с дисперсией, с атрибуцией, со стейкхолдером, который хотел выкатить без теста. Соберите рассказ по каркасу выше и проговорите вслух с таймером — три минуты, не больше. Уточняющие вопросы будут про дизайн: размер выборки, дисперсия пропорции, что бы вы делали при значимом, но крошечном эффекте.