Offline↔online gap. Хорошая offline-метрика не гарантирует пользу в проде. Offline мы переигрываем прошлое (где система уже на что-то влияла), а в проде рекомендации меняют поведение людей. Поэтому offline — это фильтр-ориентир, а финальное решение — за онлайном.
A/B-тест. Случайно делим пользователей на контроль (старая модель) и тест (новая) и сравниваем целевую метрику со статистикой значимости. Золотой стандарт, но дорогой и медленный.
Interleaving. Смешиваем выдачу двух моделей в одном списке и смотрим, чьи айтемы кликают чаще. Чувствительнее A/B и требует меньше трафика, но применим в основном к ранжированию.
Delayed / biased feedback. Отклик приходит с задержкой (покупку видно через дни) и смещён: мы наблюдаем клики только по тому, что сами показали (exposure / position bias). Поэтому «нет клика» ≠ «не понравилось» — это надо корректировать (debiasing, counterfactual-оценка).
Long-term value. Можно накрутить сиюминутный CTR кликбейтом и потерять пользователя через месяц. Зрелые системы оптимизируют долгосрочную ценность (retention, LTV), а не только мгновенный клик — поэтому и нужны guardrail-метрики.