Сравнение моделей
Все пять моделей на одном протоколе, рядом. Выбери метрику и сравни — а главное, посмотри, как меняется картина на сложных сегментах: long-tail фильмах и малоактивных пользователях. Именно там видно реальную силу персонализации.
▸Почему нельзя выбрать модель по одной средней метрике
| Модель |
|---|
Всё на одном протоколе: leave-last-out, K = 10, релевантно = оценка ≥ 4. Зелёным — лидер сегмента. У coverage/novelty/diversity «больше» не всегда значит «лучше».
Сложные срезы: long-tail айтемы и малоактивные пользователи
Средняя метрика «по всем» прячет важное. Модель может выглядеть прилично в среднем, но разваливаться там, где данных мало. Поэтому мы считаем те же метрики ещё и на двух узких сегментах, где сигнала меньше.
⚠️ Это не настоящий cold-start
Полный production cold-start — это айтем/пользователь без взаимодействий вовсе. У нас же фильмы и люди со скудной, но ненулевой историей: это long-tail / low-signal-сегменты, учебная аппроксимация ситуаций, где данных мало, а не строгий cold-start.
Сегменты не взаимоисключающие: один пользователь может попасть и в long-tail-срез (его спрятанный фильм нишевый), и в low-activity-срез (у него самого мало оценок). Размеры срезов также видны в шапке таблицы выше.
Как читать таблицу
- Выбери метрику в выпадающем списке.
- Сначала сравни модели в колонке «Все пользователи».
- Потом — тех же моделей на «Long-tail айтемах».
- Потом — на «Малоактивных пользователях».
- Не выбирай модель по одной метрике: accuracy, coverage, novelty и diversity отвечают на разные вопросы.
На что смотреть
Переключи метрику на NDCG@10 и сравни столбцы «Все» и «Long-tail айтемы». На наших данных точность popularity на long-tail вышла ровно 0: модель ранжирует фильмы по общей популярности, поэтому нишевому фильму почти невозможно попасть в Top-10. MF же на этом сегменте всё ещё лидирует, а content-based — обгоняет item-CF: вот где проявляется его козырь, ведь он опирается на признаки фильма, а не на чужие оценки, которых у нишевого фильма мало. За это «удержание на хвосте» мы и платим сложностью моделей.
А на малоактивных пользователях разрыв обратный: персональные модели (item-CF, MF) заметно обходят popularity — даже тонкого профиля хватает, чтобы победить «средние хиты». Важная оговорка: это верно для нашего датасета и порога ≤ 30. У настоящего cold-start-пользователя с 1–2 событиями item-CF и MF уже нестабильны — здесь же у людей всё-таки есть какая-то история.
Это главный вывод фазы: одно усреднённое число обманчиво. Сравнивать модели нужно по сегментам и по нескольким метрикам сразу — как на странице метрик и в описании протокола.