Сравнение моделей
Все модели курса на одном протоколе, рядом. Выбери метрику и сравни — а главное, посмотри, как меняется картина на узких срезах: хвост каталога и малоактивные пользователи. Заодно увидишь, чего на таких срезах измерить нельзя.
▸Почему нельзя выбрать модель по одной средней метрике
Узкие срезы: хвост каталога и малоактивные пользователи
Средняя метрика «по всем» прячет важное. Модель может выглядеть прилично в среднем, но разваливаться там, где данных мало. Поэтому мы считаем те же метрики ещё и на двух узких сегментах, где сигнала меньше.
⚠️ Это не настоящий cold-start
Полный production cold-start — это айтем/пользователь без взаимодействий вовсе. У нас же фильмы и люди со скудной, но ненулевой историей: это low-signal-срезы, учебная аппроксимация ситуаций, где данных мало, а не строгий cold-start.
Почему границы теперь квантильные
Раньше здесь стояло «≤ 60 оценок», и объяснение было честным до неприличия: на более строгой границе не попадала ни одна модель, «поэтому планка чуть выше, чтобы был виден контраст». Это значит, что срез выбран после просмотра результатов, а потом на нём же построен вывод о поведении моделей в хвосте. Разбор — в разделе ниже, и он поучительнее прежнего вывода.
Срезы не взаимоисключающие: один пользователь может попасть и в срез хвоста (его спрятанный фильм нишевый), и в срез малоактивных (у него самого мало оценок). Размеры срезов также видны в шапке таблицы выше.
Как читать таблицу
- Выбери метрику в выпадающем списке.
- Сначала сравни модели в колонке «Все пользователи».
- Потом — тех же моделей на «Хвосте каталога».
- Потом — на «Малоактивных пользователях».
- Не выбирай модель по одной метрике: accuracy, coverage, novelty и diversity отвечают на разные вопросы.
На что смотреть
В колонке «Хвост каталога» у всех моделей стоят нули — и это не поломка, а результат. Ни одна модель курса не достала из Top-10 ни одного фильма вне головного дециля. Вывод отсюда ровно один: на этих данных про хвост нельзя сказать ничего — ни «MF его удерживает», ни «content-based выигрывает». Чтобы про хвост что-то измерить, нужен либо каталог поменьше, либо лог побольше, либо другая постановка задачи.
На малоактивных пользователях точечные числа у персональных моделей выше, чем у popularity. Но срез — 73 человека, и по разнице средних тут выводов не делают: интервалы для обоих сравнений — в разделе ниже, и они расходятся между собой.
Это главный вывод фазы: одно усреднённое число обманчиво. Сравнивать модели нужно по сегментам и по нескольким метрикам сразу — как на странице метрик и в описании протокола.
Хвост каталога: сколько попаданий на самом деле
Малоактивные пользователи: что выдерживает интервал
Конфигурация обучения
Всё, что нужно, чтобы повторить числа на этой странице. Значения читаются из самих обученных моделей, а не набраны в вёрстке, — разойтись с кодом они не могут.
Что дальше
Чем продолжить — прямых наследников у модуля нет — это следующий шаг по карте
До финальной сборки не хватает ещё 9 модулей по этому пути.
Порядок здесь — рекомендация из карты курса, ничего не блокируется. Отметка «прочитано» хранится только в этом браузере.
Источники
- Are We Really Making Much Progress?M. F. Dacrema, P. Cremonesi, D. Jannach · 2019 · статьяметодика сравнения: один протокол, настроенные baseline, срезы вместо одного агрегата
- On Sampled Metrics for Item RecommendationW. Krichene, S. Rendle · 2020 · статьяпочему сравнивать можно только внутри одного протокола