DIAGNOSTIC EVALUATION PROTOCOL FOR GRAPH-SEMANTIC RECOMMENDER MODELS UNDER SPARSE DATA
Введение
В исследованиях рекомендательных систем новые модели часто сравнивают по агрегированным метрикам ранжирования. Такой подход удобен, но не всегда объясняет природу результата: высокое значение метрики может быть связано не только с архитектурой модели, но и с особенностями данных, семантической близостью объектов или популярностным смещением.
Для графовых рекомендательных моделей это особенно заметно. LightGCN остается сильной базовой моделью совместной фильтрации [1], а NCL усиливает графовые представления контрастивным обучением [2]. Современные обзоры фиксируют устойчивый интерес к графовым нейронным сетям в рекомендательных задачах [3]. Однако корректное сравнение таких моделей требует единого разбиения данных, полного ранжирования или корректной выборки негативных объектов и сопоставимых настроек обучения [4, 5]. Дополнительную неопределенность вносит популярностное смещение: оно проявляется уже в простых стратегиях переранжирования [6] и подробно обсуждается в современных обзорах [7, 8]. Содержательные признаки объектов – текст, категории и метаданные – также могут становиться самостоятельным источником высокого качества без полноценного графового обучения. Это видно в классических гибридных подходах [9, 10]. Сходная проблема сохраняется и в современных работах о самоконтролируемом и контрастивном обучении в рекомендательных системах [11, 12].
Причинная и контрфактическая оценка рекомендаций глубже анализирует смещения, но обычно требует информации о политике показа, вероятностях экспозиции или пользовательском эксперименте [13, 14]. В рассматриваемой постановке таких данных нет. Поэтому акцент сделан на автономном диагностическом протоколе, который различает семантическое доминирование, популярностное доминирование, эмпирическое превосходство относительно контролей, смешанный режим и отрицательный перенос.
В российских публикациях последних лет близкие вопросы обсуждаются в работах об архитектурах рекомендательных систем [15] и графовых нейронных сетях в электронной коммерции [16]. Отдельно рассматриваются метрики качества рекомендаций [17], холодный старт, разреженность данных и коррекция релевантности [18, 19]. Для предлагаемого протокола важна эта методическая линия: результат модели рассматривается не как одно число, а как следствие условий эксперимента.
Под диагностическим протоколом далее понимается не новая метрика, а последовательность проверок, сопровождающих основное сравнение моделей. Протокол отделяет случай, когда семантическая ветвь действительно помогает низкосвязным объектам, от ситуации, когда высокое качество уже достигается без обучения графовой модели.
Цель исследования – разработать компактный диагностический протокол для интерпретации результатов графово-семантических рекомендательных моделей при разреженных данных и проверить его на нескольких предметных областях с различной ролью семантических признаков и популярностного смещения.
Материалы и методы исследования
Проверка протокола выполнена на экспериментальных срезах Amazon Books, Movies и Yelp. Исходные данные доступны соответственно по адресам https://www.kaggle.com/datasets/mohamedbakhet/amazon-books-reviews, https://www.kaggle.com/datasets/rounakbanik/the-movies-dataset и https://business.yelp.com/data/resources/open-dataset/. Amazon Books используется как каталог с текстово выраженными свойствами объектов и контролируемой разреженностью пользовательских историй, сокращенный срез Movies – как мультимедийный случай с отрицательным результатом, сокращенный срез Yelp – как пример сильного популярностного смещения. Семантические признаки строились по текстовым описаниям и метаданным с использованием Sentence-BERT [20]; применялась модель all-MiniLM-L6-v2, доступная по адресу https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2.
В табл. 1 приведены характеристики основных рабочих экспериментальных срезов. Исходный Amazon дополнительно используется как проверочный случай семантического доминирования, поэтому его результаты представлены отдельно в разделе результатов и не смешиваются со сводной характеристикой основных рабочих срезов.
Таблица 1
Характеристики экспериментальных срезов данных
|
Набор данных |
Пользователи |
Объекты |
Взаимодействия |
Среднее на пользователя |
Медиана на пользователя |
|
Amazon, минимум 5 |
1 433 |
6 841 |
13 670 |
9,539 |
7 |
|
Movies, сокращенный срез |
265 879 |
6 387 |
3 307 732 |
12,441 |
9 |
|
Yelp, сокращенный срез |
895 930 |
44 733 |
1 143 545 |
1,276 |
1 |
Примечание: составлена авторами на основе подготовленных экспериментальных срезов данных.
В экспериментальную схему включены BPR-MF [21], LightGCN, NCL, AsymLightGCN, семантический контроль и популярностный контроль. Эксперименты проводились в среде RecBole [22, 23]. Для Amazon, минимум 5, основные результаты агрегировались по шести начальным состояниям генератора случайных чисел: 42, 43, 44, 45, 46 и 47. Для сокращенных срезов Movies и Yelp использовались три начальных состояния: 42, 43 и 44.
AsymLightGCN в этой статье не рассматривается как самостоятельный предмет архитектурного анализа; модель используется как проверяемый графово-семантический метод. LightGCN-часть формирует пользовательский вектор eu и коллаборативный вектор объекта gi, семантический вектор si проецируется в латентное пространство zi = Ps(si), а итоговое объектное представление задается смесью
,
где вес wi экспоненциально убывает с ростом степени объекта ci. При ранжировании используется
, γ = 0,25.
В отличие от LightGCN, модель изменяет объектное представление с учетом семантики и степени объекта, добавляет прототипную семантическую составляющую функции потерь и калибрует норму объектного вектора при ранжировании. Общая функция потерь имеет вид
(1)
где qbpr и qsem – обучаемые коэффициенты балансировки, а Lsem – кросс-энтропийная потеря классификации объекта по семантическим прототипам с зависящей от степени температурой и порогом отключения для уже близких прототипу объектов. Точное выражение для wi и Lsem, псевдокод, конфигурации зарегистрированных запусков, программы подготовки данных и векторных представлений, контрольные суммы подготовленных таблиц и статистическая обработка приведены в публичном репозитории воспроизводимости: https://github.com/nIBOP/asym-lightgcn-reproducibility. Исходные наборы данных не включаются в пакет реализации; они восстанавливаются по открытым страницам источников с сохранением указанных фильтров и контрольных статистик срезов.
В формуле (1) L_BPR обозначает попарную ранжирующую потерю BPR, Θ – совокупность обучаемых параметров модели, а λ – коэффициент L2-регуляризации. Множители exp(-q_bpr) и exp(-q_sem) задают обучаемые относительные веса двух составляющих; слагаемые q_bpr и q_sem ограничивают их неограниченное изменение. Такая параметризация соответствует принципу взвешивания задач через обучаемую неопределенность [24].
Для всех обучаемых моделей применялись случайное разбиение 80/10/10, полное ранжирование с исключением обучающих объектов, метрики Recall@10, NDCG@10, Recall@50 и NDCG@50, алгоритм Adam с шагом обучения 0,001, один отрицательный объект на положительный, размерность векторных представлений 64, максимум 90 эпох, размер пакета 8192, оценка каждые 15 эпох и ранняя остановка после двух проверок без улучшения. Для LightGCN и AsymLightGCN использовались два графовых слоя и reg_weight=10–5. Специальные параметры NCL и AsymLightGCN зафиксированы в конфигурациях зарегистрированных запусков в публичном репозитории. Диагностический протокол включает проверку разбиения, расчет основных метрик, семантический и популярностный контроль, стратификацию объектов по популярности и проверку устойчивости ключевых сравнений.
Семантический контроль строит профиль пользователя как среднее семантических векторов объектов из его обучающей истории и ранжирует кандидатов по косинусной близости:
(2)
где pu обозначает семантический профиль пользователя u,
– множество объектов из обучающей истории этого пользователя,
– число таких объектов, а si и sj – семантические векторы объектов, построенные по их содержательным признакам. Все известные пользователю объекты исключаются из списка кандидатов до расчета метрик.
Первое выражение в формуле (2) задает профиль как среднее векторных представлений объектов из обучающей истории. Второе выражение вычисляет косинусную близость профиля и объекта: в числителе находится их скалярное произведение, в знаменателе – произведение евклидовых норм. Чем ближе значение к единице, тем выше семантическое соответствие объекта истории пользователя. Этот показатель используется только как контроль и не обучается совместно с проверяемыми моделями.
Популярностный контроль упорядочивает кандидатов по числу обучающих взаимодействий объекта. В обоих контролях используется то же разбиение и то же множество кандидатов, что и для обучаемых моделей. Режим определялся по четырем метрикам Recall@10, NDCG@10, Recall@50 и NDCG@50. Семантическое доминирование фиксировалось, если Semantic-only был не ниже проверяемой модели не менее чем по трем из четырех метрик; популярностное доминирование определялось по тому же правилу для MostPopIndependent. Различие считалось практически малым, если

и интервал парной разности включал ноль; порог 5 % применялся ко всем сравнениям как единая операционная граница практической эквивалентности. Эмпирическое превосходство относительно контролей допускалось при положительной разности не менее чем по трем метрикам, включая Recall@10, причем нижняя граница интервала для Recall@10 должна была быть больше нуля. Если эти условия не выполнялись одинаково для разных метрик, значений К или сегментов объектов, результат относился к смешанному режиму. Отрицательный перенос фиксировался, если новая модель уступала графовому базовому методу не менее чем по трем из четырех метрик.
Результаты исследования и их обсуждение
В табл. 2 показано, как меняется интерпретация при фильтрации Amazon по минимальному числу взаимодействий пользователя. В исходном Amazon семантический контроль слишком силен, поэтому этот вариант не подходит как основной аргумент в пользу графового обучения. Amazon, минимум 5, дает более содержательный сценарий: AsymLightGCN превосходит LightGCN и NCL по метрикам полноты, но семантический контроль остается сильным по раннему ранжированию.
Для проверки устойчивости использовались парные сравнения по начальным состояниям генератора случайных чисел. Для Amazon, минимум 5, дополнительно пересчитаны пользовательские разности метрик: разности усреднялись по шести повторным запускам, после чего по 10 000 бутстрэп-выборок пользователей строился 95 %-й процентильный интервал и выполнялись критерии Уилкоксона и знаков. Для Movies и Yelp приведены 95 %-е t-интервалы среднего парного различия и точный двусторонний знаковый критерий по трем повторным запускам. При трех парах минимальное возможное двустороннее значение этого критерия равно 0,250, поэтому результаты для Movies и Yelp используются как диагностические, а не как самостоятельное строгое доказательство.
В табл. 3 приведена сводная статистическая проверка ключевых сравнений.
Фильтрация Amazon по минимальному числу взаимодействий меняет диагностический режим: в исходном Amazon семантическая близость объектов сама по себе объясняет слишком большую часть качества, а в варианте Amazon, минимум 5, графовые базовые модели становятся сильнее. Поэтому здесь не следует говорить о полном превосходстве модели; корректнее фиксировать область, где семантическая поддержка увеличивает полноту рекомендаций относительно LightGCN и NCL в автономной оценке.
Сокращенный срез Yelp демонстрирует популярностное доминирование: AsymLightGCN выше LightGCN по Recall@10 (0,0109 против 0,0082), но ниже MostPopIndependent (0,0210). Поэтому результаты на данном срезе не подтверждают практическое превосходство графово-семантической модели; здесь прежде всего проявляется популярностное смещение.
Сокращенный срез Movies рассматривается как мультимедийный случай с отрицательным результатом: AsymLightGCN уступает LightGCN по Recall@10 (0,1704 против 0,2024), а семантический контроль практически не работает (0,0015). Этот результат фиксирует границу применимости: наличие содержательных признаков не гарантирует полезности семантического вмешательства, если пользовательские предпочтения лучше восстанавливаются по структуре взаимодействий.
Стратификация уточняет, какие именно объекты попадают в рекомендации. На Amazon, минимум 5, AsymLightGCN получает Recall@10 по редким объектам 0,0409 против 0,0008 у LightGCN и 0,0011 у NCL.
Таблица 2
Результаты на вариантах Amazon
|
Вариант данных |
Метод |
Начальные состояния |
Recall@10 |
NDCG@10 |
Recall@50 |
NDCG@50 |
|
Исходный Amazon |
Semantic-only |
42 |
0,2490 |
0,2201 |
0,2808 |
0,2274 |
|
Исходный Amazon |
LightGCN |
42 |
0,0116 |
0,0058 |
0,0423 |
0,0123 |
|
Исходный Amazon |
NCL |
42 |
0,0151 |
0,0072 |
0,0395 |
0,0124 |
|
Исходный Amazon |
AsymLightGCN |
42 |
0,1141 |
0,0629 |
0,2164 |
0,0853 |
|
Amazon, минимум 5 |
MostPop Independent |
42/43/44/45/46/47 |
0,0282 ± 0,0037 |
0,0133 ± 0,0020 |
0,0851 ± 0,0066 |
0,0256 ± 0,0024 |
|
Amazon, минимум 5 |
Semantic-only |
42/43/44/45/46/47 |
0,0441 ± 0,0062 |
0,0287 ± 0,0053 |
0,0854 ± 0,0058 |
0,0378 ± 0,0051 |
|
Amazon, минимум 5 |
BPR-MF |
42/43/44/45/46/47 |
0,0181 ± 0,0042 |
0,0097 ± 0,0024 |
0,0415 ± 0,0064 |
0,0149 ± 0,0027 |
|
Amazon, минимум 5 |
LightGCN |
42/43/44/45/46/47 |
0,0311 ± 0,0036 |
0,0175 ± 0,0025 |
0,0878 ± 0,0026 |
0,0300 ± 0,0019 |
|
Amazon, минимум 5 |
NCL |
42/43/44/45/46/47 |
0,0326 ± 0,0052 |
0,0177 ± 0,0028 |
0,0906 ± 0,0041 |
0,0304 ± 0,0022 |
|
Amazon, минимум 5 |
AsymLightGCN |
42/43/44/45/46/47 |
0,0465 ± 0,0059 |
0,0232 ± 0,0035 |
0,1297 ± 0,0070 |
0,0413 ± 0,0038 |
Примечание: составлена авторами по результатам экспериментальной оценки моделей; для шести повторных запусков приведены среднее значение и выборочное стандартное отклонение.
Таблица 3
Сводная статистическая проверка ключевых сравнений
|
Сценарий |
Сравнение |
Проверка по метрикам Recall@10; NDCG@10; Recall@50; NDCG@50 |
Диагностический вывод |
|
Amazon, минимум 5 |
AsymLightGCN – LightGCN |
+0, 0154 [0,0096; 0,0211]; +0, 0057 [0,0022; 0,0093]; +0, 0420 [0,0329; 0,0513]; +0, 0112 [0,0074; 0,0151] |
Устойчиво выше графовой базы |
|
Amazon, минимум 5 |
AsymLightGCN – NCL |
+0, 0139 [0, 0080; 0, 0200]; +0, 0055 [0,0021; 0,0090]; +0, 0391 [0, 0300; 0, 0484]; +0, 0109 [0,0073; 0,0146] |
Устойчиво выше NCL |
|
Amazon, минимум 5 |
AsymLightGCN – Semantic–only |
+0, 0024 [–0, 0057; 0, 0101]; –0, 0055 [–0, 0111; –0, 0001]; +0, 0443 [0,0328; 0,0559]; +0, 0035 [–0, 0022; 0, 0091] |
Смешанный режим: выигрыш по охвату, но не по раннему NDCG |
|
Movies, сокращенный срез |
AsymLightGCN – LightGCN |
–0, 0320 [–0, 0405; –0, 0235]; –0, 0197 [–0, 0250; –0, 0144]; –0, 0443 [–0,0513; –0,0373]; –0, 0227 [–0, 0277; –0, 0178] |
Отрицательный перенос во всех ключевых метриках |
|
Yelp, сокращенный срез |
AsymLightGCN – LightGCN |
+0, 0026 [0,0008; 0,0045]; +0, 0013 [–0, 0001; 0, 0028]; +0, 0039 [0, 0030; 0, 0047]; +0, 0017 [0,0008; 0,0026] |
Выше LightGCN, но требуется контроль популярности |
|
Yelp, сокращенный срез |
AsymLightGCN – MostPopIndependent |
–0, 0101 [–0, 0114; –0, 0089]; –0, 0050 [–0, 0060; –0, 0040]; –0, 0329 [–0,0347; –0,0311]; –0, 0098 [–0, 0103; –0, 0092] |
Популярностное доминирование |
Примечание: составлена авторами по результатам статистической обработки. Для Amazon приведены пользовательские бутстрэп-интервалы; для Movies и Yelp – интервалы по трем парным повторным запускам, которые характеризуют только направление различий. Полные таблицы по предметным областям и файлы статистической обработки приведены в публичном репозитории воспроизводимости.

Доля рекомендаций непопулярных объектов в первых десяти рекомендациях Примечание: составлен авторами по результатам стратифицированного анализа
На сокращенном срезе Movies модель увеличивает долю непопулярных рекомендаций, но не получает релевантных попаданий в этом сегменте. На сокращенном срезе Yelp доля непопулярных рекомендаций у AsymLightGCN выше, чем у LightGCN, однако агрегированное качество остается ниже популярностного контроля.
Доля рекомендаций непопулярных объектов в первых десяти позициях выдачи для рассматриваемых методов представлена на рисунке.
В сводной интерпретации исходный Amazon относится к семантическому доминированию, Amazon, минимум 5, – к смешанному режиму с эмпирическим превосходством по охвату, Movies – к отрицательному переносу, а Yelp – к популярностному доминированию. Поэтому положительный вывод допустим только для Amazon, минимум 5, и только с указанием роли семантического контроля.
Результаты показывают, что один и тот же численный прирост может иметь разные объяснения. На Amazon, минимум 5, AsymLightGCN улучшает графовые базовые модели по полноте ранжирования, но часть раннего ранжирования остается объяснимой семантическим контролем. На Yelp агрегированные метрики связаны с популярностью объектов, а на Movies отрицательный результат фиксирует границу применимости графово-семантического вмешательства. Поэтому протокол работает как предварительный фильтр: он показывает, когда результат можно рассматривать как основание для дальнейшей проверки в пользовательском эксперименте, а когда вывод должен оставаться диагностическим.
Область применимости протокола ограничена несколькими условиями. Во-первых, все эксперименты относятся к автономной оценке и не заменяют проверки пользовательского эффекта в рабочей среде. Во-вторых, применялось случайное разбиение 80/10/10, а не временной протокол. В-третьих, пользовательские бутстрэп- и непараметрические проверки проведены для Amazon, минимум 5; Movies и Yelp проверялись по парным повторным запускам и поэтому интерпретируются осторожнее. В-четвертых, NCL на сокращенных срезах Movies и Yelp не используется как центральное доказательство из-за неполной серии повторных запусков. Наконец, протокол не является причинной оценкой: он диагностирует источники качества, но не восстанавливает контрфактический эффект рекомендационной политики.
Заключение
Предложен диагностический протокол оценки графово-семантических рекомендательных моделей при разреженных данных. Он объединяет полное ранжирование, семантический и популярностный контроль, стратификацию по популярности объектов и проверку устойчивости ключевых сравнений. На исходном Amazon, Amazon с минимальным числом взаимодействий 5, а также на сокращенных срезах Movies и Yelp видно, что агрегированные метрики нельзя интерпретировать без дополнительных контролей. Наиболее содержательный положительный сценарий выявлен на Amazon, минимум 5, где AsymLightGCN улучшает полноту рекомендаций относительно LightGCN и NCL. Результаты на Movies и Yelp, напротив, обозначают границы применимости: в одном случае возникает отрицательный перенос, в другом качество сильнее объясняется популярностным контролем. Работа не утверждает универсальное преимущество конкретной модели, а задает воспроизводимую процедуру различения источников полученного качества.
Conflict of Interest
Funding
Bibliographic Reference
URL: https://top-technologies.ru/en/article/view?id=40899 (accessed: 04/09/2026).
DOI: https://doi.org/10.17513/snt.40899
