Современные платформы электронной коммерции аккумулируют значительные объёмы пользовательских отзывов о качестве товаров, соответствии заявленным характеристикам и обслуживании. Их анализ позволяет выявлять причины удовлетворённости покупателей и проблемные характеристики продукции.
Анализ тональности определяет эмоциональную окраску текста, однако не позволяет установить, какие характеристики товара обусловили оценку пользователя [9, с. 5731-5780; 11, с. 1834-1848]. Для решения этой задачи применяются методы аспектно-ориентированного анализа тональности (ABSA), выделяющие аспекты объекта и отношение к ним [2, с. 5543-5574; 7, с. 7261-7303]. Многие подобные решения требуют размеченных данных, подготовка которых связана со значительными затратами.
Альтернативой является тематическое моделирование на основе Latent Dirichlet Allocation (LDA), позволяющее выявлять скрытые темы без предварительной разметки [1, с. 993-1022; 4, с. 15169-15211]. Его применение к анализу текстовых коллекций рассматривается в работе [10, ст. 120114], а вопросы интерпретации и оценки тем – в [8, с. 662-675]. Для группировки документов также используется K-Means [5, с. 1-9], однако получаемые кластеры не всегда обладают достаточной интерпретируемостью.
Целью работы является исследование возможности применения LDA для автоматического выделения аспектов пользовательских отзывов и сравнение результатов с кластеризацией методом K-Means.
Модель LDA рассматривает каждый документ как смесь скрытых тем, а каждую тему – как распределение вероятностей слов. Наиболее вероятные слова используются для содержательной интерпретации темы как аспекта отзыва. В отличие от K-Means, относящего документ к одному кластеру, LDA позволяет учитывать несколько аспектов в одном сообщении.
Качество модели оценивалось по перплексии и когерентности [6, с. 262-272]. Перплексия характеризует способность модели описывать наблюдаемые данные, а когерентность – смысловую связность слов внутри темы. Число тем выбиралось на основе совместного анализа метрик и содержательной интерпретации результатов.
Исходный набор содержал 58531 отзыв о 793 товарах. Для каждой записи были доступны наименование товара, текст, пятибалльная оценка, результат предварительной классификации и описание класса. Основным объектом анализа являлся текст отзыва. В наборе преобладала оценка 5: 36758 записей. Средняя длина отзыва составляла около 89 символов, медианная – около 60, что затрудняло выделение аспектов по ограниченному контексту.
Предобработка данных и построение признакового пространства. Тексты приводились к нижнему регистру; удалялись пунктуация, специальные символы, HTML-фрагменты, ссылки и числовые значения. Затем выполнялись токенизация, лемматизация и удаление стоп-слов. После исключения дубликатов, некорректных записей и текстов с недостаточным количеством информативных терминов рабочая выборка составила 32897 отзывов.
Числовое представление формировалось с помощью CountVectorizer [3, с. 16-19]. В словарь включались слова и биграммы, встречающиеся не менее чем в 16 документах. Биграммы, в том числе «цена-качество», «приятный-тело» и «быстрая-доставка», позволяли сохранить контекст устойчивых словосочетаний. Это позволило исключить редкие термины, опечатки и случайные слова.
Например, отзыв «Товар пришёл быстро, упаковка целая, но размер не подошёл и пришлось оформить возврат денег» после предобработки преобразовывался в набор «упаковка целый размер возврат-денег». Такой набор сохраняет основные аспекты пользовательского опыта.
Подбор оптимального количества тем и сценарии экспериментов. Были рассмотрены три варианта признакового пространства: униграммы, биграммы и их совместное использование. Последний вариант обеспечил наиболее интерпретируемые результаты. При использовании только униграмм терялась часть контекста, а только биграмм – формировалось много служебных конструкций.
Для определения числа тем построены модели с 5, 8, 10, 12, 15 и 20 темами. Значения перплексии составили соответственно 663,66; 668,51; 675,77; 662,47; 668,38 и 695,95, когерентности – 0,569; 0,548; 0,555; 0,523; 0,471 и 0,450.
Максимальная когерентность наблюдалась при пяти темах, однако отдельные аспекты объединялись в слишком крупные группы. Модель с десятью темами также превосходила модель с восемью темами по когерентности, но часть тематик дублировалась и хуже интерпретировалась экспертно. Поэтому для дальнейшего анализа выбрана модель с восемью темами как компромисс между качеством и интерпретируемостью.
Результаты тематического моделирования. Для каждой темы итоговой модели определены наиболее вероятные слова и биграммы, на основе которых выполнена интерпретация аспектов (табл.).
Таблица
Выделенные аспекты пользовательских отзывов
№ темы | Интерпретация аспекта | Характерные слова и биграммы |
1 | Брак, возврат и проблемы с заказом | деньга, продавец, возврат, упаковка, брак, коробка |
2 | Материал, ткань и комфорт одежды | приятный, ткань, мягкий, тело, костюм, тёплый |
3 | Размер, качество и соответствие одежды | размер, качество, рост, платье, джинсы, длина |
4 | Запах, эффект и опыт использования | запах, вода, кожа, эффект, результат, использование |
5 | Сборка мебели, комплектность и получение | стол, сборка, полка, ножка, доставка, упаковка |
6 | Работа устройства, зарядка и звук | наушник, зарядка, звук, телефон, не_работает |
7 | Детали, крепления и состояние комплекта | комод, деталь, крепление, ящик, скол |
8 | Размер, рост и посадка одежды | рост, нога, куртка, размер, носка, длинный |
Несколько тем относятся к одежде, широко представленной в исследуемой коллекции. Наряду с характеристиками товаров модель выделила аспекты обслуживания: тема «Брак, возврат и проблемы с заказом» объединяет термины «возврат», «брак», «продавец» и «упаковка».
Анализ отдельных документов показал соответствие выделенным аспектам: отзыв о кулере для телефона отнесён к теме «Работа устройства, зарядка и звук» с вероятностью 0,865, а отзыв о повреждённой упаковке с негативной оценкой продавца – к теме «Брак, возврат и проблемы с заказом» с вероятностью 0,875. Для отзыва о кулере со смешанным содержанием вероятность основной темы составила 0,536, остальные значения распределились между другими темами.
Сравнение результатов тематического моделирования и кластеризации K-Means. Кластеризация выполнялась на TF-IDF матрице размерностью 32897 × 2181; число кластеров составило восемь. Для каждой группы анализировались наиболее значимые термины.
Кластеры № 2, № 3 и № 6 объединяли преимущественно отзывы об электронных устройствах, мебели и одежде соответственно. Вместе с тем кластер № 1 содержал термины качества, возврата, внешнего вида и материалов, а кластер № 4 – цены, удобства и качества. Такое смешение затрудняло интерпретацию аспектов. В проведённых экспериментах LDA обеспечила более чёткое выделение характеристик товаров и пользовательского опыта с учётом нескольких тем в одном отзыве.
Полученные результаты подтверждают возможность автоматического выделения аспектов пользовательских отзывов без размеченных данных. Предложенный подход может применяться для мониторинга качества товаров и анализа факторов удовлетворённости покупателей. Перспективным направлением является объединение тематического моделирования с аспектно-ориентированным анализом тональности для определения отношения пользователей к выделенным аспектам.
.png&w=384&q=75)
.png&w=640&q=75)