Главная
АИ #39 (325)
Статьи журнала АИ #39 (325)
Выделение аспектов пользовательских отзывов на основе тематического моделировани...

Выделение аспектов пользовательских отзывов на основе тематического моделирования с использованием модели LDA

Цитирование

Сорокин П. В., Базунов А. И., Жимолостнова А. В. Выделение аспектов пользовательских отзывов на основе тематического моделирования с использованием модели LDA // Актуальные исследования. 2026. №39 (325). URL: https://apni.ru/article/16069-vydelenie-aspektov-polzovatelskih-otzyvov-na-osnove-tematicheskogo-modelirovaniya-s-ispolzovaniem-modeli-lda

Аннотация статьи

Предложен подход к автоматическому выделению аспектов пользовательских отзывов на основе тематического моделирования. На наборе из более чем 32 тысяч отзывов выполнены предобработка текстов, построение тематической модели LDA и подбор оптимального количества тем по метрикам когерентности и перплексии. Проведено сравнение результатов тематического моделирования с кластеризацией текстов методом K-Means. Показано, что модель LDA обеспечивает более интерпретируемое выделение аспектов, связанных с качеством товаров, размером одежды, работой электронных устройств, сборкой мебели, возвратом и комплектацией заказов.

Текст статьи

Современные платформы электронной коммерции аккумулируют значительные объёмы пользовательских отзывов о качестве товаров, соответствии заявленным характеристикам и обслуживании. Их анализ позволяет выявлять причины удовлетворённости покупателей и проблемные характеристики продукции.

Анализ тональности определяет эмоциональную окраску текста, однако не позволяет установить, какие характеристики товара обусловили оценку пользователя [9, с. 5731-5780; 11, с. 1834-1848]. Для решения этой задачи применяются методы аспектно-ориентированного анализа тональности (ABSA), выделяющие аспекты объекта и отношение к ним [2, с. 5543-5574; 7, с. 7261-7303]. Многие подобные решения требуют размеченных данных, подготовка которых связана со значительными затратами.

Альтернативой является тематическое моделирование на основе Latent Dirichlet Allocation (LDA), позволяющее выявлять скрытые темы без предварительной разметки [1, с. 993-1022; 4, с. 15169-15211]. Его применение к анализу текстовых коллекций рассматривается в работе [10, ст. 120114], а вопросы интерпретации и оценки тем – в [8, с. 662-675]. Для группировки документов также используется K-Means [5, с. 1-9], однако получаемые кластеры не всегда обладают достаточной интерпретируемостью.

Целью работы является исследование возможности применения LDA для автоматического выделения аспектов пользовательских отзывов и сравнение результатов с кластеризацией методом K-Means.

Модель LDA рассматривает каждый документ как смесь скрытых тем, а каждую тему – как распределение вероятностей слов. Наиболее вероятные слова используются для содержательной интерпретации темы как аспекта отзыва. В отличие от K-Means, относящего документ к одному кластеру, LDA позволяет учитывать несколько аспектов в одном сообщении.

Качество модели оценивалось по перплексии и когерентности [6, с. 262-272]. Перплексия характеризует способность модели описывать наблюдаемые данные, а когерентность – смысловую связность слов внутри темы. Число тем выбиралось на основе совместного анализа метрик и содержательной интерпретации результатов.

Исходный набор содержал 58531 отзыв о 793 товарах. Для каждой записи были доступны наименование товара, текст, пятибалльная оценка, результат предварительной классификации и описание класса. Основным объектом анализа являлся текст отзыва. В наборе преобладала оценка 5: 36758 записей. Средняя длина отзыва составляла около 89 символов, медианная – около 60, что затрудняло выделение аспектов по ограниченному контексту.

Предобработка данных и построение признакового пространства. Тексты приводились к нижнему регистру; удалялись пунктуация, специальные символы, HTML-фрагменты, ссылки и числовые значения. Затем выполнялись токенизация, лемматизация и удаление стоп-слов. После исключения дубликатов, некорректных записей и текстов с недостаточным количеством информативных терминов рабочая выборка составила 32897 отзывов.

Числовое представление формировалось с помощью CountVectorizer [3, с. 16-19]. В словарь включались слова и биграммы, встречающиеся не менее чем в 16 документах. Биграммы, в том числе «цена-качество», «приятный-тело» и «быстрая-доставка», позволяли сохранить контекст устойчивых словосочетаний. Это позволило исключить редкие термины, опечатки и случайные слова.

Например, отзыв «Товар пришёл быстро, упаковка целая, но размер не подошёл и пришлось оформить возврат денег» после предобработки преобразовывался в набор «упаковка целый размер возврат-денег». Такой набор сохраняет основные аспекты пользовательского опыта.

Подбор оптимального количества тем и сценарии экспериментов. Были рассмотрены три варианта признакового пространства: униграммы, биграммы и их совместное использование. Последний вариант обеспечил наиболее интерпретируемые результаты. При использовании только униграмм терялась часть контекста, а только биграмм – формировалось много служебных конструкций.

Для определения числа тем построены модели с 5, 8, 10, 12, 15 и 20 темами. Значения перплексии составили соответственно 663,66; 668,51; 675,77; 662,47; 668,38 и 695,95, когерентности – 0,569; 0,548; 0,555; 0,523; 0,471 и 0,450.

Максимальная когерентность наблюдалась при пяти темах, однако отдельные аспекты объединялись в слишком крупные группы. Модель с десятью темами также превосходила модель с восемью темами по когерентности, но часть тематик дублировалась и хуже интерпретировалась экспертно. Поэтому для дальнейшего анализа выбрана модель с восемью темами как компромисс между качеством и интерпретируемостью.

Результаты тематического моделирования. Для каждой темы итоговой модели определены наиболее вероятные слова и биграммы, на основе которых выполнена интерпретация аспектов (табл.).

Таблица

Выделенные аспекты пользовательских отзывов

№ темы

Интерпретация аспекта

Характерные слова и биграммы

1

Брак, возврат и проблемы с заказом

деньга, продавец, возврат, упаковка, брак, коробка

2

Материал, ткань и комфорт одежды

приятный, ткань, мягкий, тело, костюм, тёплый

3

Размер, качество и соответствие одежды

размер, качество, рост, платье, джинсы, длина

4

Запах, эффект и опыт использования

запах, вода, кожа, эффект, результат, использование

5

Сборка мебели, комплектность и получение

стол, сборка, полка, ножка, доставка, упаковка

6

Работа устройства, зарядка и звук

наушник, зарядка, звук, телефон, не_работает

7

Детали, крепления и состояние комплекта

комод, деталь, крепление, ящик, скол

8

Размер, рост и посадка одежды

рост, нога, куртка, размер, носка, длинный

Несколько тем относятся к одежде, широко представленной в исследуемой коллекции. Наряду с характеристиками товаров модель выделила аспекты обслуживания: тема «Брак, возврат и проблемы с заказом» объединяет термины «возврат», «брак», «продавец» и «упаковка».

Анализ отдельных документов показал соответствие выделенным аспектам: отзыв о кулере для телефона отнесён к теме «Работа устройства, зарядка и звук» с вероятностью 0,865, а отзыв о повреждённой упаковке с негативной оценкой продавца – к теме «Брак, возврат и проблемы с заказом» с вероятностью 0,875. Для отзыва о кулере со смешанным содержанием вероятность основной темы составила 0,536, остальные значения распределились между другими темами.

Сравнение результатов тематического моделирования и кластеризации K-Means. Кластеризация выполнялась на TF-IDF матрице размерностью 32897 × 2181; число кластеров составило восемь. Для каждой группы анализировались наиболее значимые термины.

Кластеры № 2, № 3 и № 6 объединяли преимущественно отзывы об электронных устройствах, мебели и одежде соответственно. Вместе с тем кластер № 1 содержал термины качества, возврата, внешнего вида и материалов, а кластер № 4 – цены, удобства и качества. Такое смешение затрудняло интерпретацию аспектов. В проведённых экспериментах LDA обеспечила более чёткое выделение характеристик товаров и пользовательского опыта с учётом нескольких тем в одном отзыве.

Полученные результаты подтверждают возможность автоматического выделения аспектов пользовательских отзывов без размеченных данных. Предложенный подход может применяться для мониторинга качества товаров и анализа факторов удовлетворённости покупателей. Перспективным направлением является объединение тематического моделирования с аспектно-ориентированным анализом тональности для определения отношения пользователей к выделенным аспектам.

Список литературы

  1. Blei D.M., Ng A.Y., Jordan M.I. Latent Dirichlet Allocation // Journal of Machine Learning Research. – 2003. – Vol. 3. – P. 993-1022.
  2. D’aniello G., Gaeta M., La Rocca I. KnowMIS-ABSA: an overview and a reference model for applications of sentiment analysis and aspect-based sentiment analysis // Artificial Intelligence Review. – 2022. – Vol. 55. – No. 7. – P. 5543-5574.
  3. Goyal R. Evaluation of rule-based, CountVectorizer, and Word2Vec machine learning models for tweet analysis to improve disaster relief //2021 IEEE Global Humanitarian Technology Conference (GHTC). – IEEE, 2021. – С. 16-19.
  4. Jelodar H., Wang Y., Yuan C. et al. Latent Dirichlet Allocation (LDA) and topic modeling: models, applications, a survey // Multimedia Tools and Applications. – 2019. – Vol. 78. – No. 11. – P. 15169-15211.
  5. Kwale F.M. A critical review of K-means text clustering algorithms // International Journal of Advanced Research in Computer Science. – 2013. – Vol. 4. – No. 9. – P. 1-9.
  6. Mimno D., Wallach H.M., Talley E., Leenders M., McCallum A. Optimizing semantic coherence in topic models // Proceedings of the 2011 Conference on Empirical Methods in Natural Language Processing. – Edinburgh, UK, 2011. – P. 262-272.
  7. Nath D., Dwivedi S.K. Aspect-based sentiment analysis: approaches, applications, challenges and trends // Knowledge and Information Systems. – 2024. – Vol. 66. – No. 12. – P. 7261-7303.
  8. Omar M., Talha M., Morshed M. et al. LDA topics: Representation and evaluation // Journal of Information Science. – 2015. – Vol. 41. – No. 5. – P. 662-675.
  9. Wankhade M., Rao A.C.S., Kulkarni C. A survey on sentiment analysis methods, applications, and challenges // Artificial Intelligence Review. – 2022. – Vol. 55. – No. 7. – P. 5731-5780.
  10. Yu D., Xiang B. Discovering topics and trends in the field of Artificial Intelligence: Using LDA topic modeling // Expert Systems with Applications. – 2023. – Vol. 225. – Art. 120114.
  11. Zhao Y.Y., Qin B., Liu T. Sentiment analysis // Journal of Software. – 2010. – Vol. 21. – No. 8. – P. 1834-1848.

Поделиться

27
Обнаружили грубую ошибку (плагиат, фальсифицированные данные или иные нарушения научно-издательской этики)? Напишите письмо в редакцию журнала: info@apni.ru

Похожие статьи

Другие статьи из раздела «Технические науки»

Все статьи выпуска
Актуальные исследования

#39 (325)

Прием материалов

19 сентября - 25 сентября

осталось 3 дня

Размещение PDF-версии журнала

30 сентября

Размещение электронной версии статьи

сразу после оплаты

Рассылка печатных экземпляров

14 октября