Главная
АИ #39 (325)
Статьи журнала АИ #39 (325)
Прогнозирование динамики научных направлений на основе тематического моделирован...

Прогнозирование динамики научных направлений на основе тематического моделирования русскоязычных публикаций

Цитирование

Малин Д. В., Лазарев А. А. Прогнозирование динамики научных направлений на основе тематического моделирования русскоязычных публикаций // Актуальные исследования. 2026. №39 (325). URL: https://apni.ru/article/16070-prognozirovanie-dinamiki-nauchnyh-napravlenij-na-osnove-tematicheskogo-modelirovaniya-russkoyazychnyh-publikacij

Аннотация статьи

Цель исследования – оценить применимость тематического моделирования и прогнозирования для анализа динамики научных направлений. На корпусе из 14737 русскоязычных публикаций использованы латентное размещение Дирихле (LDA), годовая агрегация и модель Prophet. Получены 20 тем; проверка прогнозов двух тем за 2023–2025 годы показала зависимость ошибки от устойчивости тренда и горизонта, что ограничивает применение подхода предварительной оценкой научных тенденций.

Текст статьи

Рост числа научных публикаций затрудняет ручной анализ исследовательской активности. В области информационных технологий быстро меняются терминология и состав направлений, поэтому для выявления тенденций необходима совместная обработка содержания публикаций и сведений о времени их выхода. Цель исследования – разработать и экспериментально проверить подход, связывающий тематическое моделирование русскоязычных научных текстов с прогнозированием публикационной активности.

В качестве базового метода выбрано латентное размещение Дирихле (Latent Dirichlet Allocation, LDA): документ представляется распределением по темам, а тема – распределением по словам [2, с. 993-1022]. Метод позволяет выделять направления без предварительной разметки и интерпретировать их по характерным терминам [3, с. 5228-5235]. Для прогнозирования используется Prophet, описывающий изменение временного ряда и формирующий интервалы неопределённости [10, с. 37-45].

Экспериментальный корпус сформирован на основе данных OpenAlex [8] и включает 14737 русскоязычных публикаций по информационным технологиям за 2008–2025 годы. Использованы записи с заполненными названием и аннотацией, а также корректным годом публикации. Подход объединяет предобработку текстов, выделение тем, подсчёт публикаций по годам и прогнозирование полученных рядов.

Для каждой публикации название и аннотация объединяются в один текст. Предобработка включает перевод символов в нижний регистр, удаление чисел, пунктуации, специальных символов, русских и английских стоп-слов. Лемматизация русскоязычных слов уменьшает вариативность грамматических форм и размерность признакового пространства [1, с. 132-144; 6, с. 320-332].

Признаковое представление строится на униграммах и биграммах. Последние сохраняют устойчивые сочетания, например «машинное обучение» и «информационная безопасность». После обучения LDA каждой публикации назначается тема с наибольшей вероятностью; содержание темы интерпретируется по её ключевым словам. В эксперименте выделено 20 тем.

Качество тематической модели оценивается с помощью разнообразия тем (topic diversity) и средней согласованности на основе нормализованной точечной взаимной информации (NPMI coherence). Первый показатель характеризует различие наборов ключевых слов, второй – их смысловую связанность. Оценка согласованности используется для анализа интерпретируемости тематических моделей [7, с. 262-272; 9, с. 399-408].

После назначения тематических меток публикации группируются по темам и годам. Значением ряда служит количество работ, отнесённых к выбранной теме в соответствующем году. Такой переход связывает содержание корпуса с изменением публикационной активности, но сам по себе не характеризует научное качество или практическую значимость направления.

Для каждой выбранной темы годовые значения передаются в Prophet: год выступает временной меткой, число публикаций – прогнозируемой величиной. Модель формирует ожидаемое значение и нижнюю и верхнюю границы прогноза. Расширение интервала указывает на неопределённость оценки; прогноз роста следует рассматривать как ориентир для последующего содержательного анализа.

Качество прогнозирования проверяется для двух тем с различной динамикой на периоде 2023–2025 годов. Используются абсолютная ошибка, симметричная средняя абсолютная процентная ошибка (SMAPE), взвешенная абсолютная процентная ошибка (WAPE) и средняя абсолютная масштабированная ошибка (MASE) [5, с. 679-688]. Результаты приведены отдельно для каждого года; для одной прогнозной точки средняя абсолютная ошибка (MAE) совпадает с абсолютной ошибкой.

Показатели тематического моделирования приведены в таблице 1. Разнообразие тем 0,605 свидетельствует о частичном различии ключевых слов при сохранении пересечений между темами. Средняя NPMI coherence 0,157 указывает на ограниченную согласованность. Полученное разбиение пригодно для предварительного анализа корпуса, однако не является окончательной классификацией научных направлений.

Таблица 1

Показатели качества тематического моделирования

Показатель

Значение

Topic diversity

0,605

Средняя NPMI coherence

0,157

Пересечение тем может быть связано с общей научной лексикой и близостью терминологии в информационных технологиях. Поэтому тематические метки требуют содержательной интерпретации, а качество последующего прогноза зависит как от временной модели, так и от исходного распределения публикаций по темам.

Для оценки прогнозирования выбраны две темы: первая характеризовалась выраженным ростом активности до 2022 года, вторая – менее устойчивой динамикой и снижением после 2021 года. Фактические и прогнозные значения, а также ошибки представлены в таблице 2.

Таблица 2

Результаты прогнозирования публикационной активности

Тема

Год

Факт

Прогноз

Абс. ошибка

SMAPE, %

WAPE, %

MASE

1

2023

137

129,68

7,32

5,49

5,35

0,54

1

2024

133

137,99

4,99

3,68

3,75

0,37

1

2025

109

146,33

37,33

29,24

34,24

2,75

2

2023

53

60,90

7,90

13,88

14,91

0,99

2

2024

46

64,09

18,09

32,87

39,34

2,28

2

2025

41

67,30

26,30

48,56

64,13

3,31

Для темы 1 абсолютная ошибка составила 7,32 публикации в 2023 году и 4,99 в 2024 году. В 2025 году фактическое число публикаций снизилось до 109, тогда как прогноз достиг 146,33; ошибка выросла до 37,33, а WAPE – до 34,24%. Модель продолжила предшествующий рост и не отразила изменение направления динамики.

Для темы 2 ошибка увеличивалась на всём проверяемом горизонте: с 7,90 до 26,30 публикации, WAPE – с 14,91 до 64,13%. Уже на второй год MASE составила 2,28, тогда как для темы 1 она оставалась ниже единицы. Следовательно, приемлемое качество на горизонте двух лет наблюдается не для всех рядов и зависит от устойчивости исходного тренда.

Значения MASE ниже единицы для темы 1 в 2023-2024 годах и темы 2 в 2023 году означают, что ошибки меньше масштабирующей ошибки наивного метода. Этот показатель не заменяет отдельного сравнения моделей на тестовом периоде. Результаты двух тем также недостаточны для вывода об одинаковом качестве прогнозирования всех 20 направлений.

Эксперимент показывает применимость сочетания LDA и Prophet для предварительного анализа: тематическая модель даёт интерпретируемое разбиение, а прогноз помогает оценить возможное продолжение динамики. Основное ограничение – чувствительность к переломам тренда. По мере увеличения горизонта решения следует принимать с учётом неопределённости и содержательной оценки темы.

Предложен подход к анализу научных направлений, объединяющий предобработку русскоязычных публикаций, тематическое моделирование LDA, годовую агрегацию и прогнозирование Prophet. На корпусе из 14737 публикаций выделено 20 тем; показатели разнообразия и согласованности подтверждают возможность базового тематического анализа при сохранении пересечений терминологии.

Проверка двух тем показала, что надёжность прогноза определяется устойчивостью ряда и горизонтом. Для первой темы небольшие ошибки сохранялись на протяжении двух лет, для второй существенное ухудшение началось на второй год. Трёхлетние прогнозы обеих тем завышали фактическую активность, поэтому их следует использовать только как ориентировочные оценки.

Дальнейшая работа предполагает расширение временного диапазона, сравнение LDA с BERTopic [4] и неотрицательной матричной факторизацией, переход к более детальной временной агрегации и прогнозированию доли темы в корпусе. Эти направления могут уточнить оценку научных тенденций и снизить зависимость результата от общего объёма публикаций.

Список литературы

  1. Седова А.Г., Митрофанова О.А. Тематическое моделирование русскоязычных текстов с опорой на леммы и лексические конструкции // Компьютерная лингвистика и вычислительные онтологии. 2017. № 1. С. 132-144.
  2. Blei D.M., Ng A.Y., Jordan M.I. Latent Dirichlet Allocation // Journal of Machine Learning Research. 2003. Vol. 3. P. 993-1022. URL: https://www.jmlr.org/papers/v3/blei03a.html (дата обращения: 29.05.2026).
  3. Griffiths T.L., Steyvers M. Finding Scientific Topics // Proceedings of the National Academy of Sciences. 2004. Vol. 101, Suppl. 1. P. 5228-5235.
  4. Grootendorst M. BERTopic: Neural Topic Modeling with a Class-based TF-IDF Procedure // arXiv. 2022. URL: https://arxiv.org/abs/2203.05794 (дата обращения: 26.05.2026).
  5. Hyndman R.J., Koehler A.B. Another Look at Measures of Forecast Accuracy // International Journal of Forecasting. 2006. Vol. 22, № 4. P. 679-688.
  6. Korobov M. Morphological Analyzer and Generator for Russian and Ukrainian Languages // Analysis of Images, Social Networks and Texts. AIST 2015. Communications in Computer and Information Science. 2015. Vol. 542. P. 320-332.
  7. Mimno D., Wallach H., Talley E., Leenders M., McCallum A. Optimizing Semantic Coherence in Topic Models // Proceedings of the 2011 Conference on Empirical Methods in Natural Language Processing. Edinburgh: Association for Computational Linguistics, 2011. P. 262-272. URL: https://aclanthology.org/D11-1024/ (дата обращения: 29.05.2026).
  8. Priem J., Piwowar H., Orr R. OpenAlex: A Fully-open Index of Scholarly Works, Authors, Venues, Institutions, and Concepts // arXiv. 2022. URL: https://arxiv.org/abs/2205.01833 (дата обращения: 26.05.2026).
  9. Röder M., Both A., Hinneburg A. Exploring the Space of Topic Coherence Measures // Proceedings of the Eighth ACM International Conference on Web Search and Data Mining. 2015. P. 399-408.
  10. Taylor S.J., Letham B. Forecasting at Scale // The American Statistician. 2018. Vol. 72, № 1. P. 37-45.

Поделиться

4
Обнаружили грубую ошибку (плагиат, фальсифицированные данные или иные нарушения научно-издательской этики)? Напишите письмо в редакцию журнала: info@apni.ru

Похожие статьи

Другие статьи из раздела «Технические науки»

Все статьи выпуска
Актуальные исследования

#39 (325)

Прием материалов

19 сентября - 25 сентября

осталось 3 дня

Размещение PDF-версии журнала

30 сентября

Размещение электронной версии статьи

сразу после оплаты

Рассылка печатных экземпляров

14 октября