Рост числа научных публикаций затрудняет ручной анализ исследовательской активности. В области информационных технологий быстро меняются терминология и состав направлений, поэтому для выявления тенденций необходима совместная обработка содержания публикаций и сведений о времени их выхода. Цель исследования – разработать и экспериментально проверить подход, связывающий тематическое моделирование русскоязычных научных текстов с прогнозированием публикационной активности.
В качестве базового метода выбрано латентное размещение Дирихле (Latent Dirichlet Allocation, LDA): документ представляется распределением по темам, а тема – распределением по словам [2, с. 993-1022]. Метод позволяет выделять направления без предварительной разметки и интерпретировать их по характерным терминам [3, с. 5228-5235]. Для прогнозирования используется Prophet, описывающий изменение временного ряда и формирующий интервалы неопределённости [10, с. 37-45].
Экспериментальный корпус сформирован на основе данных OpenAlex [8] и включает 14737 русскоязычных публикаций по информационным технологиям за 2008–2025 годы. Использованы записи с заполненными названием и аннотацией, а также корректным годом публикации. Подход объединяет предобработку текстов, выделение тем, подсчёт публикаций по годам и прогнозирование полученных рядов.
Для каждой публикации название и аннотация объединяются в один текст. Предобработка включает перевод символов в нижний регистр, удаление чисел, пунктуации, специальных символов, русских и английских стоп-слов. Лемматизация русскоязычных слов уменьшает вариативность грамматических форм и размерность признакового пространства [1, с. 132-144; 6, с. 320-332].
Признаковое представление строится на униграммах и биграммах. Последние сохраняют устойчивые сочетания, например «машинное обучение» и «информационная безопасность». После обучения LDA каждой публикации назначается тема с наибольшей вероятностью; содержание темы интерпретируется по её ключевым словам. В эксперименте выделено 20 тем.
Качество тематической модели оценивается с помощью разнообразия тем (topic diversity) и средней согласованности на основе нормализованной точечной взаимной информации (NPMI coherence). Первый показатель характеризует различие наборов ключевых слов, второй – их смысловую связанность. Оценка согласованности используется для анализа интерпретируемости тематических моделей [7, с. 262-272; 9, с. 399-408].
После назначения тематических меток публикации группируются по темам и годам. Значением ряда служит количество работ, отнесённых к выбранной теме в соответствующем году. Такой переход связывает содержание корпуса с изменением публикационной активности, но сам по себе не характеризует научное качество или практическую значимость направления.
Для каждой выбранной темы годовые значения передаются в Prophet: год выступает временной меткой, число публикаций – прогнозируемой величиной. Модель формирует ожидаемое значение и нижнюю и верхнюю границы прогноза. Расширение интервала указывает на неопределённость оценки; прогноз роста следует рассматривать как ориентир для последующего содержательного анализа.
Качество прогнозирования проверяется для двух тем с различной динамикой на периоде 2023–2025 годов. Используются абсолютная ошибка, симметричная средняя абсолютная процентная ошибка (SMAPE), взвешенная абсолютная процентная ошибка (WAPE) и средняя абсолютная масштабированная ошибка (MASE) [5, с. 679-688]. Результаты приведены отдельно для каждого года; для одной прогнозной точки средняя абсолютная ошибка (MAE) совпадает с абсолютной ошибкой.
Показатели тематического моделирования приведены в таблице 1. Разнообразие тем 0,605 свидетельствует о частичном различии ключевых слов при сохранении пересечений между темами. Средняя NPMI coherence 0,157 указывает на ограниченную согласованность. Полученное разбиение пригодно для предварительного анализа корпуса, однако не является окончательной классификацией научных направлений.
Таблица 1
Показатели качества тематического моделирования
Показатель | Значение |
Topic diversity | 0,605 |
Средняя NPMI coherence | 0,157 |
Пересечение тем может быть связано с общей научной лексикой и близостью терминологии в информационных технологиях. Поэтому тематические метки требуют содержательной интерпретации, а качество последующего прогноза зависит как от временной модели, так и от исходного распределения публикаций по темам.
Для оценки прогнозирования выбраны две темы: первая характеризовалась выраженным ростом активности до 2022 года, вторая – менее устойчивой динамикой и снижением после 2021 года. Фактические и прогнозные значения, а также ошибки представлены в таблице 2.
Таблица 2
Результаты прогнозирования публикационной активности
Тема | Год | Факт | Прогноз | Абс. ошибка | SMAPE, % | WAPE, % | MASE |
1 | 2023 | 137 | 129,68 | 7,32 | 5,49 | 5,35 | 0,54 |
1 | 2024 | 133 | 137,99 | 4,99 | 3,68 | 3,75 | 0,37 |
1 | 2025 | 109 | 146,33 | 37,33 | 29,24 | 34,24 | 2,75 |
2 | 2023 | 53 | 60,90 | 7,90 | 13,88 | 14,91 | 0,99 |
2 | 2024 | 46 | 64,09 | 18,09 | 32,87 | 39,34 | 2,28 |
2 | 2025 | 41 | 67,30 | 26,30 | 48,56 | 64,13 | 3,31 |
Для темы 1 абсолютная ошибка составила 7,32 публикации в 2023 году и 4,99 в 2024 году. В 2025 году фактическое число публикаций снизилось до 109, тогда как прогноз достиг 146,33; ошибка выросла до 37,33, а WAPE – до 34,24%. Модель продолжила предшествующий рост и не отразила изменение направления динамики.
Для темы 2 ошибка увеличивалась на всём проверяемом горизонте: с 7,90 до 26,30 публикации, WAPE – с 14,91 до 64,13%. Уже на второй год MASE составила 2,28, тогда как для темы 1 она оставалась ниже единицы. Следовательно, приемлемое качество на горизонте двух лет наблюдается не для всех рядов и зависит от устойчивости исходного тренда.
Значения MASE ниже единицы для темы 1 в 2023-2024 годах и темы 2 в 2023 году означают, что ошибки меньше масштабирующей ошибки наивного метода. Этот показатель не заменяет отдельного сравнения моделей на тестовом периоде. Результаты двух тем также недостаточны для вывода об одинаковом качестве прогнозирования всех 20 направлений.
Эксперимент показывает применимость сочетания LDA и Prophet для предварительного анализа: тематическая модель даёт интерпретируемое разбиение, а прогноз помогает оценить возможное продолжение динамики. Основное ограничение – чувствительность к переломам тренда. По мере увеличения горизонта решения следует принимать с учётом неопределённости и содержательной оценки темы.
Предложен подход к анализу научных направлений, объединяющий предобработку русскоязычных публикаций, тематическое моделирование LDA, годовую агрегацию и прогнозирование Prophet. На корпусе из 14737 публикаций выделено 20 тем; показатели разнообразия и согласованности подтверждают возможность базового тематического анализа при сохранении пересечений терминологии.
Проверка двух тем показала, что надёжность прогноза определяется устойчивостью ряда и горизонтом. Для первой темы небольшие ошибки сохранялись на протяжении двух лет, для второй существенное ухудшение началось на второй год. Трёхлетние прогнозы обеих тем завышали фактическую активность, поэтому их следует использовать только как ориентировочные оценки.
Дальнейшая работа предполагает расширение временного диапазона, сравнение LDA с BERTopic [4] и неотрицательной матричной факторизацией, переход к более детальной временной агрегации и прогнозированию доли темы в корпусе. Эти направления могут уточнить оценку научных тенденций и снизить зависимость результата от общего объёма публикаций.
.png&w=384&q=75)
.png&w=640&q=75)