Главная
АИ #33 (319)
Статьи журнала АИ #33 (319)
Теоретические принципы формирования ансамблей компактных машин экстремального об...

Теоретические принципы формирования ансамблей компактных машин экстремального обучения

Цитирование

Кашпирев М. Д. Теоретические принципы формирования ансамблей компактных машин экстремального обучения // Актуальные исследования. 2026. №33 (319). URL: https://apni.ru/article/15898-teoreticheskie-principy-formirovaniya-ansamblej-kompaktnyh-mashin-ekstremalnogo-obucheniya

Аннотация статьи

Цель статьи - систематизировать теоретические условия, при которых объединение компактных машин экстремального обучения может быть полезным. Рассмотрены регуляризованная модель машины экстремального обучения, влияние ковариации прогнозов на усреднение и точное разложение квадратичной ошибки ансамбля. Показано, что различие моделей имеет смысл только при приемлемом качестве отдельных компонентов, а показатели разнообразия должны использоваться как вспомогательные. Предложена последовательная процедура отбора моделей для последующей экспериментальной проверки.

Текст статьи

Введение

Машина экстремального обучения (Extreme Learning Machine, ELM) - нейронная сеть прямого распространения с одним скрытым слоем, в которой параметры скрытых узлов задаются без итерационного градиентного обучения, а выходные коэффициенты находятся решением линейной задачи [5, с. 489-501]. Такое обучение является быстрым, но результат зависит от случайно сформированного скрытого пространства: разные входные веса и смещения могут давать разные прогнозы на одной выборке.

В работах Л.А. Демидовой, А.В. Горчакова и И.А. Фурсова ELM и их компактные варианты применяются к прогнозированию и классификации; отдельное внимание уделяется формированию и настройке скрытого представления [1, с. 59-74; 2, с. 22-35; 3, с. 1-20]. Объединение нескольких ELM может повысить устойчивость, однако оно полезно не само по себе. Для эффективного ансамблирования важны как качество отдельных компонентов, так и неполная зависимость их ошибок [4, с. 993-1001; 6, с. 231-238]. Цель статьи - систематизировать теоретические условия эффективного ансамблирования компактных ELM и обосновать последовательность отбора компонентов с учетом их качества и взаимодополняемости прогнозов.

Объект и методы исследования

Объект исследования - ансамбль компактных ELM, различающихся случайной инициализацией скрытого слоя, его шириной и параметрами регуляризации. Использованы аналитическое представление регуляризованной ELM, разложение дисперсии зависимых прогнозов, точное разложение квадратичной ошибки и сравнительный анализ мер разнообразия. Работа имеет теоретический характер; сформулированная процедура требует проверки на независимых данных.

Математическая модель компактной ELM

Под компактной ELM в работе понимается модель с ограниченным числом скрытых узлов, используемая как отдельный компонент ансамбля; универсальный численный порог компактности не вводится.

Пусть X - матрица n объектов с d признаками, Y - матрица целевых значений, Lₘ - число скрытых узлов m-й ELM. Матрица скрытых признаков равна

                                    Hₘ = g(XWₘ + 1bₘᵀ),                                                                (1)

где Wₘ и bₘ - входные веса и смещения, g(·) - функция активации. При λₘ > 0 выходные коэффициенты находятся как

                          Bₘ = (HₘᵀHₘ + λₘI)⁻¹HₘᵀY.                                                                   (2)

При λₘ > 0 матрица HₘᵀHₘ + λₘI положительно определена и обратима. Без регуляризации в общем случае применяется псевдообратная матрица Мура - Пенроуза. Различия между компонентами задаются Wₘ, bₘ, числом скрытых узлов Lₘ и значением λₘ.

                               f̄(x) = (1/M) Σₘ₌₁ᴹ fₘ(x).                                                                   (3)

В регрессии выражение (3) используется непосредственно; в классификации усредняются оценки классов либо применяется голосование. Дальнейшие точные формулы относятся к числовым выходам. Для голосования они задают общий смысл, но не являются прямым доказательством.

Почему различие прогнозов может быть полезно

Для фиксированного объекта случайность прогноза связывается с различными реализациями параметров компонентов. Дисперсия среднего прогноза равна

  Var(f̄) = (1/M²)[Σₘ₌₁ᴹ Var(fₘ) + 2Σ₁≤ᵢ<ⱼ≤ᴹ Cov(fᵢ,fⱼ)].                                                  (4)

Формула (4) не требует независимости: эффект усреднения определяется дисперсиями отдельных прогнозов и их ковариациями. Если дополнительно все модели имеют дисперсию σ² и одинаковую попарную корреляцию ρ, то

                      Var(f̄) = (σ²/M)[1 + (M - 1)ρ].                                                                   (5)

При ρ = 0 дисперсия уменьшается в M раз, а при ρ = 1 усреднение ее не снижает. Следовательно, эффект ансамблирования определяется не только числом моделей, но и зависимостью их прогнозов: при прочих равных меньшая положительная корреляция повышает эффект усреднения. Формула (5) является частным случаем; в общем случае применяется формула (4).

Соотношение точности и разнообразия

Для одного объекта, скалярной цели y, равных весов и квадратичной потери выполняется точное тождество [6, с. 232-233]:

                       (y - f̄)² = (1/M)Σₘ₌₁ᴹ(y - fₘ)² - (1/M)Σₘ₌₁ᴹ(fₘ - f̄)².                                   (6)

Первое слагаемое - средняя ошибка компонентов, второе - неоднозначность, то есть средний квадрат отклонения прогнозов от ансамблевого среднего. Для векторного выхода квадраты заменяются квадратами евклидовых норм.

При фиксированной средней ошибке рост неоднозначности уменьшает ошибку ансамбля. Однако максимизация разнообразия не является самостоятельной целью: слабая модель может одновременно увеличить различие прогнозов и среднюю ошибку. Поэтому сначала необходимо обеспечить приемлемое качество компонентов, а затем учитывать взаимодополняемость их прогнозов.

Тождество (6) непосредственно применимо к усреднению числовых прогнозов при квадратичной потере и не переносится напрямую на Accuracy, F1 и Macro-F1. Поэтому в задачах классификации меры разнообразия следует рассматривать как диагностические характеристики, а окончательный состав ансамбля выбирать по целевой метрике на валидационных данных.

Показатели различия ошибок классификаторов

Для классификации введем индикатор zₘ(x), равный 1 при ошибке модели и 0 при правильном ответе. Основные парные показатели - корреляция индикаторов ошибок, несогласие (disagreement) и совместная ошибка (double-fault) - соответствуют мерам, рассмотренным в [7, с. 184-185]. Поклассовый анализ в таблице используется как дополнительный диагностический прием.

Таблица

Показатели и способы анализа различия ошибок классификаторов

ПоказательСодержаниеОграничение
Несогласие (disagreement)Доля объектов, на которых одна модель ошиблась, а другая дала правильный ответВысокое значение может быть вызвано присутствием слабой модели
Совместная ошибка (double-fault)Доля объектов, ошибочно классифицированных обеими моделями; единица в индикаторе означает ошибкуНе показывает, какая модель исправляет ошибки другой; зависит от состава классов
Корреляция индикаторов ошибокСтепень статистической зависимости ошибок двух моделейМожет быть неустойчивой при малом числе ошибок или небольшой выборке
Поклассовый анализ ошибокРасчет показателей совместных ошибок и их зависимости отдельно для объектов каждого классаНе является точным разложением Macro-F1, но позволяет выявлять систематические совместные ошибки, в том числе на малочисленных классах

Ни один из приведенных показателей не заменяет оценку качества ансамбля. Связь мер разнообразия с точностью зависит от данных, состава моделей и правила объединения [7, с. 181-207]. При дисбалансе классов полезно дополнительно анализировать совместные ошибки по каждому классу, однако окончательное решение следует принимать по целевой метрике, например Macro-F1.

Процедура отбора компонентов ансамбля

Сначала формируется пул компактных ELM с различными случайными инициализациями, числом скрытых узлов и значениями регуляризации. Эти изменения создают разные скрытые представления, но само различие не является достаточным условием включения модели в ансамбль.

Затем модели оцениваются на общей валидационной выборке по целевой метрике. Компоненты ниже заданного порога исключаются. Порог определяется требованиями задачи либо допустимым отклонением от лучшей модели и предотвращает включение слабых решений только ради разнообразия.

Среди прошедших фильтр моделей анализируется взаимодополняемость ошибок. Для классификации используются disagreement, double-fault, корреляция индикаторов ошибок и их поклассовые аналоги. Эти показатели сокращают число кандидатов, но не заменяют оценку ансамбля по целевой метрике.

Размер и состав ансамбля выбираются по итоговой валидационной метрике, после чего результат один раз проверяется на независимой тестовой выборке. Такая последовательность не гарантирует глобального оптимума, но разделяет контроль индивидуального качества и анализ взаимодополняемости моделей.

Вычислительные особенности

Компоненты ансамбля обучаются независимо и могут вычисляться параллельно. При представлении (2) каждая компактная ELM решает линейную систему, размерность которой определяется числом ее скрытых узлов, что удобно при распределенных вычислениях.

Это не означает безусловного уменьшения суммарных затрат: ансамбль хранит параметры всех компонентов и выполняет несколько прогнозов. Соотношение затрат зависит от числа моделей, размеров скрытых слоев и вычислительной архитектуры. Теория также не позволяет заранее утверждать превосходство ансамбля по точности; выигрыш должен подтверждаться экспериментально.

Заключение

В работе систематизированы теоретические условия формирования ансамблей компактных ELM. Показано, что снижение вариативности усредненного прогноза определяется числом компонентов и ковариационной структурой их прогнозов, а разнообразие следует рассматривать совместно с индивидуальным качеством моделей.

В классификации disagreement, double-fault и корреляция индикаторов ошибок остаются вспомогательными показателями. Предложенная процедура включает фильтрацию моделей по целевой метрике, анализ совместных ошибок и окончательный выбор ансамбля по валидационному качеству с независимой 

Список литературы

1. Демидова Л.А., Горчаков А.В. Применение биоинспирированных алгоритмов глобальной оптимизации для повышения точности прогнозов компактных машин экстремального обучения // Российский технологический журнал. 2022. Т. 10. № 2. С. 59-74. DOI: 10.32362/2500-316X-2022-10-2-59-74.

2. Демидова Л.А., Фурсов И.А. Машина экстремального обучения в задачах предсказания остаточного срока полезной службы дисковых накопителей // Вестник Рязанского государственного радиотехнического университета. 2023. № 83. С. 22-35. DOI: 10.21667/1995-4565-2023-83-22-35.

3. Demidova L.A., Gorchakov A.V. Classification of Program Texts Represented as Markov Chains with Biology-Inspired Algorithms-Enhanced Extreme Learning Machines // Algorithms. 2022. Vol. 15. No. 9. Article 329. DOI: 10.3390/a15090329.

4. Hansen L.K., Salamon P. Neural Network Ensembles // IEEE Transactions on Pattern Analysis and Machine Intelligence. 1990. Vol. 12. No. 10. P. 993-1001. DOI: 10.1109/34.58871.

5. Huang G.-B., Zhu Q.-Y., Siew C.-K. Extreme Learning Machine: Theory and Applications // Neurocomputing. 2006. Vol. 70. No. 1-3. P. 489-501. DOI: 10.1016/j.neucom.2005.12.126.

6. Krogh A., Vedelsby J. Neural Network Ensembles, Cross Validation, and Active Learning // Advances in Neural Information Processing Systems. 1995. Vol. 7. P. 231-238.

7. Kuncheva L.I., Whitaker C.J. Measures of Diversity in Classifier Ensembles and Their Relationship with the Ensemble Accuracy // Machine Learning. 2003. Vol. 51. No. 2. P. 181-207. DOI: 10.1023/A:1022859003006.

Поделиться

1
Обнаружили грубую ошибку (плагиат, фальсифицированные данные или иные нарушения научно-издательской этики)? Напишите письмо в редакцию журнала: info@apni.ru

Похожие статьи

Другие статьи из раздела «Технические науки»

Все статьи выпуска
Актуальные исследования

#33 (319)

Прием материалов

8 августа - 14 августа

осталось 3 дня

Размещение PDF-версии журнала

19 августа

Размещение электронной версии статьи

сразу после оплаты

Рассылка печатных экземпляров

2 сентября