Введение
Машина экстремального обучения (Extreme Learning Machine, ELM) - нейронная сеть прямого распространения с одним скрытым слоем, в которой параметры скрытых узлов задаются без итерационного градиентного обучения, а выходные коэффициенты находятся решением линейной задачи [5, с. 489-501]. Такое обучение является быстрым, но результат зависит от случайно сформированного скрытого пространства: разные входные веса и смещения могут давать разные прогнозы на одной выборке.
В работах Л.А. Демидовой, А.В. Горчакова и И.А. Фурсова ELM и их компактные варианты применяются к прогнозированию и классификации; отдельное внимание уделяется формированию и настройке скрытого представления [1, с. 59-74; 2, с. 22-35; 3, с. 1-20]. Объединение нескольких ELM может повысить устойчивость, однако оно полезно не само по себе. Для эффективного ансамблирования важны как качество отдельных компонентов, так и неполная зависимость их ошибок [4, с. 993-1001; 6, с. 231-238]. Цель статьи - систематизировать теоретические условия эффективного ансамблирования компактных ELM и обосновать последовательность отбора компонентов с учетом их качества и взаимодополняемости прогнозов.
Объект и методы исследования
Объект исследования - ансамбль компактных ELM, различающихся случайной инициализацией скрытого слоя, его шириной и параметрами регуляризации. Использованы аналитическое представление регуляризованной ELM, разложение дисперсии зависимых прогнозов, точное разложение квадратичной ошибки и сравнительный анализ мер разнообразия. Работа имеет теоретический характер; сформулированная процедура требует проверки на независимых данных.
Математическая модель компактной ELM
Под компактной ELM в работе понимается модель с ограниченным числом скрытых узлов, используемая как отдельный компонент ансамбля; универсальный численный порог компактности не вводится.
Пусть X - матрица n объектов с d признаками, Y - матрица целевых значений, Lₘ - число скрытых узлов m-й ELM. Матрица скрытых признаков равна
Hₘ = g(XWₘ + 1bₘᵀ), (1)
где Wₘ и bₘ - входные веса и смещения, g(·) - функция активации. При λₘ > 0 выходные коэффициенты находятся как
Bₘ = (HₘᵀHₘ + λₘI)⁻¹HₘᵀY. (2)
При λₘ > 0 матрица HₘᵀHₘ + λₘI положительно определена и обратима. Без регуляризации в общем случае применяется псевдообратная матрица Мура - Пенроуза. Различия между компонентами задаются Wₘ, bₘ, числом скрытых узлов Lₘ и значением λₘ.
f̄(x) = (1/M) Σₘ₌₁ᴹ fₘ(x). (3)
В регрессии выражение (3) используется непосредственно; в классификации усредняются оценки классов либо применяется голосование. Дальнейшие точные формулы относятся к числовым выходам. Для голосования они задают общий смысл, но не являются прямым доказательством.
Почему различие прогнозов может быть полезно
Для фиксированного объекта случайность прогноза связывается с различными реализациями параметров компонентов. Дисперсия среднего прогноза равна
Var(f̄) = (1/M²)[Σₘ₌₁ᴹ Var(fₘ) + 2Σ₁≤ᵢ<ⱼ≤ᴹ Cov(fᵢ,fⱼ)]. (4)
Формула (4) не требует независимости: эффект усреднения определяется дисперсиями отдельных прогнозов и их ковариациями. Если дополнительно все модели имеют дисперсию σ² и одинаковую попарную корреляцию ρ, то
Var(f̄) = (σ²/M)[1 + (M - 1)ρ]. (5)
При ρ = 0 дисперсия уменьшается в M раз, а при ρ = 1 усреднение ее не снижает. Следовательно, эффект ансамблирования определяется не только числом моделей, но и зависимостью их прогнозов: при прочих равных меньшая положительная корреляция повышает эффект усреднения. Формула (5) является частным случаем; в общем случае применяется формула (4).
Соотношение точности и разнообразия
Для одного объекта, скалярной цели y, равных весов и квадратичной потери выполняется точное тождество [6, с. 232-233]:
(y - f̄)² = (1/M)Σₘ₌₁ᴹ(y - fₘ)² - (1/M)Σₘ₌₁ᴹ(fₘ - f̄)². (6)
Первое слагаемое - средняя ошибка компонентов, второе - неоднозначность, то есть средний квадрат отклонения прогнозов от ансамблевого среднего. Для векторного выхода квадраты заменяются квадратами евклидовых норм.
При фиксированной средней ошибке рост неоднозначности уменьшает ошибку ансамбля. Однако максимизация разнообразия не является самостоятельной целью: слабая модель может одновременно увеличить различие прогнозов и среднюю ошибку. Поэтому сначала необходимо обеспечить приемлемое качество компонентов, а затем учитывать взаимодополняемость их прогнозов.
Тождество (6) непосредственно применимо к усреднению числовых прогнозов при квадратичной потере и не переносится напрямую на Accuracy, F1 и Macro-F1. Поэтому в задачах классификации меры разнообразия следует рассматривать как диагностические характеристики, а окончательный состав ансамбля выбирать по целевой метрике на валидационных данных.
Показатели различия ошибок классификаторов
Для классификации введем индикатор zₘ(x), равный 1 при ошибке модели и 0 при правильном ответе. Основные парные показатели - корреляция индикаторов ошибок, несогласие (disagreement) и совместная ошибка (double-fault) - соответствуют мерам, рассмотренным в [7, с. 184-185]. Поклассовый анализ в таблице используется как дополнительный диагностический прием.
Таблица
Показатели и способы анализа различия ошибок классификаторов
| Показатель | Содержание | Ограничение |
| Несогласие (disagreement) | Доля объектов, на которых одна модель ошиблась, а другая дала правильный ответ | Высокое значение может быть вызвано присутствием слабой модели |
| Совместная ошибка (double-fault) | Доля объектов, ошибочно классифицированных обеими моделями; единица в индикаторе означает ошибку | Не показывает, какая модель исправляет ошибки другой; зависит от состава классов |
| Корреляция индикаторов ошибок | Степень статистической зависимости ошибок двух моделей | Может быть неустойчивой при малом числе ошибок или небольшой выборке |
| Поклассовый анализ ошибок | Расчет показателей совместных ошибок и их зависимости отдельно для объектов каждого класса | Не является точным разложением Macro-F1, но позволяет выявлять систематические совместные ошибки, в том числе на малочисленных классах |
Ни один из приведенных показателей не заменяет оценку качества ансамбля. Связь мер разнообразия с точностью зависит от данных, состава моделей и правила объединения [7, с. 181-207]. При дисбалансе классов полезно дополнительно анализировать совместные ошибки по каждому классу, однако окончательное решение следует принимать по целевой метрике, например Macro-F1.
Процедура отбора компонентов ансамбля
Сначала формируется пул компактных ELM с различными случайными инициализациями, числом скрытых узлов и значениями регуляризации. Эти изменения создают разные скрытые представления, но само различие не является достаточным условием включения модели в ансамбль.
Затем модели оцениваются на общей валидационной выборке по целевой метрике. Компоненты ниже заданного порога исключаются. Порог определяется требованиями задачи либо допустимым отклонением от лучшей модели и предотвращает включение слабых решений только ради разнообразия.
Среди прошедших фильтр моделей анализируется взаимодополняемость ошибок. Для классификации используются disagreement, double-fault, корреляция индикаторов ошибок и их поклассовые аналоги. Эти показатели сокращают число кандидатов, но не заменяют оценку ансамбля по целевой метрике.
Размер и состав ансамбля выбираются по итоговой валидационной метрике, после чего результат один раз проверяется на независимой тестовой выборке. Такая последовательность не гарантирует глобального оптимума, но разделяет контроль индивидуального качества и анализ взаимодополняемости моделей.
Вычислительные особенности
Компоненты ансамбля обучаются независимо и могут вычисляться параллельно. При представлении (2) каждая компактная ELM решает линейную систему, размерность которой определяется числом ее скрытых узлов, что удобно при распределенных вычислениях.
Это не означает безусловного уменьшения суммарных затрат: ансамбль хранит параметры всех компонентов и выполняет несколько прогнозов. Соотношение затрат зависит от числа моделей, размеров скрытых слоев и вычислительной архитектуры. Теория также не позволяет заранее утверждать превосходство ансамбля по точности; выигрыш должен подтверждаться экспериментально.
Заключение
В работе систематизированы теоретические условия формирования ансамблей компактных ELM. Показано, что снижение вариативности усредненного прогноза определяется числом компонентов и ковариационной структурой их прогнозов, а разнообразие следует рассматривать совместно с индивидуальным качеством моделей.
В классификации disagreement, double-fault и корреляция индикаторов ошибок остаются вспомогательными показателями. Предложенная процедура включает фильтрацию моделей по целевой метрике, анализ совместных ошибок и окончательный выбор ансамбля по валидационному качеству с независимой
.png&w=384&q=75)
.png&w=640&q=75)