Главная
АИ #31 (317)
Статьи журнала АИ #31 (317)
Эволюция методов маскирования в компьютерном зрении: от случайного скрытия патче...

Эволюция методов маскирования в компьютерном зрении: от случайного скрытия патчей к адаптивному и пространственно-согласованному маскированию значимых признаков для улучшения обобщающей способности (Zero-Shot и Low-Shot)

Цитирование

Шепталов Д. Д., Лустин И. Ю., Шавыркин А. В. Эволюция методов маскирования в компьютерном зрении: от случайного скрытия патчей к адаптивному и пространственно-согласованному маскированию значимых признаков для улучшения обобщающей способности (Zero-Shot и Low-Shot) // Актуальные исследования. 2026. №31 (317). URL: https://apni.ru/article/15829-evolyuciya-metodov-maskirovaniya-v-kompyuternom-zrenii-ot-sluchajnogo-skrytiya-patchej-k-adaptivnomu-i-prostranstvenno-soglasovannomu-maskirovaniyu-znachimyh-priznakov-dlya-uluchsheniya-obobshayushej-sposobnosti-zero-shot-i-low-shot

Аннотация статьи

В работе рассматривается эволюция подходов к маскированию в задачах компьютерного зрения — от ранних методов случайного удаления патчей до современных стратегий адаптивного и пространственно-согласованного сокрытия семантически значимых признаков. Анализируется, как переход от стохастических схем (Masked Autoencoders, Random Erasing) к целенаправленному маскированию ключевых регионов (IMAGE, RFGAM) позволяет существенно улучшить обобщающую способность моделей в сценариях с ограниченным количеством размеченных данных (Zero-Shot и Low-Shot). Приводятся результаты сопоставительных экспериментов на стандартных бенчмарках COCO и ODinW, а также теоретическое обоснование эффективности адаптивных методов через анализ сложности Радемахера.

Текст статьи

Задачи визуального распознавания, стоящие перед современными моделями компьютерного зрения, всё чаще выходят за рамки привычного сценария «обучение на большом размеченном датасете — оценка на том же распределении». В прикладных областях, от автономного вождения до embodied AI, системам приходится адаптироваться к новым, редким или вовсе невиданным ранее ситуациям, причём объём размеченных данных оказывается существенно ограничен [1]. Как представляется, именно этот сдвиг парадигмы и обусловил повышенное внимание исследователей к методам регуляризации, среди которых маскирование входных данных занимает особое место. С одной стороны, маскирование — это форма аугментации, принудительно обучающая модель инвариантным признакам; с другой, правильно организованное сокрытие частей изображения заставляет сеть рассуждать на основе остаточной информации, что напрямую связано с улучшением обобщающей способности.

Целью настоящей работы является систематизация эволюции методов маскирования в компьютерном зрении: от ранних стохастических схем, удаляющих случайные патчи, до современных адаптивных подходов, целенаправленно скрывающих семантически значимые регионы. Мы ставим перед собой задачу проследить, как менялись мотивация, математическое обоснование и практическая реализация этих методов, и оценить, насколько каждый из шагов эволюции способствовал улучшению производительности в Zero-Shot [14] и Low-Shot [15] сценариях. Ключевая гипотеза, которую мы проверяем, состоит в том, что переход от случайного к адаптивному маскированию — это не просто инженерное усовершенствование, а качественный скачок, имеющий строгое теоретическое обоснование через анализ сложности гипотез.

Теоретическую основу маскирования составляет идея, родственная dropout и другим методам регуляризации: принудительное «выключение» части входной информации не даёт модели переобучиться на тривиальных признаках и заставляет искать более устойчивые зависимости. Формально маскирование задаётся бинарной или мягкой маской, применяемой к входному тензору на уровне пикселей, патчей или признаков, и критерием качества становится способность модели сохранять низкие ошибки на тестовом распределении. Для оценки эффективности традиционно используются метрики Zero-Shot accuracy на невиданных классах (бенчмарки ODinW_13 и ODinW_35), Low-Shot performance при обучении на подвыборках COCO [13], а также closed-set evaluation с расчётом Average Precision (AP).

Первые шаги в развитии методов маскирования были связаны с интуитивно простой идеей: случайным образом удалять прямоугольные области изображения. Работы CutOut [2] и Random Erasing [3] показали, что даже такая незамысловатая стратегия даёт заметный прирост робастности, поскольку модель перестаёт полагаться на отдельные «зацепки» в кадре. Позднее эта логика была перенесена на уровень патчей в архитектуре Vision Transformers (ViT) [4]: в seminal работе Masked Autoencoders (MAE) [5] было продемонстрировано, что случайное маскирование до 75% патчей с последующей реконструкцией позволяет обучать масштабируемые визуальные представления. Параллельно развивались BERT-подобные подходы, такие как BEiT [6], адаптировавшие концепцию masked language modeling к задачам компьютерного зрения.

Однако у всех этих методов есть общий и весьма существенный недостаток: они не учитывают семантическую значимость регионов. Случайное маскирование с равной вероятностью может как скрыть фоновые области, так и уничтожить ключевые дискриминативные части объекта. Попытки частично исправить эту ситуацию предпринимались в работах MaskCLIP [7], CenterMask [8] и ClusterMask [9], где маскирование направлялось на исключение периферийных или фоновых регионов с целью снизить вычислительные затраты и сфокусировать внимание модели на основном объекте. Но простое удаление нерелевантных областей не учит модель рассуждать о частично наблюдаемых признаках, а именно это и требуется в Zero-Shot и Low-Shot сценариях.

Качественный сдвиг произошёл с появлением метода IMAGE (Interpretative MAsking with Gaussian Radiation ModEling) [10], который знаменует собой переход к принципиально новой парадигме. Ключевая идея IMAGE состоит в том, чтобы намеренно скрывать наиболее значимые (salient) области изображения. Если мы заставим модель восстанавливать объект по остаточным признакам, она будет вынуждена строить более глубокие контекстные зависимости, имитируя человеческое восприятие, способное опознать объект по его частичным признакам. Архитектурно IMAGE опирается на два блока: Importance Prior Generation Block, оценивающий значимость каждого патча через глобальные контекстные взаимодействия с помощью механизма self-attention [17], и Adaptive Mask Generation Block, формирующий маску на основе полученного приоритета. Нормализованные importance scores , затем используются для ранжирования патчей и маскирования top-% наиболее значимых.

Следующим важным шагом стало осознание того, что пороговое (threshold-based) маскирование, несмотря на всю свою эффективность, порождает дискретные границы, не использующие пространственную непрерывность семантических структур. Для преодоления этого ограничения в работе [10] предложен механизм RFGAM (Radiance Field Gaussian Adaptive Masking), моделирующий пространственный ландшафт значимости как непрерывное поле излучения, параметризованное обучаемыми гауссовскими ядрами. Интенсивность поля в точке(x,y) вычисляется как 
, где дисперсии ​ обучаются совместно с cross-attention выходами. На основе этого поля строятся два порога —  и   — разделяющих пространство на три зоны: полностью замаскированную, частично замаскированную (soft mask) и полностью видимую. Параметр 𝑘 при этом плавно затухает от 0.5 до нуля в течение обучения, реализуя progressive training strategy. Как показывают визуализации, такой подход даёт значительно более плавные и семантически согласованные переходы между регионами, нежели жёсткое пороговое маскирование, и позволяет эффективно локализовать дискриминативные регионы [18].

Теоретическое обоснование эффективности адаптивного маскирования было получено в работе [10] через анализ сложности Радемахера. Авторы формализуют три класса гипотез:  (без маскирования), ​(случайное маскирование всех признаков, включая значимые) и ​ (адаптивное маскирование, при котором значимые признаки маскируются с высокой вероятностью). По определению выполняется вложение

 , откуда в силу монотонности сложности Радемахера следует . Стандартная граница обобщения , тогда непосредственно влечёт, что при равных эмпирических потерях граница обобщения для адаптивного маскирования строго уже, чем для случайного или отсутствия маскирования. Это, на наш взгляд, и есть тот самый теоретический фундамент, которого так не хватало ранним эвристическим методам.

Экспериментальная валидация подтверждает теоретические выводы. На бенчмарке ODinW_13 (Zero-Shot) метод IMAGE(RG) достигает 0.251 AP, превосходя базовую линию без маскирования на 4.3%, а лучшие существующие подходы — MaskCLIP на 2.6%, CenterMask на 2.1% и ClusterMask на 1.8% [10]. В Low-Shot сценарии на COCO val2017 IMAGE(RG) показывает 0.437 AP (+3.7% к baseline). Особенно показателен результат в ultra-low data режиме (1% размеченных данных): если baseline даёт 1.90 AP, а Random Mask — 0.95 AP, то IMAGE(RG) достигает 3.30 AP, что ярко демонстрирует эффективность целенаправленного маскирования в условиях экстремальной нехватки данных. В closed-set оценке на COCO val2017 IMAGE(RG) превосходит даже семантически-ориентированные методы, такие как SemMAE [16], достигая 0.481 AP против 0.469 AP, причём без привлечения внешних семантических priors.

Важным результатом является архитектурная универсальность подхода. Если основные эксперименты в работе [10] проводились на Grounding DINO [12] со Swin-T backbone, то дополнительная серия опытов на YOLO-World показала сопоставимые приросты. Это убедительно доказывает, что предложенная парадигма не привязана к конкретному типу архитектуры. Вычислительные накладные расходы при этом оказываются умеренными: время обучения увеличивается примерно на 10%, потребление памяти — на ~100 МБ, но на этапе инференса дополнительные затраты полностью отсутствуют.

Подводя итоги, можно констатировать, что эволюция методов маскирования в компьютерном зрении прошла путь от интуитивных стохастических приёмов до строго обоснованных адаптивных стратегий. Случайное удаление патчей уступило место целенаправленному сокрытию значимых регионов, что, на первый взгляд парадоксально, но на деле оказывается естественным следствием требования к модели рассуждать на основе частичной информации. Метод IMAGE и его гауссовская модификация RFGAM демонстрируют, что такое маскирование не только улучшает Zero-Shot и Low-Shot производительность, но и имеет строгое теоретическое обоснование через сужение класса гипотез.

Вместе с тем, ряд вопросов остаётся открытым. Во-первых, отсутствует единая теоретическая framework, объединяющая различные подходы к маскированию. Во-вторых, масштабируемость методов на очень большие модели и высокие разрешения требует дополнительной проверки. В-третьих, перспективным представляется распространение идеи адаптивного маскирования на мультимодальные vision-language модели, такие как CLIP [11], а также на 3D- и видео-данные. Как нам представляется, именно в этих направлениях и будет продолжаться развитие области в ближайшие годы.

Список литературы

  1. Rezaei M., Shahidi M. Zero-shot learning and its applications from autonomous vehicles to covid-19 diagnosis: A review // Intelligence-based medicine. — 2020. — Vol. 3. — P. 100005.
  2. DeVries T., Taylor G.W. Improved regularization of convolutional neural networks with cutout // arXiv preprint arXiv:1708.04552. — 2017.
  3. Zhong Z., Zheng L., Kang G., Song S., Yang Y. Random erasing data augmentation // Proceedings of the AAAI conference on artificial intelligence. — 2020. — Vol. 34, № 07. — P. 13001–13008.
  4. Dosovitskiy A., Beyer L., Kolesnikov A. et al. An image is worth 16x16 words: Transformers for image recognition at scale // International Conference on Learning Representations. — 2021.
  5. He K., Chen X., Xie S., Li Y., Dollár P., Girshick R. Masked autoencoders are scalable vision learners // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2022. — P. 16000–16009.
  6. Bao H., Dong L., Wei F. BEiT: BERT pre-training of image transformers // International Conference on Learning Representations. — 2021.
  7. Yang Y., Huang W., Wei Y. et al. Attentive mask CLIP // Proceedings of the IEEE/CVF International Conference on Computer Vision. — 2023. — P. 2771–2781.
  8. Liang M., Larson M. Centered masking for language-image pre-training // Joint European Conference on Machine Learning and Knowledge Discovery in Databases. — Springer, 2024. — P. 90–106.
  9. Wei Z., Pan Z., Owens A. Efficient vision-language pre-training by cluster masking // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2024. — P. 26815–26825.
  10. Anonymous. Adaptive masking enhances visual grounding // Under review as a conference paper at ICLR. — 2026.
  11. Radford A., Kim J.W., Hallacy C. et al. Learning transferable visual models from natural language supervision // International conference on machine learning. — PMLR, 2021. — P. 8748–8763.
  12. Liu S., Zeng Z., Ren T. et al. Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection // arXiv preprint arXiv:2303.05499. — 2023.
  13. Lin T.-Y., Maire M., Belongie S. et al. Microsoft COCO: Common objects in context // Computer Vision–ECCV 2014. — Springer, 2014. — P. 740–755.
  14. Lampert C.H., Nickisch H., Harmeling S. Learning to detect unseen object classes by between-class attribute transfer // 2009 IEEE Conference on Computer Vision and Pattern Recognition. — IEEE, 2009. — P. 951–958.
  15. Snell J., Swersky K., Zemel R.S. Prototypical networks for few-shot learning // Advances in Neural Information Processing Systems. — 2017. — Vol. 30.
  16. Li G., Zheng H., Liu D. et al. SemMAE: Semantic-guided masking for learning masked autoencoders // Advances in Neural Information Processing Systems. — 2022. — Vol. 35. — P. 14290–14302.
  17. Vaswani A., Shazeer N., Parmar N. et al. Attention is all you need // Advances in Neural Information Processing Systems. — 2017. — P. 5998–6008.
  18. Zhou B., Khosla A., Lapedriza A., Oliva A., Torralba A. Learning deep features for discriminative localization // Proceedings of the IEEE conference on computer vision and pattern recognition. — 2016. — P. 2921–2929.

Поделиться

Обнаружили грубую ошибку (плагиат, фальсифицированные данные или иные нарушения научно-издательской этики)? Напишите письмо в редакцию журнала: info@apni.ru

Похожие статьи

Другие статьи из раздела «Информационные технологии»

Все статьи выпуска
Актуальные исследования

#31 (317)

Прием материалов

25 июля - 31 июля

осталось 6 дней

Размещение PDF-версии журнала

5 августа

Размещение электронной версии статьи

сразу после оплаты

Рассылка печатных экземпляров

19 августа