Мобильные устройства сегодня фактически превратились в основной инструмент повседневных коммуникаций и двухфакторной аутентификации, через который проходит значительная часть конфиденциальной информации. Принято считать, что защита экрана сводится к тому, чтобы скрыть его от посторонних глаз — от человека или камеры. Однако методы анализа побочных каналов (Side-Channel Analysis, SCA) позволяют обойти подобные барьеры, извлекая данные через физические величины — потребление энергии, электромагнитное излучение и тому подобное. Появление новых, ранее не описанных в литературе векторов атак на мобильные платформы, способных компрометировать коды безопасности и пароли без прямого визуального контакта, и обусловливает актуальность настоящей работы.
Настоящая работа ставит своей целью провести аналитический обзор атаки «Screen Gleaning» и оценить, насколько серьёзную угрозу она представляет для мобильных терминалов. В исследовании рассматриваются физика утечки электромагнитного сигнала, модель злоумышленника, архитектура экспериментального стенда, а также эффективность алгоритмов глубокого обучения при восстановлении сигналов, не интерпретируемых человеком. Исходя из этого, мы полагаем, что сочетание недорогого SDR-оборудования и свёрточных нейронных сетей делает данную атаку вполне реалистичной угрозой, что требует пересмотра подходов к физической защите мобильных устройств, в том числе специального назначения.
Исторически методы TEMPEST, связанные с перехватом непреднамеренных электромагнитных излучений, были ориентированы на стационарные мониторы. Классические работы показывали, что видеосигнал можно перехватывать на расстоянии сотен метров, используя оборудование с минимальной стоимостью. Так, ещё в 1985 году было продемонстрировано, что подобный перехват возможен при затратах порядка 15 долларов [2, с. 270]. Современные мобильные устройства, однако, устроены иначе: миниатюризация компонентов, снижение энергопотребления и жёсткое соблюдение норм электромагнитной совместимости (EMC) существенно ослабляют паразитное излучение. Сигнал утечки в основном исходит от шлейфа, соединяющего графический процессор и экран, который фактически играет роль непреднамеренной антенны. Импедансное рассогласование между кабелем и разъёмами на материнской плате это излучение усиливает. Частоту утечки можно оценить по формуле
,
и
— высота и ширина экрана в пикселях,
— частота обновления в герцах [4].
Чтобы формализовать угрозу, в литературе предлагается пятимерная модель атакующего. Она включает: конечный набор символов сообщения (например, цифры 0–9 с равной вероятностью); стандартный внешний вид сообщения (размер, шрифт, яркость push-уведомления); аппаратное обеспечение (антенна ближнего поля и SDR в непосредственной близости); профилирование устройства (доступ к аналогичному устройству для сбора обучающей выборки в течение 2–3 часов); вычислительные ресурсы (около 24 часов на стандартном ноутбуке или час на GPU для обучения модели). Экспериментальная установка, как правило, включает пассивный магнитный зонд, усилитель и SDR-приёмник, параметры которых тщательно калибруются для максимизации отношения сигнал/шум (SNR).
Характерная особенность атаки «Screen Gleaning» состоит в том, что восстановленный сигнал визуализируется в виде полутонового электромагнитного изображения, которое в литературе получило название «emage». В большинстве случаев из-за низкого SNR такое изображение не читается человеческим глазом, и это принципиально отличает данную атаку от классических TEMPEST-сценариев, где сигнал был визуально различим. Для решения возникшей проблемы применяется машинное обучение, в первую очередь свёрточные нейронные сети (CNN), способные автоматически извлекать признаки изображений и достигать сверхчеловеческой эффективности в задачах, где дискриминативные визуальные паттерны трудно различимы невооружённым глазом, — например, в цифровой криминалистике и стегоанализе [5, 7, 8].
В качестве базовой архитектуры классификатора адаптируется модель LeNet, изначально предложенная для распознавания рукописных цифр. Входной размер emage зависит от устройства: 31×21 пикселей для iPhone 6s, 31×20 для iPhone 6 и 45×21 для Honor 6X. Для сбора данных применяется метод multi-crop: экран заполняется сеткой из ячеек с цифрами, что позволяет из одной сессии генерации emage получить тысячи размеченных примеров. Модель обучается с использованием оптимизатора Adam в течение 100 эпох, после чего проверяется на тестовой выборке, имитирующей реальные текстовые сообщения с 6-значными кодами безопасности.
Экспериментальная проверка на устройстве iPhone 6s показала, что предложенный подход работает достаточно эффективно. Общая точность классификации всех 1200 отдельных цифр (200 кодов по 6 цифр) достигла 89,8%. При этом точность заметно различалась в зависимости от конкретной цифры: от 75,8% для цифры «3» до 99,1% для цифры «4». С практической точки зрения это означает, что с одной попытки атакующий может полностью корректно распознать 6-значный код безопасности в 50,5% случаев, а вероятность правильного распознавания четырёх и более цифр составляет 99,0%. Подобные результаты, на наш взгляд, подтверждают, что атака представляет серьёзную практическую угрозу для систем двухфакторной аутентификации.
Дополнительные эксперименты показали, что атака остаётся работоспособной и в усложнённых условиях. Тестирование в сценарии «cross-device» (обучение на одном iPhone 6 и атака на другом iPhone 6 той же модели) продемонстрировало сохранение высокой точности, что, в свою очередь, снимает необходимость доступа именно к целевому устройству на этапе профилирования. Тесты с физическим препятствием (размещение телефона между страницами журнала) выявили снижение точности из-за зависимости плотности мощности от расстояния по закону
[6]. Однако для устройств с изначально более высоким уровнем утечки (например, Honor 6X) атака оставалась эффективной даже при наличии препятствия толщиной в 200 страниц.
Для стандартизации будущих исследований и объективного сравнения различных аппаратных конфигураций в работе предложен специализированный тестовый стенд, построенный на основе таблицы для проверки остроты зрения («Eye Chart Testbed»). Вместо реальных сообщений используются буквы специального шрифта Sloan в 11 различных масштабах. Такой подход позволяет измерять минимальный уровень визуальных деталей, который может восстановить алгоритм, независимо от конкретного алфавита или языка, и оценивать «остроту» атаки при ослаблении сигнала.
В ответ на выявленные угрозы в литературе обсуждаются три основных уровня контрмер. Аппаратные методы предполагают экранирование шлейфов дисплея (по аналогии с коаксиальными кабелями) или использование металлических чехлов, создающих клетку Фарадея; однако это ведёт к удорожанию, увеличению габаритов и ухудшению качества радиосвязи. Коммуникационные методы включают шифрование видеосигнала между графическим контроллером и экраном по аналогии с системами платного телевидения, что требует внедрения дополнительной логики, протоколов обмена ключами и может внести недопустимые задержки. Графические методы предлагают использование специальных «размытых» шрифтов с «тихим» спектром Фурье или добавление фоновых паттернов для обфускации, но, как показывает практика, такие методы часто оказываются неэффективны против устойчивых моделей машинного обучения и при этом ухудшают читаемость для легитимного пользователя [3].
Проведённый аналитический обзор подтвердил, что атака «Screen Gleaning» представляет собой реалистичную и развивающуюся угрозу для мобильных устройств. Сочетание доступного SDR-оборудования и методов глубокого обучения позволяет успешно восстанавливать конфиденциальную информацию без визуального контакта с экраном, обходя традиционные меры защиты. Как представляется, результаты исследования важны для пересмотра подходов к защите мобильных терминалов: привычных мер вроде отключения экрана или поворота устройства экраном вниз уже недостаточно, требуется комплексная защита на физическом, коммуникационном и графическом уровнях. Будущие исследования, по-видимому, должны быть направлены на переход от сценариев дискриминации (выбор из известного набора) к сценариям полной реконструкции изображения на экране в исходном виде, что потребует разработки ещё более совершенных алгоритмов и специализированных антенных систем.

