Созданная композиционная структура позволяет оптимизировать процесс подбора подходящих инструментов для поиска уязвимостей моделей компьютерного зрения. Это повысит безопасность управления воздушным и автомобильным транспортом.

Сегодня в системах для автоматического или полуавтоматического ведения транспортного средства по заданному маршруту применяются модели компьютерного зрения. Они позволяют снизить нагрузку на оператора в авиации, в морском транспорте и в современных автомобилях.

Принцип работы таких нейросетей основан на распознавании и классификации объектов по входящему изображению. Главным препятствием для их безопасного использования являются атаки со стороны злоумышленников, которые накладывают на входное изображение специальные фильтры. Они незаметны для человеческого глаза, но заставляют модель ошибочно классифицировать объект. В критических системах даже небольшие ошибки при распознавании пешехода или дорожного знака могут привести к катастрофе.

На данный момент оценка устойчивости моделей проводится вручную: специалисты подбирают параметры и затем выбирают, какой способ лучше подойдет для конкретной модели. Однако такой метод не позволяет систематически и автоматически исследовать все пространство возможных атак, из-за чего значительная часть уязвимостей остается необнаруженной, а результаты оценки зависят от субъективного опыта конкретного специалиста, а не от воспроизводимой методологии.

«Мы создали единую базу данных, содержащую все существующие инструменты для поиска уязвимостей в моделях компьютерного зрения, и разработали эволюционный алгоритм оптимизации, который автоматически перебирает комбинации методов, настраивает параметры и подбирает конфигурацию, наиболее эффективно выявляющую уязвимости конкретной модели. Такой способ требует только запуск алгоритма вместо ручного подбора, что позволяет обнаружить все возможные «слабые места» в нейросетях, используемых в автопилоте». – Руководитель лаборатории фундаментальных основ построения интеллектуальных систем (ФОИС), доцент кафедры информационной безопасности (ИБ) СПбГЭТУ «ЛЭТИ» Алла Борисовна Левина

Сначала исследователи разбили поиск уязвимостей на шесть модулей, включая инициализаторы (метод, который задает начальное значение для переменной), функции потерь (формула, которая определяет насколько сильно ответ программы отличается от правильного ответа), планировщики и градиент моделей (вектор частных производных функции потерь по всем параметрам). Каждый из них может быть собран из взаимозаменяемых инструментов. На этой основе был создан программный комплекс и общая база инструментов, а подбор конфигураций был переведен в задачу оптимизации «черного ящика», где для поиска эффективных сочетаний применялись байесовская оптимизация и специально разработанный эволюционный алгоритм.

Для проверки подхода ученые обучили собственную модель компьютерного зрения на сверточной нейросети для распознавания и классификации изображений, которая решает проблему затухания градиента в глубоких моделях за счет передачи сигнала в обход слоев, а также на крупномасштабной базе данных изображений. После этого исследователи сравнили устойчивость модели с помощью ключевых методов и стандартов в области машинного обучения, которые необходимы для создания и тестирования «враждебных примеров», а также посредством конфигураций, синтезированных предложенным алгоритмом.

Оценка велась по двум параметрам: доле изображений, на которых модель ошибалась, и заметности внесенных изменений для человеческого глаза, которую измеряли по метрике, отражающей среднее отклонение по всем пикселям изображения.

«Результаты показали, что созданная композиционная структура находит более скрытые способы обмана нейросетей. Если обычный алгоритм смог обмануть нейросеть лишь в 13% случаев из тысячи картинок, то новый подход, подобранный программой, сработал в 58%. При этом искажения, вносимые в изображения удалось снизить примерно на 15% по сравнению с обычным методом. Визуально они выглядят просто как легкий шум на несколько раз пересохраненной фотографии, а не как грубая подделка. Таким образом мы создаем инструмент аудита безопасности, который позволит разработчикам до выпуска модели в открытый доступ проверить ее, выявить наиболее серьезные уязвимости и заранее устранить их». – Младший научный сотрудник лаборатории ФОИС, аспирант кафедры ИБ СПбГЭТУ «ЛЭТИ» Роман Радионов

В дальнейшем исследователи планируют перейти от моделей «белого ящика», где доступен полный доступ к параметрам модели, к моделям «черного ящика», в которых виден только вход и выход системы без внутренней архитектуры. Цель состоит в том, чтобы алгоритм мог автоматически подбирать эффективные и малозаметные способы поиска уязвимостей и в таких условиях. Также они расширят подход на большие языковые модели, работающие с текстом, так как логика разложения проверки на модульные компоненты и автоматического подбора инструментов теоретически применима и к ним.

Результаты представлены в научном журнале Nature (Q1). Исследование профинансировано Министерством науки и высшего образования Российского научного фонда в рамках проекта «Госадание» № 075-00003-24-02, FSEE-2024-0003.