AWA: выравнивание весов на основе активаций для повышения устойчивости статических методов маркирования нейронных сетей
AWA: выравнивание весов на основе активаций для повышения устойчивости статических методов маркирования нейронных сетей
Аннотация
Рассматривается задача повышения устойчивости статических методов маркирования нейронных сетей в сценарии извлечения «белый ящик», при котором цифровой водяной знак (ЦВЗ) извлекается непосредственно из параметров модели. Основное внимание уделяется атаке согласованной перестановки весов, сохраняющей качество работы нейронной сети, но изменяющей порядок параметров, используемый при извлечении водяного знака. Для противодействия такой атаке предлагается алгоритм выравнивания весов на основе активаций AWA, который сопоставляет структурные элементы исходной и атакованной моделей по картам активаций и восстанавливает порядок весов перед извлечением ЦВЗ. В рамках работы AWA интегрируется в процедуру извлечения метода NeuralMark, поскольку данный метод обладает высокой устойчивостью к ряду атак модификации модели, но остается чувствительным к перестановке параметров. Экспериментальная оценка выполнена на нескольких наборах данных, архитектурах нейронных сетей и при разных атаках модификации модели. Результаты показывают, что применение AWA повышает устойчивость NeuralMark к атакам перестановки и сохраняет высокую устойчивость к другим рассмотренным атакам модификации модели. В частности, при атаке согласованной перестановки весов NeuralMark-AWA снижает значение метрики BER на CIFAR-10 и Caltech-101, а значение TPR@FPR увеличивается.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 4, часть 2, 2026, стр. 225-244.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(4)-28
Для цитирования
Полный текст статьи в формате pdf
Вернуться к содержанию тома