Новости
Повышение эффективности квантования больших языковых моделей с архитектурой смеси экспертов
Аннотация
Модели с архитектурой смеси экспертов (Mixture-of-experts, MoE) требуют значительных ресурсов для хранения и выполнения, поэтому их сжатие является актуальной задачей. Посттренировочное квантование весов – один из наиболее эффективных способов уменьшения размера модели, однако существующие методы, например метод GPTQ, при прямом применении к модели MoE работают хуже из-за неравномерной активации экспертов и особенностей маршрутизации. Для устранения указанных недостатков в работе предложены три модификации. Первая – формирование калибровочного набора с повышенной энтропией активаций экспертов за счёт семплирования данных из разных доменов. Вторая – взвешивание гессиана коэффициентами маршрутизатора для более точной оценки вклада экспертов. Третья – введение метрики чувствительности эксперта, позволяющей назначать двухбитное квантование наименее значимым экспертам и трёхбитное – остальным. Эксперименты на модели Qwen3-30B-A3B и Mixtral-8x7b показали, что предложенный метод превосходит существующие аналоги в режиме INT3, а использование метрики чувствительности позволяет понизить среднюю битность для модели до 2.8 с минимальным падением качества генерации текстов. Полученные результаты подтверждают эффективность предложенных модификаций и открывают путь к более компактному развёртыванию MoE-моделей.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 6, часть 1, 2026, стр. 123-138.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(6)-8
Для цитирования
Полный текст статьи в формате pdf
Вернуться к содержанию тома