Малошаговые диффузионные модели с прогрессивным увеличением разрешения для генерации изображений и видео
Малошаговые диффузионные модели с прогрессивным увеличением разрешения для генерации изображений и видео
Аннотация
Современные методы дистилляции диффузионных моделей достигли значительного прогресса, обеспечивая качественную генерацию примерно за 4 шага для крупномасштабных диффузионных моделей генерации изображений и видео по текстовому описанию. Однако дальнейшее уменьшение количества шагов генерации становится всё более сложной задачей. Это наводит на мысль о том, что для повышения эффективности, возможно, стоит обратить внимание на другие степени свободы. Руководствуясь этой идеей, мы представляем SwD – подход для дистилляции диффузионных моделей с постепенным увеличением масштаба генерируемого изображения (Scale-wise Distillation, SwD), который наделяет малошаговые модели способностью к прогрессивной генерации, избегая избыточных вычислений на промежуточных шагах диффузионного процесса. Помимо повышения эффективности, SwD расширяет семейство методов дистилляции, предлагая простую функцию потерь дистилляции на уровне локальных фрагментов изображения или видео, основанную на метрике Maximum Mean Discrepancy (MMD). Эта функция потерь значительно повышает эффективность существующих методов дистилляции и демонстрирует конкурентное качество при использовании в качестве самостоятельного метода. Применённый к современным диффузионным моделям генерации изображений и видео по тексту, SwD приближается по скорости генерации к двум полноразмерным шагам и значительно превосходит альтернативы при сопоставимых вычислительных затратах, что подтверждается автоматическими метриками и исследованиями пользовательских предпочтений.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 5, 2026, стр. 175-194.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(5)-11
Для цитирования
Полный текст статьи в формате pdf
Вернуться к содержанию тома