Метод адаптивного синтеза изображений высокого разрешения на основе диффузионных трансформеров


Метод адаптивного синтеза изображений высокого разрешения на основе диффузионных трансформеров

Ананьев В.В. (ИСП РАН, Москва, Россия)
Ефимов Э.В. (ИСП РАН, Москва, Россия)
Земнухов Е.С. (ИСП РАН, Москва, Россия)
Тимакова А.А. (Сеченовский университет, Москва, Россия)
Карпулевич Е.А. (ИСП РАН, Москва, Россия)

Аннотация

В работе рассматривается задача адаптивного синтеза изображений высокого разрешения для цифровой патологии. Предложен генеративный конвейер на базе латентного диффузионного трансформера, объединяющий кодирование изображений в латентное пространство, визуальное обусловливание признаками фундаментальной модели UNI2-h, архитектурную оптимизацию слоев внимания за счет KV-компрессии и доменную специализацию с использованием низкоранговых адаптеров LoRA. Описан алгоритм контекстно-ориентированного встраивания объектов, который совмещает пространственно-хроматическое выравнивание, семантически обусловленную диффузию из промежуточного латентного состояния и морфологическое смешивание границ. Программная реализация построена как модульный комплекс из контуров ввода-вывода, латентно-признакового кодирования, генерации и подготовки данных для прикладных моделей. Экспериментальная верификация выполнена на задачах сегментации сосудистых структур и классификации участков лимфоваскулярной инвазии; результаты показывают, что направленное добавление синтетических изображений может повышать качество прикладных моделей в условиях дефицита данных. Эксперименты выполнены с использованием базы из 449 полнослайдовых изображений (WSI), состоящей из выборок DHMC, LCNOV и NLST. Синтетическое расширение выборки включает 5172 изображений для сегментации и 4520 изображений для классификации. Используемые аппаратно-программные оптимизации позволили сократить длительность эпохи обучения и пиковое потребление VRAM, добавление синтетических данных повысило значение метрики IoU модели UNet++ и значение метрики F1-score модели EfficientNet-b1.

Ключевые слова

латентная диффузионная модель; диффузионный трансформер; синтез изображений; визуальное обусловливание; адаптер LoRA; технология inpainting; гигапиксельные изображения; цифровая патология.

Издание

Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 225-238.

ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).

DOI: 10.15514/ISPRAS-2026-38(4)-12

Для цитирования

Ананьев В.В., Ефимов Э.В., Земнухов Е.С., Тимакова А.А., Карпулевич Е.А. Метод адаптивного синтеза изображений высокого разрешения на основе диффузионных трансформеров. Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 225-238. DOI: 10.15514/ISPRAS-2026-38(4)-12.

Полный текст статьи в формате pdf Вернуться к содержанию тома