Метод адаптивного синтеза изображений высокого разрешения на основе диффузионных трансформеров
Аннотация
В работе рассматривается задача адаптивного синтеза изображений высокого разрешения для цифровой патологии. Предложен генеративный конвейер на базе латентного диффузионного трансформера, объединяющий кодирование изображений в латентное пространство, визуальное обусловливание признаками фундаментальной модели UNI2-h, архитектурную оптимизацию слоев внимания за счет KV-компрессии и доменную специализацию с использованием низкоранговых адаптеров LoRA. Описан алгоритм контекстно-ориентированного встраивания объектов, который совмещает пространственно-хроматическое выравнивание, семантически обусловленную диффузию из промежуточного латентного состояния и морфологическое смешивание границ. Программная реализация построена как модульный комплекс из контуров ввода-вывода, латентно-признакового кодирования, генерации и подготовки данных для прикладных моделей. Экспериментальная верификация выполнена на задачах сегментации сосудистых структур и классификации участков лимфоваскулярной инвазии; результаты показывают, что направленное добавление синтетических изображений может повышать качество прикладных моделей в условиях дефицита данных. Эксперименты выполнены с использованием базы из 449 полнослайдовых изображений (WSI), состоящей из выборок DHMC, LCNOV и NLST. Синтетическое расширение выборки включает 5172 изображений для сегментации и 4520 изображений для классификации. Используемые аппаратно-программные оптимизации позволили сократить длительность эпохи обучения и пиковое потребление VRAM, добавление синтетических данных повысило значение метрики IoU модели UNet++ и значение метрики F1-score модели EfficientNet-b1.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 225-238.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(4)-12
Для цитирования
Полный текст статьи в формате pdf
Вернуться к содержанию тома