Архитектура машинного обучения EG-TD3: эволюционно-направленный двойной задержанный глубокий детерминированный градиент политики


Архитектура машинного обучения EG-TD3: эволюционно-направленный двойной задержанный глубокий детерминированный градиент политики

Джамбонг Тенке Х.-Д. (НИУ ВШЭ, Москва, Россия)

Аннотация

В работе представлена архитектура EG-TD3 (Evolutionary-Guided Twin Delayed Deep Deterministic Policy Gradient) – гибридный конвейер обучения, объединяющий алгоритм TD3 и дифференциальную эволюцию для адаптивного управления буферизацией пакетов в нестационарных условиях. На стандартном тесте непрерывного управления (Pendulum-v1) и синтетическом симуляторе очередей с всплесками трафика показано, что EG-TD3 повышает стабильность обучения (коэффициент вариации 0,005 против 0,258 у TD3) и плавность управляющих воздействий (средняя дельта действий 0,052 против 0,164), сохраняя конкурентоспособную устойчивость к шуму наблюдений и действий. Архитектура использует периодическую замену элитных параметров и исследование, направляемое функцией приспособленности. Помимо результатов обучения описан путь развёртывания в сервисной сети на основе разделённых плоскостей управления и данных. Обучение и вывод EG-TD3 выполняются в пользовательском пространстве рядом с плоскостью управления сервисной сети, поскольку полноценное машинное обучение внутри eBPF ограничено верификатором и набором инструкций. На узловой плоскости данных программы eBPF, подключаемые к точкам перехватка TC или сокетов и работающие совместно с прокси в дополнительном контейнере (например, Envoy), собирают телеметрию буферизации и трафика в BPF-карты и применяют квантованные управляющие решения (целевой размер буфера, таймаут и пороги срочности) с частотой контура управления 10–100 Гц, без обучения на пути пакета. Взаимодействие опосредуется общими BPF-картами: eBPF записывает телеметрию; агент EG-TD3 считывает состояние и записывает параметры управления; eBPF применяет обновлённую политику. Обучение на журналах траекторий (офлайн или в прокси в дополнительном контейнере) не блокирует быстрый путь. Приведены полные спецификации гиперпараметров и открытая реализация для воспроизводимости результатов.

Ключевые слова

управление сетями; адаптивная буферизация; глубокое обучение с подкреплением; EG-TD3; двойной отсроченный глубокий детерминированный градиент политики (TD3); дифференциальная эволюция (DE).

Издание

Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 135-152.

ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).

DOI: 10.15514/ISPRAS-2026-38(4)-7

Для цитирования

Джамбонг Тенке Х.-Д. Архитектура машинного обучения EG-TD3: эволюционно-направленный двойной задержанный глубокий детерминированный градиент политики. Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 135-152. DOI: 10.15514/ISPRAS-2026-38(4)-7.

Полный текст статьи в формате pdf (на английском) Вернуться к содержанию тома