Послойная обобщенная гладкость: единый подход для адаптивных LMO-оптимизаторов
Аннотация
Недавно появившиеся алгоритмы, основанные на оракуле линейной минимизации (Linear Minimization Oracle, LMO), такие как Muon и Scion, становятся конкурентоспособной заменой оптимизатору Adam. Они обеспечивают более эффективное использование памяти, лучшую переносимость гиперпараметров и превосходное эмпирическое качество в крупномасштабных задачах, например при обучении больших языковых моделей (LLM). Тем не менее между их практическим успехом и теоретическим пониманием сохраняется существенный разрыв: предшествующий анализ игнорирует послойное применение этих оптимизаторов и опирается на нереалистичные предположения о гладкости, приводящие к непрактично малым шагам. Чтобы устранить эти проблемы, мы предлагаем обобщённый послойный LMO-подход вместе с уточнённой моделью обобщённой гладкости. Такой подход точно учитывает послойную геометрию нейронных сетей и даёт гарантии сходимости с высокой предсказательной силой. Кроме того, в отличие от предыдущих результатов, предсказанные теоретические шаги близко соответствуют тонко настроенным значениям. Эксперименты с NanoGPT и CNN подтверждают, что наше предположение выполняется вдоль траектории оптимизации, что в итоге устраняет разрыв между теорией и практикой.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 25-48.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(4)-2
Для цитирования
Полный текст статьи в формате pdf
Вернуться к содержанию тома