Гибридный подход к оценке эссе без обучения на целевом корпусе с помощью LLM-агентов на основе рубрик и детерминированных лингвистических признаков
Гибридный подход к оценке эссе без обучения на целевом корпусе с помощью LLM-агентов на основе рубрик и детерминированных лингвистических признаков
Аннотация
Системы автоматической оценки эссе требуют размеченных данных для каждого нового корпуса. В данной работе исследуется, можно ли снизить эту зависимость за счёт объединения двух парадигм: агентов на основе больших языковых моделей (БЯМ), оценивающих эссе без обучения на целевых данных, и детерминированных лингвистических признаков, описывающих лексику, морфологию и синтаксис независимо от рубрики. На эталонном наборе ASAP 2.0 (17 307 эссе, шкала 1-6) гибридный регрессор на основе случайного леса достигает квадратично взвешенной каппы (QWK) = 0,765 на полном корпусе, приближаясь к лучшим результатам методов обучения с учителем (0,841). Признаки в отдельности дают 0,719 без нейросетей. Жадный ансамбль из 15 агентов набирает QWK = 0,650 без обучения. Рубрики, согласованные с целевой популяцией, значимо превосходят межпопуляционные, подтверждая ведущую роль построения рубрик. Результаты формализованы как «спектр переносимости оценки»: детерминированные признаки переносимы наиболее надёжно, за ними следуют рубрики для целевой популяции и межпопуляционные рубрики.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 4, часть 2, 2026, стр. 257-266.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(4)-30
Для цитирования
Полный текст статьи в формате pdf (на английском)
Вернуться к содержанию тома