Новости
Исследование семантического представления табличных данных для верификации фактов
Аннотация
Таблицы широко используются в различных областях от аналитики до управления, однако их автоматическая интерпретация затруднена структурной неоднородностью и отсутствием явной семантики. В данной статье предложен подход к задаче рассуждений над табличными данными (Table Reasoning), основанный на компактном семантическом представлении таблиц и генерации исполняемых Pandas-запросов к ним. Представление является схемой данных таблицы в формате XML, обогащенной типами данных, семантическими ролями столбцов и контекстуальным описанием, что сохраняет структурные зависимости при значительном сокращении объема данных исходной таблицы. Эксперименты на наборе данных TabFact показали, что модель с LoRA-адаптером достигает наилучшего баланса по точности (80.15%) и исполнимости кода (95.38%). При сравнении модели с базовым решением без учета специальной коррекции ошибок, модель с LoRA-адаптером достигает лучшей точности. В работе также приводиться детальный анализ ошибок, не позволяющих модели продемонстрировать аналогичные базовому решению итоговые результаты с учетом исправления ошибок. Для подтверждения переносимости предложенного подхода на другие данные, были проведены дополнительные эксперименты на наборе данных WikiTableQuestions в контексте задачи ответов на вопросы по табличным данным.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 6, часть 1, 2026, стр. 97-122.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(6)-7
Для цитирования
Полный текст статьи в формате pdf
Вернуться к содержанию тома