Угрозы безопасности и приватности в информационных системах с интеграцией больших языковых моделей: комплексный аналитический фреймворк
Угрозы безопасности и приватности в информационных системах с интеграцией больших языковых моделей: комплексный аналитический фреймворк
Аннотация
В статье представлен подход к автоматизированному структурированию информации о событиях, извлекаемой из неструктурированных текстовых Интернет-источников, для задач углублённого анализа процессов. Во многих практических случаях сведения о событиях, происходящих в рамках различных процессов, представлены не в виде готовых журналов событий, а распределены по новостным публикациям, отчётам и другим текстовым материалам. Это существенно усложняет применение средств анализа процессов, использующих данные, представленные в определённых форматах (например XES), поскольку требует выполнить поиск релевантных текстов, их интерпретацию и преобразование в структурированное представление, пригодное для анализа с помощью существующих средств Process Mining. Задача ещё более усложняется, если необходимо извлекать дополнительные атрибуты, связанные с описанными событиями, что даёт возможность выявить более глубокие закономерности, характеризующие исследуемые процессы, применять новые методы анализа процессов, учитывающие эти характеристики. Предлагаемый подход основан на сочетании онтологического представления знаний о предметных областях и источниках данных и больших языковых моделей, генеративного искусственного интеллекта. Онтологический слой используется для описания предметных областей исследуемых процессов, открытых источников информации о них, пользовательских запросов и результатов обработки найденной информации, тогда как генеративные модели обеспечивают поиск релевантной информации, извлечение данных о событиях и их первичную обработку и структурирование. Для реализации подхода предложена общая архитектура решения, позволяющего автоматизировать получение текстовых данных из различных источников на основе пользовательских запросов, сформированных с использованием онтологии, предобработку полученных данных с использованием генеративных моделей, структурирование и нормализацию извлечённых данных о событиях, а также подготовку данных для формирования журналов событий в заданных форматах. Для иллюстрации возможностей предложенного подхода рассматривается контролируемый экспериментальный сценарий. Проведённые эксперименты показали, что описанное программное решение позволяет находить релевантные текстовые материалы, выделять события и их атрибуты, а также формировать структурированное представление, пригодное для последующего преобразования в журнал событий. Вместе с тем результаты показали необходимость дополнительной нормализации данных и экспертной интерпретации части извлечённой информации.
Ключевые слова
Издание
Труды Института системного программирования РАН, том 38, вып. 4, часть 1, 2026, стр. 153-170.
ISSN 2220-6426 (Online), ISSN 2079-8156 (Print).
DOI: 10.15514/ISPRAS-2026-38(4)-8
Для цитирования
Полный текст статьи в формате pdf
Вернуться к содержанию тома