Метод оцінки захищеності застосунків з інтегрованими агентами на основі великих мовних моделей
Вантажиться...
Дата
2026
Науковий керівник
Назва журналу
Номер ISSN
Назва тому
Видавець
КПІ ім. Ігоря Сікорського
Анотація
Запропоновано метод оцінки захищеності застосунків з інтегрованими агентами на основі великих мовних моделей (ВММ). Метод включає формалізовану модель загроз із чотирирівневою поверхнею атаки, каталог тестових сценаріїв у п'яти категоріях adversarial атак та систему з чотирьох метрик для кількісного порівняння стійкості моделей. Проведено експериментальну верифікацію на 2000 тестових запусках для чотирьох конфігурацій open-source моделей (Llama 3.1, Ministral 3, Qwen 3 без та з reasoning). Загальний показник ASR варіюється від 6,2 % до 23,8 %, а увімкнення reasoning знижує його у 3,5 рази.
Опис
Ключові слова
кібербезпека, великі мовні моделі, LLM-агенти, prompt injection, оцінка захищеності, adversarial testing
Бібліографічний опис
Редько-Шпак, Р. А. Метод оцінки захищеності застосунків з інтегрованими агентами на основі великих мовних моделей / Р. А. Редько-Шпак, І. В. Стьопочкіна // Теоретичні і прикладні проблеми фізики, математики та інформатики : матеріали XXIV Всеукраїнської науково-практичної конференції студентів, аспірантів та молодих вчених, [Київ], 13–16 травня 2026 р. / КПІ ім. Ігоря Сікорського. – Київ, 2026. – С. 261-263.