Метод оцінки захищеності застосунків з інтегрованими агентами на основі великих мовних моделей

Вантажиться...
Ескіз

Дата

2026

Науковий керівник

Назва журналу

Номер ISSN

Назва тому

Видавець

КПІ ім. Ігоря Сікорського

Анотація

Запропоновано метод оцінки захищеності застосунків з інтегрованими агентами на основі великих мовних моделей (ВММ). Метод включає формалізовану модель загроз із чотирирівневою поверхнею атаки, каталог тестових сценаріїв у п'яти категоріях adversarial атак та систему з чотирьох метрик для кількісного порівняння стійкості моделей. Проведено експериментальну верифікацію на 2000 тестових запусках для чотирьох конфігурацій open-source моделей (Llama 3.1, Ministral 3, Qwen 3 без та з reasoning). Загальний показник ASR варіюється від 6,2 % до 23,8 %, а увімкнення reasoning знижує його у 3,5 рази.

Опис

Ключові слова

кібербезпека, великі мовні моделі, LLM-агенти, prompt injection, оцінка захищеності, adversarial testing

Бібліографічний опис

Редько-Шпак, Р. А. Метод оцінки захищеності застосунків з інтегрованими агентами на основі великих мовних моделей / Р. А. Редько-Шпак, І. В. Стьопочкіна // Теоретичні і прикладні проблеми фізики, математики та інформатики : матеріали XXIV Всеукраїнської науково-практичної конференції студентів, аспірантів та молодих вчених, [Київ], 13–16 травня 2026 р. / КПІ ім. Ігоря Сікорського. – Київ, 2026. – С. 261-263.

ORCID

DOI