Система інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP)
Дата
2026
Автори
Науковий керівник
Назва журналу
Номер ISSN
Назва тому
Видавець
КПІ ім. Ігоря Сікорського
Анотація
Дипломний проєкт присвячено розробці системи інтелектуального аналізу текстових даних із використанням методів обробки природної мови.
У роботі проаналізовано сучасні сервіси обробки природної мови та обґрунтовано потребу у відкритому рішенні, яке усуває ризики непрозорості обробки даних і залежності від постачальника послуг. Визначено поняття природної мови та наведено класифікацію текстових даних за їхньою структурою й обсягом. Описано процес розбиття тексту на токени та перетворення токенів на векторні представлення, що називаються ембедінгами, а також архітектури рекурентних нейронних мереж RNN та LSTM.
На підставі оглянутого матеріалу сформовано технологічний стек: бібліотека spaCy, фреймворк FastAPI, система керування базами даних PostgreSQL, сховище Redis та бібліотека React. Описано процес підготовки набору даних і генерації синтетичних даних для донавчання моделі класифікації спаму, а також тестування її роботи на незалежному наборі даних.
Реалізовано три модулі обробки природної мови: класифікатор спаму на основі донавченої моделі DistilBERT, модуль анонімізації персональних даних, що працює за допомогою регулярних виразів та розпізнавання іменованих сутностей, і модуль вилучення ключових слів. Серверну частину побудовано з розмежуванням двох категорій клієнтів за допомогою JWT-токенів та API-ключів, а клієнтський інтерфейс реалізовано як односторінковий застосунок, що побудований за допомогою бібліотеки React. Працездатність усіх компонентів підтверджено тестуванням, зокрема через реальні запити до запущеного сервісу. Текст програмного коду розміщено на платформі GitHub у відкритому доступі.
Опис
Ключові слова
обробка природної мови, natural language processing, класифікація спаму, spam classification, анонімізація персональних даних, personal data anonymization, вилучення ключових слів, keyword extraction, DistilBERT, FastAPI, API
Бібліографічний опис
Галай, А. В. Система інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP) : дипломний проєкт ... бакалавра : 121 Інженерія програмного забезпечення / Галай Андрій Вікторович. – Київ, 2026. – 99 с.