Система інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP)

dc.contributor.advisorТрочун, Євгеній Володимирович
dc.contributor.authorГалай, Андрій Вікторович
dc.date.accessioned2026-09-09T11:32:36Z
dc.date.available2026-09-09T11:32:36Z
dc.date.issued2026
dc.description.abstractДипломний проєкт присвячено розробці системи інтелектуального аналізу текстових даних із використанням методів обробки природної мови. У роботі проаналізовано сучасні сервіси обробки природної мови та обґрунтовано потребу у відкритому рішенні, яке усуває ризики непрозорості обробки даних і залежності від постачальника послуг. Визначено поняття природної мови та наведено класифікацію текстових даних за їхньою структурою й обсягом. Описано процес розбиття тексту на токени та перетворення токенів на векторні представлення, що називаються ембедінгами, а також архітектури рекурентних нейронних мереж RNN та LSTM. На підставі оглянутого матеріалу сформовано технологічний стек: бібліотека spaCy, фреймворк FastAPI, система керування базами даних PostgreSQL, сховище Redis та бібліотека React. Описано процес підготовки набору даних і генерації синтетичних даних для донавчання моделі класифікації спаму, а також тестування її роботи на незалежному наборі даних. Реалізовано три модулі обробки природної мови: класифікатор спаму на основі донавченої моделі DistilBERT, модуль анонімізації персональних даних, що працює за допомогою регулярних виразів та розпізнавання іменованих сутностей, і модуль вилучення ключових слів. Серверну частину побудовано з розмежуванням двох категорій клієнтів за допомогою JWT-токенів та API-ключів, а клієнтський інтерфейс реалізовано як односторінковий застосунок, що побудований за допомогою бібліотеки React. Працездатність усіх компонентів підтверджено тестуванням, зокрема через реальні запити до запущеного сервісу. Текст програмного коду розміщено на платформі GitHub у відкритому доступі.
dc.description.abstractotherThis bachelor's thesis addresses the development of a system for intelligent textual data analysis based on natural language processing techniques. The work reviews existing natural language processing services and argues for an open alternative that mitigates the risks of opaque data handling and vendor lock-in. It defines the notion of natural language and classifies textual data according to its structure and volume. The fundamentals of text processing are then outlined, including tokenization, the transformation of tokens into vector representations known as embeddings, and the architectures of recurrent neural networks such as RNN and LSTM. Drawing on this review, a technology stack was chosen, comprising the spaCy library, the FastAPI framework, the PostgreSQL database management system, Redis for in-memory storage, and the React library. The project further describes the preparation of the dataset and the generation of synthetic data for fine-tuning the spam classification model, as well as the evaluation of its performance on an independent dataset. Three natural language processing modules were implemented: a spam classifier built on a fine-tuned DistilBERT model, a personal data anonymization module combining regular expressions with named-entity recognition, and a keyword extraction module. The back end distinguishes between two categories of clients through JWT tokens and API keys, while the front end is implemented as a single-page application developed with React. All components were validated through testing, including live requests to the deployed service. The source code is publicly available on GitHub.
dc.format.extent99 с.
dc.identifier.citationГалай, А. В. Система інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP) : дипломний проєкт ... бакалавра : 121 Інженерія програмного забезпечення / Галай Андрій Вікторович. – Київ, 2026. – 99 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/82918
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectобробка природної мови
dc.subjectnatural language processing
dc.subjectкласифікація спаму
dc.subjectspam classification
dc.subjectанонімізація персональних даних
dc.subjectpersonal data anonymization
dc.subjectвилучення ключових слів
dc.subjectkeyword extraction
dc.subjectDistilBERT
dc.subjectFastAPI
dc.subjectAPI
dc.titleСистема інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP)
dc.typeBachelor Thesis

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
halai_bakalavr.pdf
Розмір:
3.17 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: