Система інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP)
| dc.contributor.advisor | Трочун, Євгеній Володимирович | |
| dc.contributor.author | Галай, Андрій Вікторович | |
| dc.date.accessioned | 2026-09-09T11:32:36Z | |
| dc.date.available | 2026-09-09T11:32:36Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Дипломний проєкт присвячено розробці системи інтелектуального аналізу текстових даних із використанням методів обробки природної мови. У роботі проаналізовано сучасні сервіси обробки природної мови та обґрунтовано потребу у відкритому рішенні, яке усуває ризики непрозорості обробки даних і залежності від постачальника послуг. Визначено поняття природної мови та наведено класифікацію текстових даних за їхньою структурою й обсягом. Описано процес розбиття тексту на токени та перетворення токенів на векторні представлення, що називаються ембедінгами, а також архітектури рекурентних нейронних мереж RNN та LSTM. На підставі оглянутого матеріалу сформовано технологічний стек: бібліотека spaCy, фреймворк FastAPI, система керування базами даних PostgreSQL, сховище Redis та бібліотека React. Описано процес підготовки набору даних і генерації синтетичних даних для донавчання моделі класифікації спаму, а також тестування її роботи на незалежному наборі даних. Реалізовано три модулі обробки природної мови: класифікатор спаму на основі донавченої моделі DistilBERT, модуль анонімізації персональних даних, що працює за допомогою регулярних виразів та розпізнавання іменованих сутностей, і модуль вилучення ключових слів. Серверну частину побудовано з розмежуванням двох категорій клієнтів за допомогою JWT-токенів та API-ключів, а клієнтський інтерфейс реалізовано як односторінковий застосунок, що побудований за допомогою бібліотеки React. Працездатність усіх компонентів підтверджено тестуванням, зокрема через реальні запити до запущеного сервісу. Текст програмного коду розміщено на платформі GitHub у відкритому доступі. | |
| dc.description.abstractother | This bachelor's thesis addresses the development of a system for intelligent textual data analysis based on natural language processing techniques. The work reviews existing natural language processing services and argues for an open alternative that mitigates the risks of opaque data handling and vendor lock-in. It defines the notion of natural language and classifies textual data according to its structure and volume. The fundamentals of text processing are then outlined, including tokenization, the transformation of tokens into vector representations known as embeddings, and the architectures of recurrent neural networks such as RNN and LSTM. Drawing on this review, a technology stack was chosen, comprising the spaCy library, the FastAPI framework, the PostgreSQL database management system, Redis for in-memory storage, and the React library. The project further describes the preparation of the dataset and the generation of synthetic data for fine-tuning the spam classification model, as well as the evaluation of its performance on an independent dataset. Three natural language processing modules were implemented: a spam classifier built on a fine-tuned DistilBERT model, a personal data anonymization module combining regular expressions with named-entity recognition, and a keyword extraction module. The back end distinguishes between two categories of clients through JWT tokens and API keys, while the front end is implemented as a single-page application developed with React. All components were validated through testing, including live requests to the deployed service. The source code is publicly available on GitHub. | |
| dc.format.extent | 99 с. | |
| dc.identifier.citation | Галай, А. В. Система інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP) : дипломний проєкт ... бакалавра : 121 Інженерія програмного забезпечення / Галай Андрій Вікторович. – Київ, 2026. – 99 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/82918 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | обробка природної мови | |
| dc.subject | natural language processing | |
| dc.subject | класифікація спаму | |
| dc.subject | spam classification | |
| dc.subject | анонімізація персональних даних | |
| dc.subject | personal data anonymization | |
| dc.subject | вилучення ключових слів | |
| dc.subject | keyword extraction | |
| dc.subject | DistilBERT | |
| dc.subject | FastAPI | |
| dc.subject | API | |
| dc.title | Система інтелектуального аналізу текстових даних із використанням методів обробки природної мови (NLP) | |
| dc.type | Bachelor Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- halai_bakalavr.pdf
- Розмір:
- 3.17 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: