Модель мультиагентної системи для автоматизованої побудови словника предметної області при обробці потокових даних
| dc.contributor.advisor | Рогоза, Валерій Станіславович | |
| dc.contributor.author | Яременко, Вадим Сергійович | |
| dc.date.accessioned | 2025-06-20T10:06:17Z | |
| dc.date.available | 2025-06-20T10:06:17Z | |
| dc.date.issued | 2025 | |
| dc.description.abstract | Яременко В. С. Модель мультиагентної системи для автоматизованої побудови словника предметної області при обробці потокових даних. Кваліфікаційна наукова праця на правах рукопису. Дисертаційна робота на здобуття наукового ступеня доктора філософії за спеціальністю 122 «Комп’ютерні науки». – Національний технічний університет України «Київський політехнічний інститут імені Ігоря Сікорського», 2025. Метою дисертаційного дослідження є розширення функціоналу існуючих мультиагентних систем завдяки розробці моделі ефективної мультиагентної системи для обробки потокових текстових даних, яка забезпечує швидку фільтрацію, точну класифікацію та адаптивне оновлення доменних словників, використовуючи модифікований фільтр Блума, спеціалізовану нейронну мережу та колективне голосування агентів за нові словники використовуючи комбінацію методів Шульце та TF-IDF. Об’єктом дослідження є процеси обробки потокових текстових даних, що включають фільтрацію, багатокласову класифікацію та оновлення доменних словників. Предметом дослідження є методи та засоби для розробки моделі мультиагентної системи для фільтрації, багатокласової класифікації та оновлення доменних словників у контексті потокової обробки текстових даних. В першому розділі обґрунтовано актуальність дослідження в напрямках мультиагентних систем, обробки потоків текстових даних та використання методів машинного навчання, зважаючи на зростання обсягів інформації. Проведено аналіз наукових праць, визначено невирішені задачі та проблеми, а також описано необхідні експерименти. Запропоновано абстрактну модель мультиагентної системи для аналізу слабоструктурованих текстових даних. У результаті сформульовано задачу дисертації. Другий розділ присвячений розробці моделі мультиагентної системи для автоматичної класифікації вхідних текстів і побудови словника предметної області в умовах постійного надходження великого обсягу даних. У розділі розглянуто практичні аспекти проєктування мультиагентних систем для розподілених обчислень, включаючи стандарти FIPA, мову комунікації ACL, можливі стани агентів і особливості їхнього розгортання на обчислювальних вузлах. Проаналізовано існуючі програмні бібліотеки та фреймворки для створення мультиагентних систем, їхні обмеження та можливості розширення. Запропоновано підходи до організації комунікації та прийняття рішень агентами, зокрема механізм голосування для узгодження кінцевого вигляду словника, а також детально описано мультиагентні підсистеми та формати запитів для їх роботи, запропоновано адаптацію методу Шульце для роботи в розподіленому середовищі. Третій розділ присвячено вирішенню задачі багатокласової класифікації потокових текстових даних, яка є ключовою для автоматичної побудови словників предметних областей. У розділі розглянуто теоретичні основи і визначено напрямки вдосконалення існуючих моделей. Запропоновано модифікацію фільтра Блума для багатокласової класифікації, а також описано використання моделей нейронних мереж для цієї задачі. Проаналізовано можливість інтеграції цих методів у мультиагентну систему, де кожен агент виконує специфічні задачі. Також розглянуто підходи до автоматичної побудови словників, включаючи обробку текстів і їхніх класів, локальне оновлення словників агентами, створення нових агентів у разі перевантаження та узгодження змін у загальному словнику через комунікацію між агентами. Четвертий розділ присвячений практичній реалізації запропонованої моделі та методів, які є базою для практичного втілення даної моделі в середовище МАС і створено комплекс інструментальних програм, який доводить ефективність запропонованої моделі в автоматизованій побудові словників предметної області. У розділі описано процес створення та налаштування моделі мультиагентної системи, яка здійснює багатокласову фільтрацію та класифікацію текстів і формує словник у кількох ітераціях роботи системи. Реалізація включає інтеграцію модифікованого фільтра Блума, нейронних мереж, а також організацію взаємодії між агентами для ефективного оновлення словника та узгодження змін у ньому. Результати роботи системи проілюстровано прикладами ітерацій, що демонструють функціональність та продуктивність запропонованої архітектури. Наукова новизна отриманих результатів. Вперше запропоновано модель мультиагентної системи, яка поєднує модифікований фільтр Блума, нейронну мережу для класифікації текстів, мультиагентний підхід для побудови та оновлення словників і механізм голосування методом Шульце з використанням методу TF-IDF, що дозволяє автоматизувати процес створення словників предметної області в умовах потокової обробки текстових даних. Вперше запропоновано модифікацію класичного фільтра Блума, який відрізняється тим, що він забезпечує швидке виявлення релевантних текстів і виконання їх попередньої класифікації, що забезпечує значне зменшення обсягу необроблених даних на наступних етапах системи та підвищує ефективність роботи в умовах обробки потокових даних. Вперше запропоновано модифікацію методу TF-IDF в розподіленому середовищі для вирішення задачі побудови словника предметної області, яка відрізняється застосуванням адаптованого методу Шульце для використання у мультиагентних системах при голосуванні між агентами щодо оновлення доменних словників, що забезпечує ухвалення рішень на основі колективного аналізу текстових даних. Вперше запропоновано метод оптимізації параметрів налаштування фільтру Блума з використанням генетичного алгоритму для застосування у задачі багатокласової фільтрації потокових текстових даних для підвищення точності їх попередньої класифікації. Розроблено модель нейронної мережі, адаптовану для класифікації текстових даних за кількома предметними областями для заданого набору даних. Розроблено механізм динамічної адаптації системи зворотного зв'язку, який передає оновлений словник назад у фільтр Блума. Це дозволяє динамічно адаптувати систему до нових даних і підвищити точність фільтрації текстів. Такий підхід забезпечує постійну актуальність системи в умовах змінного середовища даних. Практичне значення отриманих результатів полягає у створенні ефективної моделі мультиагентної системи для обробки потокових текстових даних, яка дозволяє автоматизувати процеси фільтрації, класифікації та адаптивного оновлення доменних словників. Запропоновані підходи забезпечують високу швидкість обробки даних завдяки використанню покращеного фільтра Блума та спеціалізованої нейронної мережі, а також підвищують точність і релевантність оновлених словників завдяки колективному голосуванню агентів за методом Шульце. Запропонована модель мультиагентної системи відзначається порівняно низькими вимогами до обчислювальних ресурсів, що дозволяє її ефективно реалізовувати на доступних апаратних платформах. Використання покращеного фільтра Блума зменшує обсяг даних, що передаються на подальші етапи обробки, а розподілений характер системи забезпечує гнучкість та можливість ефективного масштабування відповідно до потреб користувача. Це рішення може бути застосоване для побудови систем моніторингу, аналізу текстових потоків, інформаційного пошуку та виявлення даних у різних доменах, зокрема в кібербезпеці, фінансових системах, соціальних мережах тощо. | |
| dc.description.abstractother | Yaremenko V. S. A multiagent system model for automated domain dictionary construction in stream data processing. a qualification scientific work as a manuscript. Dissertation for obtaining the Doctor of Philosophy scientific degree in specialty 122 "Computer Science". – National Technical University of Ukraine "Igor Sikorsky Kyiv Polytechnic Institute", 2025. The aim of the dissertation research is to expand the functionality of existing multi-agent systems by developing a model of an efficient multi-agent system for processing streaming textual data. This system ensures fast filtering, accurate classification, and adaptive updating of domain dictionaries using a modified Bloom filter, a specialized neural network, and collective agent voting for new dictionaries through a combination of the Schulze method and TF-IDF. Object of the research: the processes of streaming text data processing, which include filtering, multi-class classification, and updating domain-specific dictionaries. Subject of the research: the methods and tools for developing a multiagent system model for filtering, multi-class classification, and updating domainspecific dictionaries in the context of streaming text data processing. The first chapter substantiates the relevance of research in the areas of multiagent systems, streaming text data processing, and machine learning methods, emphasizing the growing volumes of information. A review of scientific literature is provided, identifying unresolved issues and challenges, along with necessary experiments. An abstract model of a multiagent system for analyzing weakly structured text data is proposed. As a result, the dissertation's objective is formulated. The second chapter focuses on the development of a multiagent system model for the automatic classification of incoming texts and the construction of a domain dictionary in conditions of a continuous influx of large amounts of data. The chapter discusses practical aspects of designing multiagent systems for distributed computing, including FIPA standards, ACL communication language, agent states, and deployment specifics on computational nodes. Existing software libraries and frameworks for multiagent system development are analyzed, highlighting their limitations and extensibility. Approaches to organizing communication and decision-making among agents, such as the Schulze and TF-IDF methods adaptation for distributed environments, are proposed. Multiagent subsystems and query formats for their operations are described in detail. The third chapter addresses the problem of multiclass classification of streaming text data, which is key to the automated construction of domain-specific dictionaries. Theoretical foundations are reviewed, and directions for improving existing models are outlined. A modification of the Bloom filter for multi-class classification is proposed, along with the use of neural networks for this task. The integration of these methods into a multiagent system, where each agent performs specific tasks, is analyzed. Approaches to automated dictionary construction are examined, including processing text and its classes, local dictionary updates by agents, creating new agents in cases of overload, and synchronizing changes in the general dictionary through inter-agent communication. The fourth chapter is dedicated to the practical implementation of the proposed model and methods, which serve as the foundation for deploying this model in a multi-agent system environment. A set of instrumental software tools has been developed to demonstrate the effectiveness of the proposed model in the automated construction of domain-specific dictionaries. The chapter describes the process of creating and configuring the multi-agent system model, which performs multi-class text filtering and classification while iteratively forming the dictionary during system operation. The implementation includes the integration of a modified Bloom filter, neural networks, and the organization of agent interactions to ensure efficient dictionary updates and consensus on changes. The system's performance is illustrated with iteration examples that demonstrate the functionality and efficiency of the proposed architecture. Scientific novelty of the results obtained. For the first time, a model of a multi-agent system has been proposed, combining a modified Bloom filter, a neural network for text classification, a multiagent approach for dictionary construction and updating, and a voting mechanism based on the Schulze method using the TF-IDF method. This enables the automation of domain-specific dictionary creation in the context of streaming text data processing. A novel modification of the classical Bloom filter has been proposed, distinguished by its ability to rapidly detect relevant texts and perform their preliminary classification. This significantly reduces the volume of raw data at subsequent stages of the system and enhances efficiency in the context of streaming data processing. For the first time, a modification of the TF-IDF method in a distributed environment has been proposed to address the task of constructing a domain-specific dictionary. This modification is distinguished by the application of an adapted Schulze method for use in multi-agent systems, enabling agents to vote on domain dictionary updates. This ensures decision-making based on collective analysis of textual data. For the first time, a method for optimizing Bloom filter parameters using a genetic algorithm has been proposed for use in multi-class filtering of streaming textual data to improve the accuracy of their preliminary classification. A neural network model has been developed and adapted for multi-class text data classification across multiple domains for the given data set. A feedback system mechanism for dynamic adaptation has been developed, transmitting the updated dictionary back to the Bloom filter. This allows the system to adapt dynamically to new data and improve text classification accuracy at the filtering stage. This approach ensures the system's relevance in changing data environments. Practical significance of the results. The practical significance of the research lies in the creation of an efficient multi-agent system for processing streaming text data, automating the processes of filtering, classification, and adaptive updating of domain dictionaries. The proposed approaches ensure high data processing speed through the enhanced Bloom filter and specialized neural network and improve the accuracy and relevance of updated dictionaries via agents' collective voting using the Schulze method. The proposed multi-agent system model is characterized by relatively low computational resource requirements, allowing for its efficient implementation on accessible hardware platforms. The use of an improved Bloom filter reduces the volume of data transmitted to subsequent processing stages, while the distributed nature of the system ensures flexibility and enables effective scaling according to user needs. This solution can be applied in monitoring systems, text stream analysis, information retrieval, and data detection in various domains, such as cybersecurity, financial systems, and social networks. | |
| dc.format.extent | 177 с. | |
| dc.identifier.citation | Яременко, В. С. Модель мультиагентної системи для автоматизованої побудови словника предметної області при обробці потокових даних : дис. … д-ра філософії : 122 – Комп’ютерні науки / Яременко Вадим Сергійович. – Київ, 2025. – 177 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/74353 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | мультиагентна система | |
| dc.subject | модель системи | |
| dc.subject | паралельні і розподілені обчислення | |
| dc.subject | аналіз текстових даних | |
| dc.subject | обробка потоків текстів | |
| dc.subject | багатопотоковість | |
| dc.subject | обчислювальний інтелект | |
| dc.subject | машинне навчання | |
| dc.subject | нейронні мережі | |
| dc.subject | глибинне навчання | |
| dc.subject | LSTM | |
| dc.subject | TF-IDF | |
| dc.subject | методи оптимізації | |
| dc.subject | фільтр Блума | |
| dc.subject | метод Шульце | |
| dc.subject | мultiagent system | |
| dc.subject | system model | |
| dc.subject | parallel and distributed computing | |
| dc.subject | text data analysis | |
| dc.subject | text stream processing | |
| dc.subject | multithreading | |
| dc.subject | computational intelligence | |
| dc.subject | machine learning | |
| dc.subject | neural networks | |
| dc.subject | deep learning | |
| dc.subject | optimization methods | |
| dc.subject | Bloom filter | |
| dc.subject | Schulze method | |
| dc.subject.udc | 004.62:004.67:004.75:004.8 | |
| dc.title | Модель мультиагентної системи для автоматизованої побудови словника предметної області при обробці потокових даних | |
| dc.type | Thesis Doctoral |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Yaremenko_dys.pdf
- Розмір:
- 2.67 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: