Методи та програмні засоби децентралізованого обміну знаннями в системах багатоагентного навчання з підкріпленням

dc.contributor.advisorФедорова, Наталія Володимирівна
dc.contributor.authorБочок, В’ячеслав Олександрович
dc.date.accessioned2026-08-25T13:19:45Z
dc.date.available2026-08-25T13:19:45Z
dc.date.issued2026
dc.description.abstractБочок В.О. Методи та програмні засоби децентралізованого обміну знаннями в системах багатоагентного навчання з підкріпленням. − Кваліфікаційна наукова праця на правах рукопису. Дисертація на здобуття наукового ступеня доктора філософії з галузі знань 12 Інформаційні технології за спеціальністю 121 Інженерія програмного забезпечення. – Національний технічний університет України «Київський політехнічний інститут імені Ігоря Сікорського», Київ, 2026. Дисертаційна робота присвячена розробці науково-методичного апарату щодо підвищення продуктивності багатоагентної системи слабко пов’язаних агентів у стаціонарному середовищі за допомогою механізму поширення знань між агентами на базі децентралізованого підходу. Багатоагентні системи є важливим напрямом сучасних інформаційних технологій та штучного інтелекту, оскільки дозволяють моделювати складні розподілені процеси у вигляді сукупності автономних агентів, що взаємодіють між собою та з середовищем. Такі системи знаходять широке застосування у промисловості, робототехніці, транспортних системах, фінансовому аналізі, системах підтримки прийняття рішень та комп’ютерних симуляціях. Одним з ключових механізмів адаптації агентів у таких системах є навчання з підкріпленням, яке дозволяє агентам формувати ефективні стратегії поведінки на основі взаємодії із середовищем. Однак сучасні алгоритми навчання з підкріпленням характеризуються високою складністю навчання, значною потребою у взаємодіях із середовищем (sample complexity), чутливістю до гіперпараметрів та нестабільністю процесу збіжності. Ці проблеми посилюються при переході до багатоагентних систем, де декілька агентів навчаються одночасно. Розвитком навчання з підкріпленням є багатоагентне навчання з підкріпленням (Multi-Agent Reinforcement Learning, MARL), у якому декілька агентів взаємодіють із середовищем паралельно. У таких системах навіть у випадку слабкої взаємодії між агентами виникають проблеми неефективного використання досвіду, оскільки кожен агент накопичує знання незалежно, що призводить до дублювання процесу навчання. Це, у свою чергу, збільшує обчислювальні витрати та уповільнює досягнення оптимальних стратегій. Додатковою проблемою є відсутність ефективних механізмів узагальнення знань між агентами, що працюють у подібних або ідентичних умовах. У результаті кожен агент змушений самостійно проходити всі етапи навчання, навіть якщо інші агенти вже отримали релевантний досвід. Це призводить до неефективного використання накопиченої інформації та знижує загальну швидкість збіжності системи. Це обмеження стає особливо критичним у великомасштабних системах, де кількість агентів зростає, а витрати на незалежне навчання збільшуються пропорційно. Перспективним напрямом підвищення ефективності навчання є використання механізмів передачі знань між агентами. Обмін знаннями дозволяє повторно використовувати досвід, накопичений різними агентами, що потенційно скорочує час навчання та підвищує загальну продуктивність системи. Однак застосування таких підходів пов’язане з низкою проблем, серед яких ризик негативної передачі знань (negative transfer), коли менш ефективні агенти передають некоректні або застарілі знання, відсутність механізмів контролю якості переданих знань, а також складність адаптивного регулювання інтенсивності обміну. Крім того, значна частина існуючих підходів базується на централізованих архітектурах, що обмежує їх застосування у розподілених системах зі слабко пов’язаними агентами. Таким чином, виникає необхідність у розробленні підходів, що поєднують переваги обміну знаннями з можливістю децентралізованого прийняття рішень, забезпечуючи при цьому контроль якості переданих знань та адаптивне регулювання інтенсивності їх використання кожним агентом. Відтак, проєктування децентралізованих підходів, що дозволяють агентам самостійно визначати момент та спосіб використання зовнішніх знань, є ключовою вимогою для підвищення ефективності навчання без додаткових витрат на координацію. Питання розробки та оптимізації багатоагентних систем, а також методів їх навчання досліджували такі вчені, як Richard S. Sutton, Andrew G. Barto, Michael Wooldridge, Nicholas R. Jennings, Yoav Shoham, Katia Sycara, Victor Lesser, Michael L. Littman, Peter Stone, Коваль О.В., Кочура Ю. П., Аврунін О. Г. та інші. Запропоновані ними підходи заклали фундамент сучасних досліджень у галузі багатоагентних систем та навчання з підкріпленням. Водночас більшість існуючих методів або орієнтовані на централізоване управління агентами, або не враховують необхідність контролю якості переданих знань. Крім того, значна частина підходів потребує значних обчислювальних ресурсів або не забезпечує достатньої адаптивності при зміні умов середовища, що обмежує їх практичне застосування у децентралізованих системах. Окреслене сформувало протиріччя між потребою підвищення ефективності навчання агентів у багатоагентних системах та можливістю використання передачі знань між агентами для прискорення навчання, що ускладнюється ризиком негативної передачі знань і відсутністю механізмів контролю інтенсивності такого обміну. Це призводить до збільшення часу навчання, зростання обчислювальних витрат та зниження загальної ефективності системи. Відповідне протиріччя може бути вирішене шляхом розроблення методів і програмних засобів децентралізованого обміну знаннями між агентами, що забезпечують адаптивний контроль якості та інтенсивності передачі знань. Об’єктом дослідження є процеси аналізу, розроблення, забезпечення якості та впровадження методів та програмних засобів децентралізованого обміну знаннями в системах багатоагентного навчання з підкріпленням у стаціонарних середовищах зі слабко пов'язаними агентами. Предметом дослідження є методи та програмне забезпечення децентралізованого обміну знаннями в системах багатоагентного навчання з підкріпленням у стаціонарних середовищах зі слабко пов’язаними агентами. Метою дисертаційної роботи є підвищення продуктивності багатоагентної системи слабко пов’язаних агентів у стаціонарному середовищі за допомогою механізму поширення знань між агентами на базі децентралізованого підходу. Наукова новизна результатів дослідження полягає в наступному. Набув подальшого розвитку метод децентралізованого вибору вчителя для передачі знань, що дозволяє контролювати якість поширюваних знань уникаючи негативного переносу. Вперше розроблено метод динамічного децентралізованого контролю інтенсивності передачі знань між агентами, що дозволяє ефективно використовувати набуті системою знання та протидіяти перенавчанню. Вперше розроблено архітектуру програмного забезпечення для реалізації механізму обміну знаннями в системі багатоагентного навчання, характерною особливістю якої є можливість децентралізованого обміну знаннями із застосуванням механізмів контролю якості та інтенсивності передачі. Практичне використання результатів роботи, розроблених методів та програмних засобів дозволило підвищити продуктивність багатоагентної системи за метрикою нормалізованої площі під кривою навчання (normalized AUC) сумарної винагороди за епізод на 4–20% для середньої інтегральної продуктивності системи та на 3,4–18,3% для максимальної продуктивності окремого агента залежно від конфігурації механізму обміну знаннями та режиму автономного навчання. Експериментальні дослідження проведено у тестових середовищах CartPolev1 та LunarLander-v3 бібліотеки Gym/Gymnasium. Запропонований механізм обміну знаннями продемонстрував результативність як для алгоритмів Deep QNetwork (DQN), так і Double Deep Q-Network (DDQN). Результати дослідження прийнято до впровадження в ТОВ «Квалітек» (акт впровадження від 20.03.2026); в навчальному процесі Національного технічного університету України «Київський політехнічний інститут імені Ігоря Сікорського» (акт впровадження від 20.03.2026 р.) при викладанні дисциплін «Проектування кібер-фізичних систем». Наукові результати дослідження є внеском у розвиток теоретичних і прикладних основ підвищення ефективності навчання у багатоагентних системах навчання з підкріпленням шляхом розроблення методів контролю якості та інтенсивності передачі знань і програмних засобів децентралізованого обміну знаннями між слабко пов’язаними агентами у стаціонарних середовищах. Отримані результати розширюють підходи до організації навчання у децентралізованих багатоагентних системах та створюють передумови для подальшого розвитку методів масштабованого навчання агентів. В якості можливих напрямків продовження дослідження можна відмітити розширення запропонованих методів децентралізованого обміну знаннями на інші алгоритми навчання з підкріпленням та різні типи багатоагентних середовищ (зокрема кооперативні та змішані), дослідження альтернативних підходів до оцінювання продуктивності агентів, а також розроблення механізмів оцінки різноманітності досвіду агентів для підвищення ефективності передачі знань.
dc.description.abstractotherBochok V.O. Methods and Software Tools for Decentralized Knowledge Sharing in Multi-Agent Reinforcement Learning Systems. – Qualification scientific work as a manuscript. Dissertation for the degree of Doctor of Philosophy in the field of knowledge 12 Information Technology, specialty 121 Software Engineering. – National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute”, Kyiv, 2026. The dissertation is devoted to the development of a scientific and methodological framework for improving the performance of a multi-agent system of weakly coupled agents in a stationary environment through a decentralized knowledge sharing mechanism between agents. Multi-agent systems are an important area of modern computer science and artificial intelligence, as they enable modeling complex distributed processes as a set of autonomous agents interacting with each other and with the environment. Such systems are widely applied in industry, robotics, transportation systems, financial analysis, decision support systems, and computer simulations. One of the key mechanisms for agent adaptation in such systems is reinforcement learning, which allows agents to develop effective behavioral strategies through interaction with the environment. However, modern reinforcement learning algorithms are characterized by high training complexity, significant sample complexity, sensitivity to hyperparameters, and instability of the convergence process. These issues become even more pronounced in multi-agent systems, where multiple agents are trained simultaneously. In addition, reinforcement learning algorithms often require extensive tuning of hyperparameters and careful design of reward functions, which complicates their practical application. In multi-agent settings, these challenges are further amplified due to the simultaneous learning processes of multiple agents, even in stationary environments with weak inter-agent dependencies. An extension of reinforcement learning is Multi-Agent Reinforcement Learning (MARL), in which multiple agents interact with the environment in parallel. Even in scenarios with weak interaction between agents, such systems suffer from inefficient use of experience, since each agent accumulates knowledge independently, leading to duplication of the learning process. This, in turn, increases computational costs and slows down convergence to optimal strategies. An additional challenge is the lack of effective mechanisms for generalizing knowledge between agents operating in similar or identical conditions. As a result, each agent must independently go through all stages of learning, even when other agents have already acquired relevant experience, which reduces overall system efficiency. This limitation becomes particularly critical in largescale systems, where the number of agents increases, and the cost of independent learning grows proportionally. Without mechanisms for sharing and reusing knowledge, the scalability of such systems remains limited. A promising direction for improving learning efficiency is the use of knowledge sharing mechanisms between agents. Knowledge exchange enables reuse of experience accumulated by different agents, potentially reducing training time and improving overall system performance. However, such approaches are associated with several challenges, including the risk of negative transfer, when less effective agents propagate incorrect or outdated knowledge, the lack of mechanisms for controlling the quality of transferred knowledge, and the difficulty of adaptively regulating the intensity of knowledge exchange. Furthermore, many existing approaches rely on centralized architectures, which limits their applicability in distributed systems with weakly coupled agents. Therefore, there is a need to develop approaches that combine the advantages of knowledge sharing with decentralized decision-making, while ensuring quality control of transferred knowledge and adaptive regulation of its usage by each agent. Therefore, designing decentralized approaches that allow agents to independently decide when and how to use external knowledge becomes a key requirement for improving learning efficiency without introducing additional coordination overhead. The problems of development and optimization of multi-agent systems and their learning methods have been studied by such researchers as Richard S. Sutton, Andrew G. Barto, Michael Wooldridge, Nicholas R. Jennings, Yoav Shoham, Katia Sycara, Victor Lesser, Michael L. Littman, Peter Stone, O.V. Koval, Yu.P. Kochura, O.H. Avrunin, and others. Their work has laid the foundation for modern research in multi-agent systems and reinforcement learning. However, most existing methods are either focused on centralized control or do not consider the need for controlling the quality of transferred knowledge. In addition, many approaches require significant computational resources or lack adaptability under changing environmental conditions, which limits their practical applicability in decentralized systems. The above considerations reveal a contradiction between the need to improve learning efficiency in multi-agent systems and the possibility of using knowledge sharing to accelerate learning, which is complicated by the risk of negative transfer and the lack of mechanisms for controlling the intensity of such exchange. This leads to increased training time, higher computational costs, and reduced overall system efficiency. This contradiction can be resolved by developing methods and software tools for decentralized knowledge sharing that provide adaptive control of both the quality and intensity of knowledge transfer. The object of research is the processes of analysis, design, quality assurance, and implementation of methods and software tools for decentralized knowledge exchange in multi-agent reinforcement learning systems operating in stationary environments with weakly coupled agents. The subject of research is methods and software for decentralized knowledge sharing in multi-agent reinforcement learning systems in stationary environments with weakly coupled agents. The aim of the dissertation is to improve the performance of a multi-agent system of weakly coupled agents in a stationary environment through a decentralized knowledge sharing mechanism. The proposed solutions address key limitations of existing approaches by introducing adaptive and decentralized mechanisms for knowledge exchange between agents. The scientific novelty of the obtained results is as follows. The method of decentralized teacher selection for knowledge transfer has been further developed, which allows controlling the quality of propagated knowledge and avoiding negative transfer. For the first time, a method of dynamic decentralized control of knowledge sharing intensity between agents has been developed, which enables efficient use of acquired knowledge and prevents overfitting. For the first time, a software architecture for implementing knowledge sharing mechanisms in multi-agent reinforcement learning systems has been developed. Its distinctive feature is the support for decentralized knowledge exchange combined with mechanisms for controlling the quality and intensity of knowledge transfer. The practical application of the developed methods and software tools has made it possible to improve the performance of a multi-agent system in terms of normalized area under the learning curve (normalized AUC) of cumulative reward per episode by 4–20% for average system performance and by 3,4–18,3% for the maximum performance of an individual agent, depending on the configuration of the knowledge sharing mechanism and the autonomous learning regime. Experimental studies were conducted in the CartPole-v1 and LunarLander-v3 environments of the Gym/Gymnasium library. The proposed knowledge sharing mechanism demonstrated effectiveness for both Deep Q-Network (DQN) and Double Deep Q-Network (DDQN) algorithms, confirming its general applicability. The results demonstrated consistent improvements across environments of varying complexity, confirming the robustness of the proposed approach under different experimental conditions. The research results have been implemented at ТОВ «Квалітек» (implementation act dated 20.03.2026) and in the educational process of the National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute” (implementation act dated 20.03.2026) in teaching the course “Design of Cyber-Physical Systems”. The obtained scientific results contribute to the development of theoretical and applied foundations for improving learning efficiency in multi-agent reinforcement learning systems by introducing methods for controlling the quality and intensity of knowledge transfer and software tools for decentralized knowledge exchange between weakly coupled agents in stationary environments. The results expand existing approaches to learning organization in decentralized multi-agent systems and create prerequisites for further development of scalable agent learning methods. The proposed framework establishes a foundation for applying decentralized knowledge sharing techniques in practical scenarios where agents operate independently, such as distributed monitoring and autonomous resource management. Future research directions include extending the proposed decentralized knowledge sharing methods to other reinforcement learning algorithms and different types of multi-agent environments (including cooperative and mixed settings), investigating alternative approaches to agent performance evaluation, and developing mechanisms for assessing experience diversity to improve knowledge transfer efficiency.
dc.format.extent175 с.
dc.identifier.citationБочок, В. О. Методи та програмні засоби децентралізованого обміну знаннями в системах багатоагентного навчання з підкріпленням : дис. … д-ра філософії : 121 – Інженерія програмного забезпечення / Бочок В’ячеслав Олександрович. – Київ, 2026. – 175 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/82697
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectбагатоагентні системи
dc.subjectнавчання з підкріпленням
dc.subjectпідвищення продуктивності багатоагентної системи
dc.subjectпередача знань між агентами
dc.subjectконтроль інтенсивності передачі знань
dc.subjectглибоке Q-навчання
dc.subjectдистиляція політики
dc.subjectдистиляція знань
dc.subjectштучний інтелект
dc.subjectмашинне навчання
dc.subjectнейронні мережі
dc.subjectmulti-agent systems
dc.subjectreinforcement learning
dc.subjectimproving multi-agent system performance
dc.subjectknowledge transfer between agents
dc.subjectcontrol of knowledge transfer intensity
dc.subjectdeep Q-learning
dc.subjectpolicy distillation
dc.subjectknowledge distillation
dc.subjectartificial intelligence
dc.subjectmachine learning
dc.subjectneural networks
dc.subject.udc004.94
dc.titleМетоди та програмні засоби децентралізованого обміну знаннями в системах багатоагентного навчання з підкріпленням
dc.title.alternativeMethods and Software Tools for Decentralized Knowledge Sharing in Multi-Agent Reinforcement Learning Systems
dc.typeThesis Doctoral

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Bochok_dys.pdf
Розмір:
7.67 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: