Інкрементальне навчання великих мовних моделей для багатомовної класифікації текстів із використанням фіксованої пам'яті та регуляризації
| dc.contributor.advisor | Шаповалова, Світлана Ігорівна | |
| dc.contributor.author | Титаренко, Ольга Володимирівна | |
| dc.date.accessioned | 2026-06-04T11:27:59Z | |
| dc.date.available | 2026-06-04T11:27:59Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Актуальність теми. Корпоративні системи задля автоматизації та аналізу текстових даних частіше базуються на великих мовних моделях, що також відомі як LLM. Однак при їх адаптації до нових доменів виникає явище катастрофічного забування, яке характеризується втратою точності на раніше засвоєних завданнях, що своєю чергою провокує дилему стабільності-пластичності, вирішення якої є критично важливим для створення ефективних систем інкрементальної класифікації текстових потоків, які працюють у реальному часі. Тому реалізація та досліди гібридних методів подолання катастрофічного забування для трансформерних моделей мають значне практичне значення та високий рівень актуальності. Метою роботи є підвищення стійкості моделей-трансформерів до втрати засвоєних знань під час навчання на гетерогенних завданнях.. Завдання дослідження сформовано таким чином: - Провести аналіз існуючих рішень подолання проблеми катастрофічного забування. - Розробити метод навчання LLM, який мінімізує катастрофічне забування. - Розробити програмне забезпечення реалізації запропонованого методу - Провести обчислювальні експерименти для оцінювання стабільності навчання моделі. Об’єкт дослідження: процес подолання катастрофічного забування у великих мовних моделях (LLM). Предмет дослідження: методи подолання катастрофічного забування для трансформерних моделей класифікації текстів в умовах послідовної зміни доменів даних. Наукова новизна: запропоновано гібридний метод подолання катастрофічного забування в LLM через поєднання: 1) математичного захисту параметрів шляхом регуляризації ваг, що мінімізує втрату раніше засвоєних знань; 2) змішування репрезентативних векторів минулого досвіду з поточними даними, що забезпечує стабільність моделі на гетерогенних задачах та забезпечує приріст 0,17 за метрикою F1-score на найбільш чутливому домені, досягаючи значення 0,56. Методи дослідження. Для досягнення поставленої мети застосовано комплекс наукових методів. Метод порівняльного аналізу застосовується задля оцінювання чинних підходів до інкрементального навчання (наївний підхід, EWC, Replay) та визначення їхніх переваг і недоліків. Методи математичного моделювання використано для формалізації гібридної функції втрат, обрахунок інформаційної матриці Фішера та доведення наявності перетину областей низької помилки для старих та нових завдань. Експериментальний метод застосовано для навчання моделі на трьох послідовних завданнях (AG News, Tweet Eval Emotion, зашумлені новини) з фіксацією метрик точності та F1-score після кожної епохи. Методи статистичного аналізу даних, а саме розрахунок середнього, стандартного відхилення, порівняння вибірок, використано для аналізу результатів експериментів і їх підтвердження статистичної значущості переваги гібридного методу. Практична цінність отриманих результатів полягає у створенні програмної системи, що готова до промислового впровадження для автоматизованої маршрутизації звернень клієнтів за тематикою та емоційним забарвленням, а також для модерації контенту соціальних мереж. Запропонований гібридний метод дозволяє скоротити витрати на зберігання історичних даних та забезпечує масштабованість через інтеграцію з AWS SageMaker та S3. Публікація результатів дисертації. Основні положення даної роботи опубліковані у фаховому науковому журналі категорії «Б» «Таврійський науковий вісник». Серія: «Технічні науки» № 2/2026. Апробація результатів. Результати роботи були представлені під час X Міжнародної науково-практичної конференції «THEORETICAL AND EMPIRICAL SCIENTIFIC RESEARCH: CONCEPT AND TRENDS» (08.05.2026; Оксфорд, Сполучене Королівство). Структура та обсяг роботи. Дисертація складається зі вступу, чотирьох розділів, висновків до розділів, загальних висновків, списку використаних джерел та двох додатків. Повний обсяг дисертації становить 118 сторінок, з яких 82 сторінки – основний текст. Робота містить 4 таблиці, 11 рисунків, список використаних джерел із 129 найменувань. Додатки займають 21 сторінку. | |
| dc.description.abstractother | Relevance of the topic. Modern systems for automating corporate communications and analyzing textual data are increasingly based on large language models (LLMs). However, when adapting these models to new domains (informal vocabulary, noisy messages), the phenomenon of catastrophic forgetting occurs – a sharp loss of accuracy on previously learned tasks. Resolving the stability-plasticity dilemma is critical to creating effective real-time incremental text stream classification systems. Therefore, the research and implementation of hybrid methods to overcome catastrophic forgetting for transformer models are relevant and have significant practical value. The aim of this work is to improve the resilience of transformer models to the loss of acquired knowledge when training on heterogeneous tasks. The research objectives are listed as follows: - To analyse existing solutions to the problem of catastrophic forgetting. - To develop an LLM training method that minimises catastrophic forgetting. - To develop software implementing the proposed method. - To conduct computational experiments to assess the stability of model training. Research object: the process of overcoming catastrophic forgetting in large language models (LLMs). Research subject: methods for overcoming catastrophic forgetting in transformer-based text classification models under conditions of sequential changes in data domains. Scientific novelty: a hybrid method is proposed to overcome catastrophic forgetting in LLMs by combining: 1) mathematical protection of parameters through weight regularisation, which minimises the loss of previously acquired knowledge; 2) mixing representative vectors of past experience with current data, which ensures model stability on heterogeneous tasks and provides a gain of 0.17 on the F1-score metric in the most sensitive domain, reaching a value of 0.56. Research methods. To achieve the stated goal, a set of scientific methods was used. The comparative analysis method was applied to evaluate existing incremental learning approaches and identify their advantages and disadvantages. Mathematical modeling methods were used to formalize the hybrid loss function, compute the Fisher information matrix, and prove the existence of an intersection of low-error regions for old and new tasks. The experimental method was applied to train the model on three sequential tasks, recording accuracy and F1-score metrics after each epoch. Statistical methods (mean, standard deviation, and sample comparisons) were used to analyze experimental results and confirm the statistical significance of the hybrid method's advantage. The practical value of the results lies in the creation of a software system ready for industrial implementation, designed to automate the routing of customer inquiries based on subject matter and emotional tone, and to moderate social media content. Publication of the dissertation results. The main provisions of this work have been published in the professional scientific journal of category "B", "Tavri Scientific Bulletin"—series: "Technical Sciences" No. 2/2026. Structure and scope of the work. The dissertation consists of an introduction, four chapters, chapter conclusions, general conclusions, a list of references, and two appendices. The total volume of the dissertation is 118 pages, of which 82 pages are the main text. The work contains 4 tables, 11 figures, and a list of references with 129 items. The appendices take up 21 pages. | |
| dc.format.extent | 118 с. | |
| dc.identifier.citation | Титаренко, О. В. Інкрементальне навчання великих мовних моделей для багатомовної класифікації текстів із використанням фіксованої пам'яті та регуляризації : магістерська дис. : 122 Комп’ютерні науки / Титаренко Ольга Володимирівна. – Київ, 2026. – 118 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/81470 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | інкрементальне навчання | |
| dc.subject | катастрофічне забування | |
| dc.subject | еластична консолідація ваг (EWC) | |
| dc.subject | буфер відтворення досвіду (Replay) | |
| dc.subject | гібридний метод | |
| dc.subject | трансформерні моделі | |
| dc.subject | RoBERTa-base | |
| dc.subject | класифікація текстів | |
| dc.subject | AWS SageMaker | |
| dc.subject | доменно-інкрементальне навчання | |
| dc.subject | incremental learning | |
| dc.subject | catastrophic forgetting | |
| dc.subject | Elastic Weight Consolidation (EWC) | |
| dc.subject | replay buf er | |
| dc.subject | hybrid method | |
| dc.subject | transformer models | |
| dc.subject | text classification | |
| dc.subject | domain-incremental learning | |
| dc.title | Інкрементальне навчання великих мовних моделей для багатомовної класифікації текстів із використанням фіксованої пам'яті та регуляризації | |
| dc.type | Master Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Titarenko_magistr.pdf
- Розмір:
- 2.63 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: