Моделі та метод розпізнавання ключових слів у голосовому сигналі в компʼютерних системах з обмеженими ресурсами

dc.contributor.advisorТерейковський, Ігор Анатолійович
dc.contributor.authorДідус, Андрій Володимирович
dc.date.accessioned2026-08-31T13:45:54Z
dc.date.available2026-08-31T13:45:54Z
dc.date.issued2026
dc.description.abstractДідус А.В. Моделі та метод розпізнавання ключових слів у голосовому сигналі в компʼютерних системах з обмеженими ресурсами. – Кваліфікаційна наукова праця на правах рукопису. Дисертація на здобуття наукового ступеня доктора філософії з галузі знань 12 Інформаційні технології за спеціальністю 123 Компʼютерна інженерія. – Національний технічний університет України «Київський політехнічний інститут імені Ігоря Сікорського», Київ, 2026. Дисертаційна робота присвячена вирішенню наукового завдання щодо розробки моделей та методу, які ґрунтуються на принципах динамічного програмування та забезпечують підвищення ефективності розпізнавання ключових слів у голосовому сигналі в комп’ютерних системах з обмеженими ресурсами. Актуальність цього наукового завдання зумовлена стрімкою інтеграцією голосового керування у широкий спектр вбудованих пристроїв, що охоплюють побутову електроніку, промислові системи та Інтернет речей. Голосовий сигнал перетворюється на найбільш природний канал комунікації, особливо у випадках, коли візуальний або тактильний контакт із пристроєм є ускладненим чи неможливим. Для українського безпекового та оборонного сектору зазначені питання є надзвичайно важливими в умовах повномасштабного збройного вторгнення. Системи безконтактного голосового керування технічними засобами необхідні в ситуаціях, де висуваються жорсткі вимоги до надійного розпізнавання команд з обмеженого словника в реальному часі за умов дефіциту обчислювальних ресурсів і відсутності стабільного каналу зв'язку. Разом із тим більшість сучасних рішень на базі глибоких нейронних мереж характеризується високими вимогами до обчислювальних потужностей, залежністю від хмарної інфраструктури та складністю оперативної адаптації до зміни набору ключових слів. Це унеможливлює їх безпосереднє застосування у спеціалізованих обчислювальних модулях зазначеного типу й визначає доцільність розробки засобів розпізнавання, що ґрунтуються на принципах динамічного програмування. Об’єктом дослідження являється процеси розпізнавання ключових слів у голосовому сигналі в комп’ютерних системах з обмеженими ресурсами. Предметом дослідження являються моделі та метод розпізнавання ключових слів у голосовому сигналі. Метою дисертаційного дослідження є підвищення ефективності розпізнавання ключових слів з малого словника за рахунок підвищення якості розпізнавання та оперативності адаптації до модифікації набору ключових слів з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. Відповідно до мети дослідження сформульовано такі наукові завдання: 1. Провести аналіз відомих методів і засобів розпізнавання ключових слів у голосовому сигналі та визначити перспективні шляхи підвищення їх ефективності в комп’ютерних системах з обмеженими ресурсами. 2. Розвинути теоретичні засади процесу розпізнавання ключових слів з малого словника на основі принципів динамічного програмування. 3. Розробити метод розпізнавання ключових слів з малого словника з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. 4. Розробити та дослідити систему розпізнавання ключових слів з малого словника в компʼютерних системах з обмеженими ресурсами. Основні наукові результати дисертаційного дослідження: - Вперше розроблено метод розпізнавання ключових слів у голосовому сигналі, який за рахунок поєднання адаптивної попередньої обробки з процесами, визначеними в запропонованій моделі побудови, забезпечує підвищення якості розпізнавання та оперативності адаптації до модифікації набору ключових слів з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. - Вперше розроблено концептуальну модель розпізнавання ключових слів у голосовому сигналі, що за рахунок системної декомпозиції інтегрального показника ефективності на функціональні складові даних, сигналу та моделі, дозволила визначити можливість підвищення ефективності процесу розпізнавання шляхом застосування адаптивної попередньої обробки, врахування вагомості окремих інформативних ознак, модульної інтеграції процесів параметризації та класифікації, а також врахування специфіки метричного порівняння в умовах обмежених обчислювальних ресурсів. Отримав подальший розвиток підхід до пріоритезації інформативності ознак голосового сигналу, що за рахунок застосування вагових коефіцієнтів при формуванні дискретних еталонних шаблонів та параметризації вхідного потоку, забезпечує можливість комплексного узгодження показників точності, оперативності та обчислювальної ресурсоємності засобів розпізнавання голосових сигналів. Отримала подальший розвиток модель побудови засобів розпізнавання ключових слів, яка за рахунок реалізації підходу до пріоритезації інформативності ознак через модульну інтеграцію процедур зваженого акустичного фінгерпринтингу та детерміністичного шаблонного зіставлення дозволяє підвищити оперативність та зменшити ресурсоємність засобів розпізнавання. Практичне значення одержаних результатів полягає у розробці архітектури системи розпізнавання ключових слів у голосовому сигналі, що забезпечує підвищення ефективності розпізнавання та придатна для розгортання на комп'ютерних засобах з обмеженими обчислювальними ресурсами. Запропоновані моделі та метод можуть бути використані при створенні інтерфейсів голосового керування спеціалізованим обладнанням і мобільними застосунками. Практична цінність одержаних результатів полягає у наступному: - Застосування розробленого методу розпізнавання ключових слів дозволяє за метрикою F1 в 1.05-1.2 рази підвищити точність розпізнавання по відношенню до класичних комп’ютерних засобів, що базуються на принципах динамічного програмування, при дотриманні обмежень щодо оперативності та ресурсоємності, а по відношенню до засобів розпізнавання на основі нейронних мереж при співрозмірній точності розпізнавання - більше ніж в 3 рази підвищити оперативність та більше ніж в 5 разів зменшити обчислювальну ресурсоємність, забезпечуючи при цьому оперативність адаптації до модифікації набору ключових слів. - Розроблені програмні додатки, що реалізують запропоновані моделі та метод, впроваджені в навчальний процес на кафедрі системного програмування і спеціалізованих комп’ютерних систем Національного технічного університету України "Київський політехнічний інститут імені Ігоря Сікорського" (акт впровадження від 30.04.2026). У вступі обґрунтовано актуальність теми дисертації, визначено мету і завдання дослідження, розкрито наукове та практичне значення результатів, а також відображено особистий внесок автора у працях, опублікованих у співавторстві. У першому розділі розглянуто сучасний стан проблеми розпізнавання ключових слів у системах з обмеженими ресурсами. Проведено аналіз класичних та нейромережевих підходів, виявлено їхні переваги та недоліки. Обґрунтовано доцільність співвіднесення шляхів підвищення ефективності розпізнавання ключових слів у голосовому сигналі в комп’ютерних системах з обмеженими ресурсами з розробкою засобів, що базуються на принципах динамічного програмування. У другому розділі проведено розвиток теоретичних засад процесу розпізнавання ключових слів з малого словника на основі принципів динамічного програмування. Розроблено концептуальну модель розпізнавання ключових слів у голосовому сигналі, що ґрунтується на представленні інтегрального показника ефективності (часової, ресурсної, адаптивної) як векторного функціоналу. Розроблено підхід до пріоритезації інформативності ознак голосового сигналу, який забезпечує можливість комплексного узгодження показників точності, оперативності та обчислювальної ресурсоємності засобів розпізнавання голосових сигналів. У третьому розділі розроблено метод розпізнавання ключових слів з малого словника з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. При цьому сформовано процедури підготовки вхідних та вихідних даних, запропоновано багатоетапний конвеєр попередньої обробки сигналу та визначено зміст та послідовність реалізації етапів методу. У четвертому розділі розроблено та досліджено систему розпізнавання ключових слів з малого словника в компʼютерних системах з обмеженими ресурсами. Запропоновано архітектуру системи розпізнавання, розроблено експериментальну установку та проведено експериментальні дослідження, що підтвердили доцільність використання дисертаційних рішень для підвищення ефективності процесу розпізнавання ключових слів з малого словника за рахунок підвищення якості розпізнавання та оперативності адаптації до модифікації набору ключових слів з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. Основні результати дисертаційної роботи опубліковано у 11 публікаціях, з яких 1 стаття в періодичному виданні, що проіндексоване у міжнародній наукометричній базі Scopus, 4 статті у фахових виданнях, категорії «Б» та 4 міжнародних та всеукраїнських науково-практичних конференціях, отримано 2 авторських свідоцтва на компʼютерні програми.
dc.description.abstractotherDidus A.V. Models and Method for Keyword Recognition in the Voice Signal in Resource-Constrained Computer Systems. – Qualifying scientific work as a manuscript. Dissertation for the degree of Doctor of Philosophy in the field of study 12 Information Technologies, specialty 123 Computer Engineering. – National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute”, Kyiv, 2026. The dissertation work is devoted to solving the scientific task of developing models and a method based on the principles of dynamic programming that ensure an increase in the efficiency of keyword recognition in a voice signal in computer systems with limited resources. The relevance of this scientific task is due to the rapid integration of voice control into a wide range of embedded devices, covering consumer electronics, industrial systems, and the Internet of Things. The voice signal is turning into the most natural channel of communication, especially in cases where visual or tactile contact with the device is complicated or impossible. For the Ukrainian security and defense sector, these issues are extremely important under the conditions of a full-scale armed invasion. Systems of contactless voice control of technical equipment are necessary in situations where strict requirements are imposed on the reliable real-time recognition of commands from a limited vocabulary under conditions of a shortage of computing resources and the absence of a stable communication channel. At the same time, most modern solutions based on deep neural networks are characterized by high requirements for computing power, dependence on cloud infrastructure, and the difficulty of rapid adaptation to changes in the set of keywords. This makes their direct application in specialized computing modules of the specified type impossible and determines the advisability of developing recognition tools based on the principles of dynamic programming. The object of research is the processes of keyword recognition in a voice signal in computer systems with limited resources. The subject of research is the models and method of keyword recognition in a voice signal. The aim of the dissertation research is to increase the efficiency of keyword recognition from a small vocabulary by improving the quality of recognition and the promptness of adaptation to the modification of the set of keywords, taking into account the limited computational resource intensity of the computer system. In accordance with the aim of the research, the following scientific tasks have been formulated: 1. Conduct an analysis of known methods and tools for keyword recognition in a voice signal and determine promising ways to increase their efficiency in computer systems with limited resources. 2. Develop the theoretical foundations of the process of keyword recognition from a small vocabulary based on the principles of dynamic programming. 3. Develop a method for keyword recognition from a small vocabulary, taking into account the limited computational resource intensity of the computer system. 4. Develop and investigate a system for keyword recognition from a small vocabulary in computer systems with limited resources. The main scientific results of the dissertation research: - For the first time, a method for keyword recognition in a voice signal has been developed, which, due to the combination of adaptive preprocessing with the processes defined in the proposed construction model, ensures an increase in the quality of recognition and the promptness of adaptation to the modification of the set of keywords, taking into account the limited computational resource intensity of the computer system. - For the first time, a conceptual model for keyword recognition in a voice signal has been developed, which, due to the systemic decomposition of the integral performance indicator into functional components of data, signal, and model, allowed determining the possibility of increasing the efficiency of the recognition process by applying adaptive preprocessing, taking into account the weight of individual informative features, modular integration of parameterization and classification processes, as well as taking into account the specifics of metric comparison under conditions of limited computing resources. The approach to prioritizing the informativeness of voice signal features has been further developed, which, due to the use of weight coefficients in the formation of discrete reference templates and parameterization of the input stream, provides the possibility of comprehensive coordination of accuracy, promptness, and computational resource intensity indicators of voice signal recognition tools. The model for constructing keyword recognition tools has been further developed, which, due to the implementation of the approach to prioritizing feature informativeness through the modular integration of weighted acoustic fingerprinting and deterministic template matching procedures, allows increasing promptness and reducing the resource intensity of recognition tools. The practical significance of the obtained results lies in the development of the architecture of a keyword recognition system in a voice signal, which provides an increase in recognition efficiency and is suitable for deployment on computer tools with limited computing resources. The proposed models and method can be used in creating voice control interfaces for specialized equipment and mobile applications. Practical value of the obtained results consists in the following: - The application of the developed keyword recognition method allows increasing the recognition accuracy by the F1 metric by 1.05-1.2 times relative to classical computer tools based on the principles of dynamic programming, while maintaining constraints regarding promptness and resource intensity, and relative to recognition tools based on neural networks with comparable recognition accuracy – increasing promptness by more than 3 times and reducing computational resource intensity by more than 5 times, while ensuring the promptness of adaptation to modifications of the keyword set. - The developed software applications implementing the proposed models and method have been introduced into the educational process at the Department of System Programming and Specialized Computer Systems of the National Technical University of Ukraine "Igor Sikorsky Kyiv Polytechnic Institute" (implementation act dated April 30, 2026). The introduction substantiates the relevance of the dissertation topic, defines the aim and tasks of the research, reveals the scientific and practical significance of the results, and reflects the personal contribution of the author in works published in co-authorship. The first chapter considers the current state of the problem of keyword recognition in systems with limited resources. An analysis of classical and neural network approaches has been carried out, and their advantages and disadvantages have been revealed. The advisability of aligning the ways to increase the efficiency of keyword recognition in a voice signal in computer systems with limited resources with the development of tools based on the principles of dynamic programming is substantiated. The second chapter provides the development of the theoretical foundations for the small-vocabulary keyword recognition process based on the principles of dynamic programming. A conceptual model for keyword recognition in the voice signal has been developed, which is based on representing the integral efficiency indicator (comprising temporal, resource, and adaptive components) as a vector functional. An approach to prioritizing the informativeness of voice signal features has been developed, ensuring the possibility of comprehensive alignment of accuracy, promptness, and computational resource intensity of voice signal recognition tools. The third chapter develops a method for keyword recognition from a small vocabulary, taking into account the limited computational resource intensity of the computer system. At the same time, procedures for preparing input and output data are formed, a multi-stage signal preprocessing pipeline is proposed, and the content and sequence of implementation of the stages of the method are defined. The fourth chapter develops and investigates a system for keyword recognition from a small vocabulary in computer systems with limited resources. The architecture of the recognition system is proposed, an experimental setup is developed, and experimental studies are conducted, which confirmed the advisability of using dissertation solutions to increase the efficiency of the keyword recognition process from a small vocabulary by increasing the quality of recognition and the promptness of adaptation to the modification of the set of keywords, taking into account the limited computational resource intensity of the computer system. The main results of the dissertation were published in 11 scientific papers, in particular, in 1 scientific article indexed in the Scopus international scientometric database, 4 articles published in scientific journals included in the list of scientific professional editions of Ukraine (category «B»), as well as 4 publications in the proceedings of international and All-Ukrainian scientific and practical conferences. Two copyright certificates for computer programs were obtained.
dc.format.extent167 с.
dc.identifier.citationДідус, А. В. Моделі та метод розпізнавання ключових слів у голосовому сигналі в компʼютерних системах з обмеженими ресурсами : дис. … д-ра філософії : 123 Комп’ютерна інженерія / Дідус Андрій Володимирович. – Київ, 2026. – 167 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/82780
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectмодель
dc.subjectметод
dc.subjectнейронні мережі
dc.subjectалгоритм
dc.subjectмашинне навчання
dc.subjectштучний інтелект
dc.subjectобробка природньої мови
dc.subjectрозпізнавання
dc.subjectкласифікація
dc.subjectкомп’ютерне моделювання
dc.subjectсистема
dc.subjectголосовий сигнал
dc.subjectключові слова
dc.subjectдинамічне програмування
dc.subjectкібербезпека
dc.subjectmodel
dc.subjectmethod
dc.subjectneural networks
dc.subjectalgorithm
dc.subjectmachine learning
dc.subjectartificial intelligence
dc.subjectnatural language processing
dc.subjectrecognition
dc.subjectclassification
dc.subjectcomputer modeling
dc.subjectsystem
dc.subjectvoice signal
dc.subjectkeywords
dc.subjectdynamic programming
dc.subjectcybersecurity
dc.subject.udc004.934
dc.titleМоделі та метод розпізнавання ключових слів у голосовому сигналі в компʼютерних системах з обмеженими ресурсами
dc.title.alternativeModels and Method for Keyword Recognition in the Voice Signal in Resource-Constrained Computer Systems
dc.typeThesis Doctoral

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Didus_dys.pdf
Розмір:
7.17 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: