Моделі та метод розпізнавання ключових слів у голосовому сигналі в компʼютерних системах з обмеженими ресурсами
Вантажиться...
Дата
2026
Автори
Науковий керівник
Назва журналу
Номер ISSN
Назва тому
Видавець
КПІ ім. Ігоря Сікорського
Анотація
Дідус А.В. Моделі та метод розпізнавання ключових слів у голосовому сигналі в компʼютерних системах з обмеженими ресурсами. – Кваліфікаційна наукова праця на правах рукопису. Дисертація на здобуття наукового ступеня доктора філософії з галузі знань 12 Інформаційні технології за спеціальністю 123 Компʼютерна інженерія. – Національний технічний університет України «Київський політехнічний інститут імені Ігоря Сікорського», Київ, 2026.
Дисертаційна робота присвячена вирішенню наукового завдання щодо розробки моделей та методу, які ґрунтуються на принципах динамічного програмування та забезпечують підвищення ефективності розпізнавання ключових слів у голосовому сигналі в комп’ютерних системах з обмеженими ресурсами. Актуальність цього наукового завдання зумовлена стрімкою інтеграцією голосового керування у широкий спектр вбудованих пристроїв, що охоплюють побутову електроніку, промислові системи та Інтернет речей. Голосовий сигнал перетворюється на найбільш природний канал комунікації, особливо у випадках, коли візуальний або тактильний контакт із пристроєм є ускладненим чи неможливим. Для українського безпекового та оборонного сектору зазначені питання є надзвичайно важливими в умовах повномасштабного збройного вторгнення. Системи безконтактного голосового керування технічними засобами необхідні в ситуаціях, де висуваються жорсткі вимоги до надійного розпізнавання команд з обмеженого словника в реальному часі за умов дефіциту обчислювальних ресурсів і відсутності стабільного каналу зв'язку. Разом із тим більшість сучасних рішень на базі глибоких нейронних мереж характеризується високими вимогами до обчислювальних потужностей, залежністю від хмарної інфраструктури та складністю оперативної адаптації до зміни набору ключових слів. Це унеможливлює їх безпосереднє застосування у спеціалізованих обчислювальних модулях зазначеного типу й визначає доцільність розробки засобів розпізнавання, що ґрунтуються на принципах динамічного програмування. Об’єктом дослідження являється процеси розпізнавання ключових слів у голосовому сигналі в комп’ютерних системах з обмеженими ресурсами. Предметом дослідження являються моделі та метод розпізнавання ключових слів у голосовому сигналі. Метою дисертаційного дослідження є підвищення ефективності розпізнавання ключових слів з малого словника за рахунок підвищення якості розпізнавання та оперативності адаптації до модифікації набору ключових слів з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. Відповідно до мети дослідження сформульовано такі наукові завдання: 1. Провести аналіз відомих методів і засобів розпізнавання ключових слів у голосовому сигналі та визначити перспективні шляхи підвищення їх ефективності в комп’ютерних системах з обмеженими ресурсами. 2. Розвинути теоретичні засади процесу розпізнавання ключових слів з малого словника на основі принципів динамічного програмування. 3. Розробити метод розпізнавання ключових слів з малого словника з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. 4. Розробити та дослідити систему розпізнавання ключових слів з малого словника в компʼютерних системах з обмеженими ресурсами. Основні наукові результати дисертаційного дослідження: - Вперше розроблено метод розпізнавання ключових слів у голосовому сигналі, який за рахунок поєднання адаптивної попередньої обробки з процесами, визначеними в запропонованій моделі побудови, забезпечує підвищення якості розпізнавання та оперативності адаптації до модифікації набору ключових слів з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. - Вперше розроблено концептуальну модель розпізнавання ключових слів у голосовому сигналі, що за рахунок системної декомпозиції інтегрального показника ефективності на функціональні складові даних, сигналу та моделі, дозволила визначити можливість підвищення ефективності процесу розпізнавання шляхом застосування адаптивної попередньої обробки, врахування вагомості окремих інформативних ознак, модульної інтеграції процесів параметризації та класифікації, а також врахування специфіки метричного порівняння в умовах обмежених обчислювальних ресурсів. Отримав подальший розвиток підхід до пріоритезації інформативності ознак голосового сигналу, що за рахунок застосування вагових коефіцієнтів при формуванні дискретних еталонних шаблонів та параметризації вхідного потоку, забезпечує можливість комплексного узгодження показників точності, оперативності та обчислювальної ресурсоємності засобів розпізнавання голосових сигналів. Отримала подальший розвиток модель побудови засобів розпізнавання ключових слів, яка за рахунок реалізації підходу до пріоритезації інформативності ознак через модульну інтеграцію процедур зваженого акустичного фінгерпринтингу та детерміністичного шаблонного зіставлення дозволяє підвищити оперативність та зменшити ресурсоємність засобів розпізнавання. Практичне значення одержаних результатів полягає у розробці архітектури системи розпізнавання ключових слів у голосовому сигналі, що забезпечує підвищення ефективності розпізнавання та придатна для розгортання на комп'ютерних засобах з обмеженими обчислювальними ресурсами. Запропоновані моделі та метод можуть бути використані при створенні інтерфейсів голосового керування спеціалізованим обладнанням і мобільними застосунками. Практична цінність одержаних результатів полягає у наступному: - Застосування розробленого методу розпізнавання ключових слів дозволяє за метрикою F1 в 1.05-1.2 рази підвищити точність розпізнавання по відношенню до класичних комп’ютерних засобів, що базуються на принципах динамічного програмування, при дотриманні обмежень щодо оперативності та ресурсоємності, а по відношенню до засобів розпізнавання на основі нейронних мереж при співрозмірній точності розпізнавання - більше ніж в 3 рази підвищити оперативність та більше ніж в 5 разів зменшити обчислювальну ресурсоємність, забезпечуючи при цьому оперативність адаптації до модифікації набору ключових слів. - Розроблені програмні додатки, що реалізують запропоновані моделі та метод, впроваджені в навчальний процес на кафедрі системного програмування і спеціалізованих комп’ютерних систем Національного технічного університету України "Київський політехнічний інститут імені Ігоря Сікорського" (акт впровадження від 30.04.2026). У вступі обґрунтовано актуальність теми дисертації, визначено мету і завдання дослідження, розкрито наукове та практичне значення результатів, а також відображено особистий внесок автора у працях, опублікованих у співавторстві. У першому розділі розглянуто сучасний стан проблеми розпізнавання ключових слів у системах з обмеженими ресурсами. Проведено аналіз класичних та нейромережевих підходів, виявлено їхні переваги та недоліки. Обґрунтовано доцільність співвіднесення шляхів підвищення ефективності розпізнавання ключових слів у голосовому сигналі в комп’ютерних системах з обмеженими ресурсами з розробкою засобів, що базуються на принципах динамічного програмування. У другому розділі проведено розвиток теоретичних засад процесу розпізнавання ключових слів з малого словника на основі принципів динамічного програмування. Розроблено концептуальну модель розпізнавання ключових слів у голосовому сигналі, що ґрунтується на представленні інтегрального показника ефективності (часової, ресурсної, адаптивної) як векторного функціоналу. Розроблено підхід до пріоритезації інформативності ознак голосового сигналу, який забезпечує можливість комплексного узгодження показників точності, оперативності та обчислювальної ресурсоємності засобів розпізнавання голосових сигналів. У третьому розділі розроблено метод розпізнавання ключових слів з малого словника з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. При цьому сформовано процедури підготовки вхідних та вихідних даних, запропоновано багатоетапний конвеєр попередньої обробки сигналу та визначено зміст та послідовність реалізації етапів методу. У четвертому розділі розроблено та досліджено систему розпізнавання ключових слів з малого словника в компʼютерних системах з обмеженими ресурсами. Запропоновано архітектуру системи розпізнавання, розроблено експериментальну установку та проведено експериментальні дослідження, що підтвердили доцільність використання дисертаційних рішень для підвищення ефективності процесу розпізнавання ключових слів з малого словника за рахунок підвищення якості розпізнавання та оперативності адаптації до модифікації набору ключових слів з урахуванням обмеженості обчислювальної ресурсоємності комп'ютерної системи. Основні результати дисертаційної роботи опубліковано у 11 публікаціях, з яких 1 стаття в періодичному виданні, що проіндексоване у міжнародній наукометричній базі Scopus, 4 статті у фахових виданнях, категорії «Б» та 4 міжнародних та всеукраїнських науково-практичних конференціях, отримано 2 авторських свідоцтва на компʼютерні програми.
Опис
Ключові слова
модель, метод, нейронні мережі, алгоритм, машинне навчання, штучний інтелект, обробка природньої мови, розпізнавання, класифікація, комп’ютерне моделювання, система, голосовий сигнал, ключові слова, динамічне програмування, кібербезпека, model, method, neural networks, algorithm, machine learning, artificial intelligence, natural language processing, recognition, classification, computer modeling, system, voice signal, keywords, dynamic programming, cybersecurity
Бібліографічний опис
Дідус, А. В. Моделі та метод розпізнавання ключових слів у голосовому сигналі в компʼютерних системах з обмеженими ресурсами : дис. … д-ра філософії : 123 Комп’ютерна інженерія / Дідус Андрій Володимирович. – Київ, 2026. – 167 с.