Система розпізнавання та структуризації усного мовлення
| dc.contributor.advisor | Тітов, Владислав Миколайович | |
| dc.contributor.author | Лакін, Дмитро Андрійович | |
| dc.date.accessioned | 2026-07-30T08:52:34Z | |
| dc.date.available | 2026-07-30T08:52:34Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Дипломна робота виконана на 61 сторінці, містить 33 розділи, має 16 рисунків та 55 використаних джерел. Мета роботи: розробка програмної системи для автоматичного розпізнавання та структуризації усного мовлення, з першочерговим використанням на локальному пристрої. Методи та засоби: мова програмування Python; бібліотеки Faster-Whisper, Transformers, Sentence-Transformers, SpaCy, BM25S, YAKE!, RapidFuzz; PySide6 для побудови графічного інтерфейсу. Основний зміст роботи: технічна постановка задачі, формалізація вимог до програмної системи; аналіз наявних рішень; огляд технічних рішень впровадження ASR, NLP, Word Embeddings, SLM, Hybrid Search у прикладну задачу; інструкція з встановлення та використання проекту. Результат: локальна система для транскрипції та структуризація медіаконтенту у текстовому представленні. Додаток призначений для транскрипції аудіо/відео контенту та структуризації отриманого тексту методами машинного навчання на локальному пристрої користувача. Програма реалізовує низьку алгоритмів та модулів: автоматичного розпізнавання мовлення, обробка масивів тексту, пошук та розподіл на семантичні секції, генерація заголовків та підсумків на основні змісту, статистичний та семантичний пошук. Програма орієнтується на користувача локального пристрої, без передового заліза, та потребує мінімум ~3 ГБ та рекомендовано ~7 ГБ оперативної пам’яті. Оптимальна швидкість роботи буде досягнена з використанням відеокарти з підтримкою CUDA, але також працює на CPU з більшим часом очікування. | |
| dc.description.abstractother | The thesis is completed on 61 pages, contains 33 sections, has 16 figures and 55 sources used. Goal: development of a software system for automatic recognition and structuring of oral speech, with primary use on a local device. Methods and tools: Python programming language; Faster-Whisper, Transformers, Sentence-Transformers, SpaCy, BM25S, YAKE!, RapidFuzz libraries; PySide6 for building a graphical interface. The main content of the paper: technical formulation of the problem, formalization of requirements for the software system; analysis of existing solutions; review of technical solutions for implementing ASR, NLP, Word Embeddings, SLM, Hybrid Search in an applied problem; instructions for installing and using the project. Result: a local system for transcription and structuring of media content in text representation. | |
| dc.format.extent | 71 с. | |
| dc.identifier.citation | Лакін, Д. А. Система розпізнавання та структуризації усного мовлення : дипломна робота ... бакалавра : 122 Комп’ютерні науки / Лакін Дмитро Андрійович. – Київ, 2026. – 71 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/82325 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | ASR | |
| dc.subject | NLP | |
| dc.subject | Word Embeddings | |
| dc.subject | Semantic Search | |
| dc.subject | Hybrid Search | |
| dc.subject | Bi-encoder | |
| dc.subject | Cross-encoder | |
| dc.subject | RAG | |
| dc.subject | Reranker | |
| dc.subject | BM25 | |
| dc.subject | RRF | |
| dc.subject | YAKE! | |
| dc.subject | Fuzzy Mathing | |
| dc.subject | LLM/SLM | |
| dc.subject | Transformer Model | |
| dc.subject | CUDA | |
| dc.subject | MoE | |
| dc.subject | Biencoder | |
| dc.title | Система розпізнавання та структуризації усного мовлення | |
| dc.type | Bachelor Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Lakin_bakalavr.pdf
- Розмір:
- 3.15 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: