Розпiзнавання рукописних цифр i лiтер, порiвняння класичних ML та сучасних DL методiв

dc.contributor.advisorКуссуль, Наталія Миколаївна
dc.contributor.authorПоштаренко, Сергiй Сергiйович
dc.date.accessioned2026-06-12T08:01:32Z
dc.date.available2026-06-12T08:01:32Z
dc.date.issued2026
dc.description.abstractКвалiфiкацiйна робота мiстить: 94 стор., 18 рисункiв, 10 таблиць, 19 джерел. Метою квалiфiкацiйної роботи є пiдвищення точностi розпiзнавання багатомовних рукописних текстiв шляхом розробки комбiнованої системи, що поєднує методи комп’ютерного зору та лексичного аналiзу. Об’єктом дослiдження є процес оптичного розпiзнавання мiшаних рукописних символiв. Предметом дослiдження є алгоритми машинного навчання та математичнi моделi лексичного декодування для усунення вiзуальної неоднозначностi омоглiфiв. У ходi роботи сформовано та збалансовано набiр даних, що мiстить кириличнi, латинськi символи та цифри. Проведено емпiричний порiвняльний аналiз базових алгоритмiв машинного навчання (k-NN, LinearSVC, Random Forest) та згорткової нейронної мережi. Встановлено, що архiтектура забезпечує найвищу точнiсть на рiвнi 94.6% зi швидкiстю iнференсу 28.35 мс на 1000 символiв. Для розв’язання проблеми абсолютних омоглiфiв розроблено алгоритм багаторiвневого лексичного декодування, який використовує детермiноване мовне якорування та ймовiрнiсну N-грамну мовну модель. Запропонованi алгоритми iнтегровано в єдиний програмний конвеєр iз розробленим графiчним iнтерфейсом користувача. Тестування системи пiдтвердило її здатнiсть автоматично визначати мовний макроконтекст i коригувати помилки iзольованого комп’ютерного зору без створення затримок у системах реального часу.
dc.description.abstractotherThe qualification work contains: 94 pages, 18 figures, 10 tables, 19 references. The aim of the qualification work is to improve the accuracy of multilingual handwritten text recognition by developing a combined system that integrates computer vision and lexical analysis methods. The object of research is the process of optical recognition of mixed handwritten characters. The subject of research includes machine learning algorithms and mathematical models of lexical decoding to eliminate the visual ambiguity of homoglyphs. During the work, a dataset containing Cyrillic, Latin characters, and digits was formed and balanced. An empirical comparative analysis of baseline machine learning algorithms (k-NN, LinearSVC, Random Forest) and a convolutional neural network was conducted. It was established that the architecture provides the highest accuracy of 94.6% with an inference speed of 28.35 ms per 1000 characters. To solve the problem of absolute homoglyphs, a multi-level lexical decoding algorithm was developed, which uses deterministic language anchoring and a probabilistic N-gram language model. The proposed algorithms are integrated into a unified software pipeline with a developed graphical user interface. System testing confirmed its ability to automatically determine the language macrocontext and correct isolated computer vision errors without introducing delays in real-time systems.
dc.format.extent94 с.
dc.identifier.citationПоштаренко, С. С. Розпiзнавання рукописних цифр i лiтер, порiвняння класичних ML та сучасних DL методiв : дипломна робота ... бакалавра : 113 Прикладна математика / Поштаренко Сергiй Сергiйович. – Київ, 2026. – 94 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/81627
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectоптичне розпiзнавання символiв
dc.subjectзгорткова нейронна мережа
dc.subjectомоглiфи
dc.subjectлексичне декодування
dc.subjectn-грамна мовна модель
dc.subjectкомп’ютерний зiр
dc.subjectмашинне навчання
dc.subject.udc004.932:004.032.26:81’322
dc.titleРозпiзнавання рукописних цифр i лiтер, порiвняння класичних ML та сучасних DL методiв
dc.typeBachelor Thesis

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Poshtarenko_bakalavr.pdf
Розмір:
3.18 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: