Методи і моделі перекладу та перенесення стилю звукових ефектів у коміксах: стилізація, переклад і типографічна верстка
| dc.contributor.advisor | Железняков, Дмитро Валентинович | |
| dc.contributor.author | Беркута, Володимир Юрійович | |
| dc.date.accessioned | 2026-06-08T12:58:35Z | |
| dc.date.available | 2026-06-08T12:58:35Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Кваліфікаційна робота містить: 137 сторінок, 20 рисунків, 3 таблиці, 38 джерел. У цій роботі розроблено комплексну нейромережеву систему для автоматизованої обробки, локалізації, видалення та семантичного перекладу стилізованого тексту (звукoнаслідувань, англ. Sound Effects, SFX) і перенесення оригінальної стилістики SFX на український відповідник у візуально-текстових наративах (комікси, манхва). Метою дослідження є аналіз і порівняння існуючих методів, алгоритмів та моделей для розробки оркестратора, що підвищує ефективність та полегшує роботу перекладачів. Об’єкт дослідження – процес автоматизованого перекладу графічного тексту в корейських графічних новелах і коміксах. Предмет дослідження — методи комп’ютерного зору для сегментації екземплярів, алгоритми генеративного відновлення фону та методи семантичного перекладу. Під час виконання роботи спроєктовано та реалізовано наскрізний конвеєр. Підсистема локалізації базується на моделях сегментації сімейства YOLO; отримані маски уточнюються за допомогою алгоритму GrabCut. Для відновлення фону (англ. inpainting) застосовано архітектуру трансформера з урахуванням маски (англ. Mask-Aware Transformer, MAT), що дозволяє уникати кольорових неузгодженостей і зберігати стилістику зображення. Проблему художнього перекладу специфічних звукoнаслідувань вирішено за допомогою великої візуально-мовної моделі Qwen2.5-VL-7B-Instruct, інтегрованої з векторною базою даних ChromaDB у схемі генерації доповненї пошуком (англ. Retrieval-Augmented Generation, RAG). Фінальний етап рендерингу використовує інтерполяцію Ланцоша та попіксельне альфа-змішування для безшовної інтеграції згенерованого тексту. Експериментальна оцінка конвеєра за метриками структурної подібності (англ. Structural Similarity Index, SSIM) та семантичної косинусної близькості показала високу ефективність запропонованого підходу порівняно з класичними системами оптичного розпізнавання символів (англ. Optical Character Recognition, OCR). | |
| dc.description.abstractother | This thesis contains 137 pages, 20 figures, 3 tables, and 38 references. We present an end-to-end neural system for automatic processing, localization, removal, and semantic translation of stylized onomatopoeic text (sound effects, SFX), transferring the original SFX style to an appropriate Ukrainian equivalent in visual-textual narratives (comics, manhwa). The research goal is to analyze and compare existing methods, algorithms and models to develop an orchestrator that improves translator efficiency. The study object is the automated translation of graphical text in Korean graphic novels and comics; the subject is instance segmentation methods, generative background restoration algorithms, and semantic translation approaches. We designed and implemented a full processing pipeline. The localization subsystem is based on YOLO-family instance segmentation models whose masks are refined with the GrabCut algorithm. For background reconstruction (inpainting) we employ a Mask-Aware Transformer (MAT) to avoid color inconsistencies and preserve artistic style. Artistic translation of SFX is addressed using the large vision-language model Qwen2.5-VL-7B-Instruct integrated with a vector DB (ChromaDB) via Retrieval-Augmented Generation (RAG). The final rendering stage uses Lanczos interpolation and per-pixel alpha blending to seamlessly integrate generated text. Experimental evaluation using Structural Similarity Index (SSIM) and semantic cosine similarity demonstrates the proposed method’s strong performance compared to classical OCR systems. | |
| dc.format.extent | 137 с. | |
| dc.identifier.citation | Беркута, В. Ю. Методи і моделі перекладу та перенесення стилю звукових ефектів у коміксах: стилізація, переклад і типографічна верстка : дипломна робота ... бакалавра : 113 Прикладна математика / Беркута Володимир Юрійович. – Київ, 2026. – 137 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/81537 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | computer vision | |
| dc.subject | deep learning | |
| dc.subject | instance segmentation | |
| dc.subject | yolo | |
| dc.subject | inpainting | |
| dc.subject | mask-aware transformer | |
| dc.subject | vision-language models | |
| dc.subject | rag | |
| dc.subject | automatic translation | |
| dc.subject.udc | 004.93:004.8 | |
| dc.title | Методи і моделі перекладу та перенесення стилю звукових ефектів у коміксах: стилізація, переклад і типографічна верстка | |
| dc.type | Bachelor Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Berkuta_bakalavr.pdf
- Розмір:
- 7.04 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: