Методи і моделі перекладу та перенесення стилю звукових ефектів у коміксах: стилізація, переклад і типографічна верстка

dc.contributor.advisorЖелезняков, Дмитро Валентинович
dc.contributor.authorБеркута, Володимир Юрійович
dc.date.accessioned2026-06-08T12:58:35Z
dc.date.available2026-06-08T12:58:35Z
dc.date.issued2026
dc.description.abstractКваліфікаційна робота містить: 137 сторінок, 20 рисунків, 3 таблиці, 38 джерел. У цій роботі розроблено комплексну нейромережеву систему для автоматизованої обробки, локалізації, видалення та семантичного перекладу стилізованого тексту (звукoнаслідувань, англ. Sound Effects, SFX) і перенесення оригінальної стилістики SFX на український відповідник у візуально-текстових наративах (комікси, манхва). Метою дослідження є аналіз і порівняння існуючих методів, алгоритмів та моделей для розробки оркестратора, що підвищує ефективність та полегшує роботу перекладачів. Об’єкт дослідження – процес автоматизованого перекладу графічного тексту в корейських графічних новелах і коміксах. Предмет дослідження — методи комп’ютерного зору для сегментації екземплярів, алгоритми генеративного відновлення фону та методи семантичного перекладу. Під час виконання роботи спроєктовано та реалізовано наскрізний конвеєр. Підсистема локалізації базується на моделях сегментації сімейства YOLO; отримані маски уточнюються за допомогою алгоритму GrabCut. Для відновлення фону (англ. inpainting) застосовано архітектуру трансформера з урахуванням маски (англ. Mask-Aware Transformer, MAT), що дозволяє уникати кольорових неузгодженостей і зберігати стилістику зображення. Проблему художнього перекладу специфічних звукoнаслідувань вирішено за допомогою великої візуально-мовної моделі Qwen2.5-VL-7B-Instruct, інтегрованої з векторною базою даних ChromaDB у схемі генерації доповненї пошуком (англ. Retrieval-Augmented Generation, RAG). Фінальний етап рендерингу використовує інтерполяцію Ланцоша та попіксельне альфа-змішування для безшовної інтеграції згенерованого тексту. Експериментальна оцінка конвеєра за метриками структурної подібності (англ. Structural Similarity Index, SSIM) та семантичної косинусної близькості показала високу ефективність запропонованого підходу порівняно з класичними системами оптичного розпізнавання символів (англ. Optical Character Recognition, OCR).
dc.description.abstractotherThis thesis contains 137 pages, 20 figures, 3 tables, and 38 references. We present an end-to-end neural system for automatic processing, localization, removal, and semantic translation of stylized onomatopoeic text (sound effects, SFX), transferring the original SFX style to an appropriate Ukrainian equivalent in visual-textual narratives (comics, manhwa). The research goal is to analyze and compare existing methods, algorithms and models to develop an orchestrator that improves translator efficiency. The study object is the automated translation of graphical text in Korean graphic novels and comics; the subject is instance segmentation methods, generative background restoration algorithms, and semantic translation approaches. We designed and implemented a full processing pipeline. The localization subsystem is based on YOLO-family instance segmentation models whose masks are refined with the GrabCut algorithm. For background reconstruction (inpainting) we employ a Mask-Aware Transformer (MAT) to avoid color inconsistencies and preserve artistic style. Artistic translation of SFX is addressed using the large vision-language model Qwen2.5-VL-7B-Instruct integrated with a vector DB (ChromaDB) via Retrieval-Augmented Generation (RAG). The final rendering stage uses Lanczos interpolation and per-pixel alpha blending to seamlessly integrate generated text. Experimental evaluation using Structural Similarity Index (SSIM) and semantic cosine similarity demonstrates the proposed method’s strong performance compared to classical OCR systems.
dc.format.extent137 с.
dc.identifier.citationБеркута, В. Ю. Методи і моделі перекладу та перенесення стилю звукових ефектів у коміксах: стилізація, переклад і типографічна верстка : дипломна робота ... бакалавра : 113 Прикладна математика / Беркута Володимир Юрійович. – Київ, 2026. – 137 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/81537
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectcomputer vision
dc.subjectdeep learning
dc.subjectinstance segmentation
dc.subjectyolo
dc.subjectinpainting
dc.subjectmask-aware transformer
dc.subjectvision-language models
dc.subjectrag
dc.subjectautomatic translation
dc.subject.udc004.93:004.8
dc.titleМетоди і моделі перекладу та перенесення стилю звукових ефектів у коміксах: стилізація, переклад і типографічна верстка
dc.typeBachelor Thesis

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Berkuta_bakalavr.pdf
Розмір:
7.04 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: