Мультимодальна мовна модель для генерації текстових описів по зображенню

dc.contributor.advisorНедашківська, Надія Іванівна
dc.contributor.authorНечай, Микола Сергійович
dc.date.accessioned2025-07-24T08:47:27Z
dc.date.available2025-07-24T08:47:27Z
dc.date.issued2025
dc.description.abstractДипломна робота: 168 с., 34 рис., 7 табл., 2 додатки, 13 джерел. Об’єкт дослідження – генерація текстових описів зображень базуючихся на гібридному вхідному форматі даних. Предмет дослідження – модель PaliGemma, яка являє собою інноваційний підхід у сферах обробки природної мови та комп’ютерного зору, використовуючи технологію трансформерів, зокрема в контексті комбінованих запитів (текст та зображення). Мета роботи – побудувати архітектуру моделі PaliGemma і розробити застосунок для її інференсу через веб-інтерфейс для зручної взаємодії з користувачем. Мета дослідження – побудувати архітектуру моделі PaliGemma і розробити застосунок для її інференсу через веб-інтерфейс для зручної взаємодії з користувачем. Актуальність – з розвитком технологій у сфері нейронних мереж і штучного інтелекту, сфера генеративних мереж, яка може поєднувати обробку природної мови та комп'ютерний зір, стає все більш актуальною. Наразі LLM з гібридним форматом вхідних даних використовується повсюди: 1) у бізнес-сфері для вирішення побажань клієнтів, наприклад, інтеграція чат–ботів у програмне забезпечення; 2) в науковій сфері для вивчення та аналізу дослідницьких статей; 3) у сфері освіти, LLM використовуються для роз’яснення матеріалу, постановки завдань та їх швидкої перевірки; 4) у сфері медицини для виявлення по знімкам МРТ ракових пухлин. Результати роботи – у межах роботи було реалізовано модель генерації текстових описів за текстовим і растровим інпутом з використанням моделі PaliGemma. Шляхи подальшого розвитку предмета дослідження – в майбутньому можна ще більше розширити вхідні формати даних, щоб модель стала ще більш універсальною, також можна ще детренувати модель для покращення узагальнюючих здібностей моделі, і для більш зручного користувацького досвіду можна розробити мобільний застосунок.
dc.description.abstractotherDiploma thesis: 168 p., 34 figures, 7 tables, 2 appendices, 13 sources. Object of the study – generation of text descriptions for images based on hybrid input data format. Subject of the study – the PaliGemma model, which represents an innovative approach in the fields of natural language processing and computer vision, using transformer technology, particularly in the context of combined queries (text and images). Goal of the work – to build the architecture of the PaliGemma model and develop an application for its inference via a web interface for convenient user interaction. Research goal – to build the architecture of the PaliGemma model and develop an application for its inference via a web interface for convenient user interaction. Relevance – with the development of technologies in the field of neural networks and artificial intelligence, the field of generative networks that combine natural language processing and computer vision is becoming increasingly relevant. Currently, LLMs with hybrid input data formats are used everywhere: 1) in business to address client needs, such as integrating chatbots into software; 2) in the scientific field for studying and analyzing research papers; 3) in education, LLMs are used to explain material, set tasks, and quickly assess them; 4) in medicine for detecting cancerous tumors in MRI scans. Results of the work – within the scope of the work, a model for generating text descriptions from text and raster input was implemented using the PaliGemma model. Future development directions for the subject of the study – in the future, the input data formats can be further expanded to make the model even more versatile, and the model can be further fine–tuned to improve its generalization capabilities. To enhance user experience, a mobile application can also be developed.
dc.format.extent170 с.
dc.identifier.citationНечай, М. С. Мультимодальна мовна модель для генерації текстових описів по зображенню : дипломна робота ... бакалавра : 124 Системний аналіз / Нечай Микола Сергійович. - Київ, 2025. - 170 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/75210
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectмультимодальна мовна модель
dc.subjectмовна модель
dc.subjectгенерація тексту
dc.subjectопис зображень
dc.subjectкомп’ютерний зір
dc.subjectтекстова генерація
dc.subjectштучний інтелект
dc.subjectмашинне навчання
dc.subjectобробка природної мови
dc.subjectmultimodal language model
dc.subjectlanguage model
dc.subjecttext generation
dc.subjectimage description
dc.subjectcomputer vision
dc.subjecttextual generation
dc.subjectartificial intelligence
dc.subjectmachine learning
dc.subjectnatural language processing
dc.titleМультимодальна мовна модель для генерації текстових описів по зображенню
dc.typeBachelor Thesis

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Nechay_bakalavr.pdf
Розмір:
6.25 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: