Мультимодальна мовна модель для генерації текстових описів по зображенню
| dc.contributor.advisor | Недашківська, Надія Іванівна | |
| dc.contributor.author | Нечай, Микола Сергійович | |
| dc.date.accessioned | 2025-07-24T08:47:27Z | |
| dc.date.available | 2025-07-24T08:47:27Z | |
| dc.date.issued | 2025 | |
| dc.description.abstract | Дипломна робота: 168 с., 34 рис., 7 табл., 2 додатки, 13 джерел. Об’єкт дослідження – генерація текстових описів зображень базуючихся на гібридному вхідному форматі даних. Предмет дослідження – модель PaliGemma, яка являє собою інноваційний підхід у сферах обробки природної мови та комп’ютерного зору, використовуючи технологію трансформерів, зокрема в контексті комбінованих запитів (текст та зображення). Мета роботи – побудувати архітектуру моделі PaliGemma і розробити застосунок для її інференсу через веб-інтерфейс для зручної взаємодії з користувачем. Мета дослідження – побудувати архітектуру моделі PaliGemma і розробити застосунок для її інференсу через веб-інтерфейс для зручної взаємодії з користувачем. Актуальність – з розвитком технологій у сфері нейронних мереж і штучного інтелекту, сфера генеративних мереж, яка може поєднувати обробку природної мови та комп'ютерний зір, стає все більш актуальною. Наразі LLM з гібридним форматом вхідних даних використовується повсюди: 1) у бізнес-сфері для вирішення побажань клієнтів, наприклад, інтеграція чат–ботів у програмне забезпечення; 2) в науковій сфері для вивчення та аналізу дослідницьких статей; 3) у сфері освіти, LLM використовуються для роз’яснення матеріалу, постановки завдань та їх швидкої перевірки; 4) у сфері медицини для виявлення по знімкам МРТ ракових пухлин. Результати роботи – у межах роботи було реалізовано модель генерації текстових описів за текстовим і растровим інпутом з використанням моделі PaliGemma. Шляхи подальшого розвитку предмета дослідження – в майбутньому можна ще більше розширити вхідні формати даних, щоб модель стала ще більш універсальною, також можна ще детренувати модель для покращення узагальнюючих здібностей моделі, і для більш зручного користувацького досвіду можна розробити мобільний застосунок. | |
| dc.description.abstractother | Diploma thesis: 168 p., 34 figures, 7 tables, 2 appendices, 13 sources. Object of the study – generation of text descriptions for images based on hybrid input data format. Subject of the study – the PaliGemma model, which represents an innovative approach in the fields of natural language processing and computer vision, using transformer technology, particularly in the context of combined queries (text and images). Goal of the work – to build the architecture of the PaliGemma model and develop an application for its inference via a web interface for convenient user interaction. Research goal – to build the architecture of the PaliGemma model and develop an application for its inference via a web interface for convenient user interaction. Relevance – with the development of technologies in the field of neural networks and artificial intelligence, the field of generative networks that combine natural language processing and computer vision is becoming increasingly relevant. Currently, LLMs with hybrid input data formats are used everywhere: 1) in business to address client needs, such as integrating chatbots into software; 2) in the scientific field for studying and analyzing research papers; 3) in education, LLMs are used to explain material, set tasks, and quickly assess them; 4) in medicine for detecting cancerous tumors in MRI scans. Results of the work – within the scope of the work, a model for generating text descriptions from text and raster input was implemented using the PaliGemma model. Future development directions for the subject of the study – in the future, the input data formats can be further expanded to make the model even more versatile, and the model can be further fine–tuned to improve its generalization capabilities. To enhance user experience, a mobile application can also be developed. | |
| dc.format.extent | 170 с. | |
| dc.identifier.citation | Нечай, М. С. Мультимодальна мовна модель для генерації текстових описів по зображенню : дипломна робота ... бакалавра : 124 Системний аналіз / Нечай Микола Сергійович. - Київ, 2025. - 170 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/75210 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | мультимодальна мовна модель | |
| dc.subject | мовна модель | |
| dc.subject | генерація тексту | |
| dc.subject | опис зображень | |
| dc.subject | комп’ютерний зір | |
| dc.subject | текстова генерація | |
| dc.subject | штучний інтелект | |
| dc.subject | машинне навчання | |
| dc.subject | обробка природної мови | |
| dc.subject | multimodal language model | |
| dc.subject | language model | |
| dc.subject | text generation | |
| dc.subject | image description | |
| dc.subject | computer vision | |
| dc.subject | textual generation | |
| dc.subject | artificial intelligence | |
| dc.subject | machine learning | |
| dc.subject | natural language processing | |
| dc.title | Мультимодальна мовна модель для генерації текстових описів по зображенню | |
| dc.type | Bachelor Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Nechay_bakalavr.pdf
- Розмір:
- 6.25 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: