Методи мультикласового сентимент-аналізу на основі мовних моделей в умовах змішаного використання мов

Вантажиться...
Ескіз

Дата

2026

Назва журналу

Номер ISSN

Назва тому

Видавець

КПІ ім. Ігоря Сікорського

Анотація

Магістерська дисертація: 118 с., 13 рис., 16 табл., 38 посилань. Об'єкт дослідження – процес автоматичного визначення тональності коротких українсько-російських код-змішаних текстів із соціальних мереж. Предмет дослідження – методи адаптації мовних моделей до мультикласового сентимент-аналізу код-змішаних текстів з урахуванням дисбалансу класів і мовної структури повідомлень. Мета роботи – розробити та експериментально перевірити комплексний підхід до сентимент-аналізу українсько-російських кодзмішаних текстів. Методи дослідження – дотренування трансформерних енкодерних моделей, промптинг, QLoRA, дистиляція знань, аугментація даних, аналіз калібрування та LIME/SHAP-пояснюваність. Наукова новизна полягає у запропонованому комплексному підході CSSent для адаптації енкодерних моделей, який поєднує мовно-зумовлену класифікаційну голову, фокусну функцію втрат, допоміжне визначення мови, аугментацію та дистиляцію знань. Показано, що ефект CSSent залежить від базової моделі: для XLM-RoBERTa Large Macro F1 зростає з 0,6500 до 0,6684-0,6691, тоді як для Modern-LiBERTa приріст не є універсальним. Експерименти виконано на COSMUS і COSMUS+. Порівняно APIмоделі, локальні енкодерні моделі, MamayLM у режимах промптингу та QLoRA, а також CSSent-конфігурації; найкращий результат на COSMUS отримала Gemini 3.0 Flash ukr few-shot (Macro F1 = 0,6768), близький результат показала Modern-LiBERTa (0,6742), а MamayLM 12B після QLoRA досягла 0,6654.

Опис

Ключові слова

сентимент-аналіз, код-змішування, українська мова, мовні моделі, cosmus, трансформер, cssent, qlora, mamaylm, sentiment analysis, code-switching, ukrainian language, language models, cosmus, transformer, modern-liberta

Бібліографічний опис

Гіловянц, К. Д. Методи мультикласового сентимент-аналізу на основі мовних моделей в умовах змішаного використання мов : магістерська дис. : 122 Комп'ютерні науки / Гіловянц Кирил Дмитрович. – Київ, 2026. – 118 с.

ORCID

DOI