Аналіз збіжності та надійності бінарної класифікації текстових даних на основі стохастичних методів та латентних представлень
| dc.contributor.advisor | Спекторський, Ігор Якович | |
| dc.contributor.author | Христов, Максим Богданович | |
| dc.date.accessioned | 2026-08-11T13:28:09Z | |
| dc.date.available | 2026-08-11T13:28:09Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Дипломна робота: 140 с., 15 табл., 16 рис., 2 додатки , 20 джерел. Об'єкт дослідження — процес бінарної класифікації текстових даних соціальних мереж. Предмет дослідження — метрики якості бінарного класифікатора та закономірності їх стохастичної стабільності залежно від обсягу вибірки. Мета роботи — дослідити вплив обсягу вибірки на стабільність метрик бінарної класифікації тексту та визначити мінімальний обсяг даних, достатній для отримання математично надійних результатів. Результат роботи — побудовано стохастичну модель бінарного класифікатора, збіжність оцінок якої обґрунтовано через закон великих чисел Хінчина та посилений закон Колмогорова. Виведено три довірчі інтервали для оцінок параметрів — на основі нерівності Чебишова, нерівності Хеффдінга та інтервалу Вальда зі сталим співвідношенням ширини 2.28 : 1.39 : 1.00. Реалізовано програмний pipeline з архітектурою Word2Vec → Denoising Autoencoder → MLP на датасеті Sentiment140 (1.6 млн твітів), що досягає F1- міри 0.7566. Експериментально верифіковано теоретичні результати через bootstrap-аналіз: швидкість збіжності 𝑂( 1 √𝑛 ) відтворено з точністю 10.52 проти 10.00, ймовірність покриття для меж Чебишова та Хеффдінга — 1.000, для межі Вальда — 0.96. Встановлено дві точки насичення: 𝑛 ∗ _𝑡𝑟𝑎𝑖𝑛 ≈ 100 000 та 𝑛 ∗ _𝑡𝑒𝑠𝑡 ≈ 25 000. Перспективи подальшого розвитку — створення основи для поширення розробленої методології аналізу надійності на багатокласову класифікацію, задачі з незбалансованими класами та сучасні трансформерні архітектури. | |
| dc.description.abstractother | Thesis: 140 pages, 15 tables, 16 figures, 2 appendices, 20 references. Object of research — the process of binary classification of textual data from social networks. Subject of research is the set of the quality metrics for a binary classifier and the regularities of their stochastic stability depending on the sample size. The aim of the work — to investigate the influence of sample size on the stability of binary text classification metrics and to determine the minimum amount of data sufficient to obtain mathematically reliable results. The main results — a stochastic model of a binary classifier is constructed, the convergence of model estimates is justified through Khinchin's law of large numbers and Kolmogorov's strong law. Three confidence intervals for parameter estimates are derived — based on Chebyshev's inequality, Hoeffding's inequality, and the Wald interval, with a stable width ratio of 2.28 : 1.39 : 1.00. A software pipeline with the architecture Word2Vec → Denoising Autoencoder → MLP is implemented on the Sentiment140 dataset (1.6 M tweets), achieving an F1-score of 0.7566. The theoretical results are experimentally verified via bootstrap analysis: the convergence rate 𝑂( 1 √𝑛 ) is reproduced with an accuracy of 10.52 against 10.00, the coverage probability for Chebyshev and Hoeffding bounds equals 1.000, and for Wald it is 0.96. Two saturation points are established: 𝑛 ∗ _𝑡𝑟𝑎𝑖𝑛 ≈ 100 000 and 𝑛 ∗ _𝑡𝑒𝑠𝑡 ≈ 25 000. As the prospects for further development we provide a foundation for extending the developed reliability analysis methodology to multiclass classification, imbalanced class problems, and modern transformer architectures . | |
| dc.format.extent | 140 с. | |
| dc.identifier.citation | Христов, М. Б. Аналіз збіжності та надійності бінарної класифікації текстових даних на основі стохастичних методів та латентних представлень : дипломна робота … бакалавра : 124 Системний аналіз / Христов Максим Богданович. – Київ, 2026. – 140 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/82409 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | бінарна класифікація | |
| dc.subject | довірчий інтервал | |
| dc.subject | закон великих чисел | |
| dc.subject | bootstrap | |
| dc.subject | стохастична збіжність | |
| dc.subject | денойзинговий автоенкодер | |
| dc.subject | word2vec | |
| dc.subject | sentiment140 | |
| dc.subject | binary classification | |
| dc.subject | confidence interval | |
| dc.subject | law of large numbers | |
| dc.subject | bootstrap | |
| dc.subject | stochastic convergence | |
| dc.subject | denoising autoencoder | |
| dc.title | Аналіз збіжності та надійності бінарної класифікації текстових даних на основі стохастичних методів та латентних представлень | |
| dc.type | Bachelor Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Khrystov_bakalavr.pdf
- Розмір:
- 4.19 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: