Аналіз даних секвенування ДНК для дослідження мікробіому кишківника людини і пов'язаних з ним хвороб

dc.contributor.advisorІванько, Катерина Олегівна
dc.contributor.authorКузьмінська, Дарія Вячеславівна
dc.date.accessioned2026-01-14T14:18:30Z
dc.date.available2026-01-14T14:18:30Z
dc.date.issued2025
dc.description.abstractВ роботі розглядається застосування методів машинного навчання до задачі дослідження ДНК мікробіому кишківника людини з метою визначення хвороб пов’язаних з шлунково-кишковим трактом. Реалізовано аналіз даних ДНК мікробіому людини використовуючи методи машинного навчання. Основну увагу приділено обробці даних секвенування нового покоління NGS (Next Generation Sequensing), представлених у форматі FASTQ, із подальшим формуванням ознак на основі k-мерів, що представляють собою відрізки послідовності ДНК довжиною k. З метою формування ознак для створення моделей машинного навчання для розпізнавання хвороб в роботі використано два основні підходи до векторизації послідовностей нуклеотидів: визначення частот появи k-мерів в прочитанних послідовностях нуклеотидів з використанням методів обробки природньої мови, а саме моделі "мішок слів", та семантичне векторне представлення k-мерів за допомогою моделі Word2Vec, яка використовує нейромережеву модель для навчання розпізнавання послідовності нуклеотидів. Проведено порівняльний аналіз обох підходів за допомогою моделей машинного навчання дерево рішень та ліс дерев рішень. Для валідації результатів застосовано метрики точності, повноти, F1-міри та побудовано матриці плутанини. У результаті було встановлено, що підхід мішок слів із використанням CountVectorizer та TF-IDF трансформації у поєднанні з моделлю машинного навчання випадковий ліс дерев рішень забезпечує здатність обробки даних при роботі з біологічними послідовностями.
dc.description.abstractotherThe master`s work considers the application of machine learning methods to the task of studying the DNA of the human gut microbiome in order to identify diseases associated with the gastrointestinal tract. The analysis of human gut microbiome DNA data using machine learning methods is realized. The main attention is paid to the processing of Next Generation Sequencing (NGS) data presented in the FASTQ format, followed by the formation of features based on k-meres, which are DNA sequence segments of length k. In order to generate features for creating machine learning models for disease recognition, two main approaches to nucleotide sequence vectorization are used in this paper: determining the frequencies of k-mer occurrence in read nucleotide sequences using natural language processing methods, namely the bag-of-words model, and semantic vector representation of k-mer using the Word2Vec model, which uses a neural network model to train nucleotide sequence recognition. A comparative analysis of both approaches was performed using the decision tree and decision tree forest machine learning models. To validate the results, the accuracy, completeness, F1-measure metrics were applied and confusion matrices were constructed. As a result, it was found that the bag-of-words approach using CountVectorizer and TF-IDF transformation in combination with the random decision tree machine learning model provides data processing capability when working with biological sequences.
dc.format.extent73 с.
dc.identifier.citationКузьмінська, Д. В. Аналіз даних секвенування ДНК для дослідження мікробіому кишківника людини і пов'язаних з ним хвороб : магістерська дис. : 176 Мікро- та наносистемна техніка / Кузьмінська Дарія Вячеславівна. – Київ, 2024. – 73 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/78119
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectсеквенування
dc.subjectДНК
dc.subjectМІКРОБІОМ
dc.subjectкішківник
dc.titleАналіз даних секвенування ДНК для дослідження мікробіому кишківника людини і пов'язаних з ним хвороб
dc.typeMaster Thesis

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Kuzminska_magistr.pdf
Розмір:
879.92 KB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: