Модифікований метод та програмне забезпечення для контенто-залежної фрагментації даних

dc.contributor.advisorХіцко, Яна Володимирівна
dc.contributor.authorКалашников-Травін, Владислав Володимирович
dc.date.accessioned2026-01-12T14:44:08Z
dc.date.available2026-01-12T14:44:08Z
dc.date.issued2025
dc.description.abstractУ сучасних розподілених та хмарних сховищах даних, системах резервного копіювання та синхронізації обсяги інформації зростають експоненційно, при цьому значна частка нових даних утворюється шляхом модифікації вже наявних версій файлів. Це призводить до накопичення великої кількості логічно тотожних або майже тотожних фрагментів, що суттєво підвищує витрати на дисковий простір. Одним із ключових механізмів зменшення цих витрат є дедублікація даних, ефективність якої критично залежить від якості роботи методів фрагментації, насамперед від методів контенто-залежної фрагментації даних. Класичні методи демонструють суперечливий компроміс між пропускною здатністю, коефіцієнтом дедублікації та розподілом розмірів фрагментів, тоді як новітні модифікації часто вимагають тонкого налаштування під конкретні сценарії та не забезпечують оптимальних характеристик на довільних наборах даних. Запропонований метод, завдяки двонаправленому пошуку меж фрагментів, використанню двох окремих Gear-таблиць та встановленню альтернативних меж фрагментів, забезпечує підвищення пропускної здатності фрагментації даних від 2% до 39%, збільшення пропускної здатності дедублікації від 3% до 46 % та зростання коефіцієнта дедублікації даних на 3 % відносно вже відомих методів фрагментації даних.
dc.description.abstractotherIn modern distributed and cloud storage systems, as well as in backup and synchronization solutions, information volumes are growing exponentially, while a significant share of new data is produced by modifying existing versions of files. This leads to the accumulation of a large number of logically identical or nearly identical chunks, which substantially increases storage costs. One of the key mechanisms for reducing these costs is data deduplication, whose effectiveness critically depends on the quality of chunking methods, primarily, content-defined chunking (CDC). Classical approaches exhibit a conflicting trade-off between chunking throughput, deduplication ratio, and chunk size distribution, whereas newer modifications often require careful tuning for specific use cases and still fail to provide optimal characteristics on arbitrary datasets. The proposed method, enabled by bidirectional chunk-boundary search, the use of two separate Gear tables, and the selection of alternative chunk boundaries, delivers a 2% – 39% improvement in chunking throughput, a 3% – 46% increase in deduplication throughput, and a 3% gain in deduplication ratio compared to established data chunking methods.
dc.format.extent151 с.
dc.identifier.citationКалашников-Травін, В. В. Модифікований метод та програмне забезпечення для контенто-залежної фрагментації даних : магістерська дис. : 121 Інженерія програмного забезпечення / Калашников-Травін Владислав Володимирович – Київ, 2025. – 151 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/78043
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectінженерія програмного забезпечення
dc.subjectфрагмент
dc.subjectфрагментація
dc.subjectдедублікація
dc.subjectCDC
dc.subject.udc004.021
dc.titleМодифікований метод та програмне забезпечення для контенто-залежної фрагментації даних
dc.typeMaster Thesis

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Kalashnykov-Travin_magistr.pdf
Розмір:
4.71 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: