Модифікований метод та програмне забезпечення для контенто-залежної фрагментації даних
| dc.contributor.advisor | Хіцко, Яна Володимирівна | |
| dc.contributor.author | Калашников-Травін, Владислав Володимирович | |
| dc.date.accessioned | 2026-01-12T14:44:08Z | |
| dc.date.available | 2026-01-12T14:44:08Z | |
| dc.date.issued | 2025 | |
| dc.description.abstract | У сучасних розподілених та хмарних сховищах даних, системах резервного копіювання та синхронізації обсяги інформації зростають експоненційно, при цьому значна частка нових даних утворюється шляхом модифікації вже наявних версій файлів. Це призводить до накопичення великої кількості логічно тотожних або майже тотожних фрагментів, що суттєво підвищує витрати на дисковий простір. Одним із ключових механізмів зменшення цих витрат є дедублікація даних, ефективність якої критично залежить від якості роботи методів фрагментації, насамперед від методів контенто-залежної фрагментації даних. Класичні методи демонструють суперечливий компроміс між пропускною здатністю, коефіцієнтом дедублікації та розподілом розмірів фрагментів, тоді як новітні модифікації часто вимагають тонкого налаштування під конкретні сценарії та не забезпечують оптимальних характеристик на довільних наборах даних. Запропонований метод, завдяки двонаправленому пошуку меж фрагментів, використанню двох окремих Gear-таблиць та встановленню альтернативних меж фрагментів, забезпечує підвищення пропускної здатності фрагментації даних від 2% до 39%, збільшення пропускної здатності дедублікації від 3% до 46 % та зростання коефіцієнта дедублікації даних на 3 % відносно вже відомих методів фрагментації даних. | |
| dc.description.abstractother | In modern distributed and cloud storage systems, as well as in backup and synchronization solutions, information volumes are growing exponentially, while a significant share of new data is produced by modifying existing versions of files. This leads to the accumulation of a large number of logically identical or nearly identical chunks, which substantially increases storage costs. One of the key mechanisms for reducing these costs is data deduplication, whose effectiveness critically depends on the quality of chunking methods, primarily, content-defined chunking (CDC). Classical approaches exhibit a conflicting trade-off between chunking throughput, deduplication ratio, and chunk size distribution, whereas newer modifications often require careful tuning for specific use cases and still fail to provide optimal characteristics on arbitrary datasets. The proposed method, enabled by bidirectional chunk-boundary search, the use of two separate Gear tables, and the selection of alternative chunk boundaries, delivers a 2% – 39% improvement in chunking throughput, a 3% – 46% increase in deduplication throughput, and a 3% gain in deduplication ratio compared to established data chunking methods. | |
| dc.format.extent | 151 с. | |
| dc.identifier.citation | Калашников-Травін, В. В. Модифікований метод та програмне забезпечення для контенто-залежної фрагментації даних : магістерська дис. : 121 Інженерія програмного забезпечення / Калашников-Травін Владислав Володимирович – Київ, 2025. – 151 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/78043 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | інженерія програмного забезпечення | |
| dc.subject | фрагмент | |
| dc.subject | фрагментація | |
| dc.subject | дедублікація | |
| dc.subject | CDC | |
| dc.subject.udc | 004.021 | |
| dc.title | Модифікований метод та програмне забезпечення для контенто-залежної фрагментації даних | |
| dc.type | Master Thesis |
Файли
Контейнер файлів
1 - 1 з 1
Вантажиться...
- Назва:
- Kalashnykov-Travin_magistr.pdf
- Розмір:
- 4.71 MB
- Формат:
- Adobe Portable Document Format
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: