Математичні моделі та методи 3D реконструкції в доповненій реальності
| dc.contributor.advisor | Куссуль, Наталія Миколаївна | |
| dc.contributor.author | Савін, Володимир Вадимович | |
| dc.date.accessioned | 2026-07-15T11:22:42Z | |
| dc.date.available | 2026-07-15T11:22:42Z | |
| dc.date.issued | 2026 | |
| dc.description.abstract | Савін В.В. Математичні моделі та методи 3D реконструкції в доповненій реальності. – Кваліфікаційна наукова праця на правах рукопису. Дисертація на здобуття наукового ступеня доктора філософії за спеціальністю 113 «Прикладна математика» (галузь знань 11 «Математика та Статистика»). – Національний технічний університет України «Київський політехнічний інститут імені Ігоря Сікорського», Київ, 2026. В останні десятиліття спостерігається надзвичайно швидкий розвиток технологій доповненої реальності (ДР), які відкривають новий етап взаємодії людини з інформацією та оточуючим середовищем. Сценарії використання цих технологій стрімко еволюціонують, переходячи з мобільних на самостійніносимі пристрої. Продукти, які дозволяють споживати сценарії ДР, виходять зі стадії обмежених та дорогих платформ розробки і набувають масовості. Сучасні тренди у галузі доповненої реальності визначаються не лише зростанням її популярності, але й постійним удосконаленням технологічного арсеналу. Все більше компаній і дослідницьких груп зосереджують свою увагу на розробці інноваційних методів та рішень спрямованих на підвищення реалістичності взаємодії об’єктів ДР з реальним світом та користувача з об’єктами ДР. Одні з ключових технологій, необхідних для досягненні максимальної імерсії взаємодії та реалізації потенціалу ДР є реконструкція карт глибини та 3D реконструкція оточуючого середовища і його об’єктів. Мета 3D реконструкції полягає у відтворенні тривимірної моделі оточення на основі доступних даних: дво- та тривимірні зображення, внутрішні та зовнішні параметри камери, дані з IMU сенсорів, або систем позиціонування і т.д. 3D реконструкція є своєрідним каркасом для доповненої реальності, а її основною складовою є отримання (за рахунок апаратних засобів), чи відтворення (за рахунок алгоритмів на основі даних з одної чи декількох камер) карт глибини. Якість моделі реконструйованої сцени суттєво впливає на реалістичність сприйняття сценаріїв доповненої реальності користувачем. Справжній виклик полягає в тому, як забезпечити точність, достовірність та ефективність 3D реконструкції середовища при виконанні алгоритмів на кінцевих пристроях користувача та апаратних прискорювачах з обмеженою розрядністю (DSP/NPU), особливо, в умовах наявності на сцені динамічного освітлення та складних поверхонь (відбивні чи напівпрозорі). Метою даного дослідження є підвищення якості, стійкості та енергоефективності методів 3D реконструкції середовища, що виконуються на кінцевому пристрої користувача, для забезпечення реалістичної та надійної взаємодії користувача з віртуальними об’єктами в системах доповненої реальності. Якість існуючих класичних підходів реконструкції карт глибини чи 3D реконструкції сцени недостатня для реалізація якісних та імерсивних сценаріїв доповненої реальності. Такі алгоритми часто помиляються на складних поверхнях, таких як: однорідні, прозорі/напівпрозорі, відбивні, поверхні з періодичною текстурою; та на складних сценах, що містять: тонкі чи дрібні структури, динамічне освітлення, динамічні об’єкти. Сучасні методи реконструкції карт глибини чи 3D реконструкції сцени вирішують, або мінімізують вплив вищезазначених складних сцен та поверхонь. Але їх обчислювальна складність робить їх непридатними, або не ефективними для використання на кінцевих пристроях користувача з обмеженими обчислювальними можливостями та з батареями невисокої ємності. Тому актуальною є розробка нових методів та підходів, що дозволять врахувати особливості складних сцен при їх реконструкції на кінцевих пристроях користувача та на апаратних прискорювачах з обмеженою розрядністю. Перший розділ дисертаційного дослідження систематизує популярні існуючі роботи та підходи, що присвячені задачам реконструкції карт глибини та 3D реконструкції сцени. Демонструються результати аналізу даних методів, визначено їх основні недоліки та сформульовано завдання дисертаційного дослідження. У другому розділі досліджується проблема реконструкції середовища в умовах динамічного освітлення сцени. Запропоновано модифікацію Neural Radiance Fields (NeRF) моделі до умов динамічного освітлення шляхом модифікації функцій втрат та введення часової змінної. Проведені експерименти на відкритих наборах даних, які демонструють ознаки наявності динамічного освітлення, підтверджують ефективність запропонованого підходу. Також, проведено аналіз та запропоновано використання описаного методу для розширення (аугментації) наявних наборів даних шляхом синтезу зображень новітніх видів сцени з метою подальшого навчання легших моделей орієнтованих на ефективне виконання на кінцевому пристрої користувача. У третьому розділі дисертаційної роботи розглядається проблема реконструкції карт глибини при наявних на сцені відбивних чи напівпрозорих поверхонь. Запропоновано метод, який дозволяє отримати та окремо зберігти значення глибини до самої складної поверхні та до відбитого чи перекритого об’єкту. Описаний метод запатентовано як винахід в глобальній базі WIPO PATENTSCOPE та присутній в петентних базах багатьох країн, включаючи Республіка Корея, США та ін. Четвертий розділ адресує проблему ефективної реконструкції карт глибини високої точності та з широким діапазоном глибини на апаратних прискорювачах з обмеженою розрядністю кінцевих пристроїв користувача. Запропоновано метод, особливістю якого є модифікація архітектури моделі реконструкції карт глибини шляхом додавання виходів для окремого передбачення компонент двовімірної кривої Гільберта. Виходи моделі піддаються простій постобробці для отримання карт глибини широкого діапазону. Представлені результати експериментів на відкритих наборах даних демонструють: - суттєве зменшення похибки квантування моделі, виконання якої планується на апаратних прискорювачах з обмеженою розрядністю; - покращення якості реконструкції карт глибини, особливо при наявності дрібних структур; - збільшення розрядності результуючих значень карт глибини, що призводить до розширення робочого діапазону та точності значень глибини; - зменшення часу виконання та енергоспоживання результуючої квантованої моделі. Демонструються результати аналізу обмежень запропонованого підходу та можливості для його подальшого розвитку. Наукова новизна отриманих результатів: 1. Удосконалено метод Neural Radiance Fields (NeRF) до умов динамічного освітлення шляхом модифікації функцій втрат та введення часової змінної, що дозволило покращити якість реконструкції сцен з динамічним освітленням та розширювати існуючі набори даних для складних сцен. 2. Вперше розроблено та запатентовано метод реконструкції глибини, який враховує напівпрозорі та відбивні поверхні, зберігає окремо значення глибини до самої площини та до відбитого/перекритого об’єкту, що дозволяє збільшити точність реконструкції складних сцен, які містять не дифузні поверхні. 3. Вперше сформульовано та розроблено метод для прогнозування карт глибини з представленням виходу моделі у вигляді компонент двовимірної кривої Гільберта, що дозволило для квантованих моделей розширити діапазон глибини, підвищити її точність та покращити енергоефективність реконструкції сцени на апаратних прискорювачах з обмеженою розрядністю (DSP/NPU) кінцевих пристроїв користувача. Практичне значення отриманих результатів та їх застосування. Результати присутні в даному дослідженні були використані в рамках комерційних та науково-дослідницьких проектів ТОВ «Самсунг РнД Інститут Україна». Запропоновані методи знайшли застосування у галузі візуального інтелекту при вирішенні завдань 3D реконструкції сцени для доповненої реальності та створення/редагування просторового контенту. 1. Метод призначений для реконструкції карт глибини з урахуванням напівпрозорих та відбивних поверхонь, що орієнтований на підвищення якості відтворення складних об’єктів, зокрема при наявності динамічного освітлення захищено патентом (US20240144503А1). Отриманий патент розширює патентне портфоліо компанії у відповідному технологічному домені. 2. Метод прогнозування високоточних карт глибини з широким діапазоном на пристроях з обмеженою розрядністю, що ґрунтується на використанні двовимірних кривих Гільберта, дозволяє: зменшити похибку квантування моделі у 4,6 рази, що підвищує якість реконструкції карт глибини на DSP-пристроях; розширити діапазон відстаней за рахунок збільшення ефективної розрядності з 8-біт до 10-біт; зменшити час виконання та енергоспоживання квантованої моделі у 1,5 раза порівняно з оригінальною моделлю за умови збереження або покращення якості прогнозування карт глибини. 3. Розглянуті та запропоновані методи 3D реконструкції сцени на кінцевих пристроях користувача з обмеженими обчислювальними ресурсами було використано при розробці комерційних проектів, що спрямовані на сценарії створення/редагування просторового контенту для флагманської моделі смартфону Samsung Galaxy S25. Також, представлення виходу моделі на основі кривої Гільберта, що запропоновано у методі прогнозування карт глибини високої точності з широким діапазоном на пристроях з обмеженою розрядністю може бути застосовано для покращення якості та ефективності і інших задач комп’ютерного зору на основі методів машинного навчання, що виконуються на апаратних прискорювачах з низькою арифметикою. | |
| dc.description.abstractother | Savin V.V. Mathematical models and methods of 3D reconstruction in Augmented Reality. – A qualification research work, manuscript. PhD thesis in specialty 113 “Applied Mathematics” (field of knowledge 11 “Mathematics and Statistics”). – National Technical University of Ukraine “Igor Sikorsky Kyiv Polytechnic Institute,” Kyiv, 2026. In recent decades, augmented reality (AR) technologies have advanced at an exceptional pace, opening a new phase of human interaction with information and the surrounding environment. Usage scenarios are rapidly evolving from mobile to standalone wearable devices. Products enabling AR experiences are moving from the stage of limited and expensive developer platforms towards mass adoption. Current trends in AR are defined not only by growing popularity but also by continuous enhancement of the technological toolkit. An increasing number of companies and research groups focus on developing innovative methods and solutions that raise the realism of interactions between AR objects and the real world, as well as between users and AR content. Among the key technologies required to achieve highly immersive interaction and to enable the potential of AR are depth-map estimation and 3D reconstruction of the environment and its objects. The goal of 3D reconstruction is to recover a threedimensional model of a scene from available data: 2D/3D images, camera intrinsics and extrinsics, IMU sensor signals, positioning systems, etc. 3D reconstruction forms the structural backbone of AR. Its core component is the acquisition (via hardware) or estimation (via algorithms operating on data from one or multiple cameras) of depth maps. The quality of the reconstructed scene model critically affects how the user percepts the realism of AR scenarios. A main challenge is ensuring the accuracy, fidelity, and efficiency of 3D reconstruction on end-user devices and low-precision hardware accelerators (DSP/NPU) in the presence of dynamic lighting and challenging surface types (reflective or semi-transparent). The aim of this work is to improve the quality, stability and energy efficiency of on-device 3D environment reconstruction methods, in order to enable realistic and reliable user interaction with virtual objects in augmented reality systems. The quality of existing classical approaches of depth-map estimation and 3D scene reconstruction is insufficient for high-quality, immersive AR experiences. Such algorithms frequently fail on challenging surfaces, including homogeneous, transparent/semi-transparent, reflective, and periodically textured materials, as well as in complex scenes containing thin or fine structures, dynamic illumination, and dynamic objects. Modern methods address or mitigate many of these challenges, but their computational cost makes them impractical or inefficient on resource-constrained end devices with limited battery capacity. Therefore, the development of new methods and approaches that enables efficient on-device scene reconstruction at low-precision hardware accelerators, remains a relevant research task. Chapter 1 systematizes prominent existing works and approaches devoted to depth-map estimation and 3D scene reconstruction. It presents an analysis of these methods, identifies their main limitations, and formulates the research objectives of the PhD thesis. Chapter 2 studies the problem of environment reconstruction considering dynamic illumination conditions. A modification of Neural Radiance Fields (NeRF) is proposed to enable scene reconstruction under dynamic illumination conditions by adjusting the loss functions and introducing a temporal variable. Experiments on open datasets exhibiting signs of dynamic illumination confirm the effectiveness of the proposed approach. The chapter also analyzes and proposes the use of this method for augmenting existing datasets by synthesizing novel views of a scene for further lighter models training focused at efficient on-device inference. Chapter 3 addresses depth-map reconstruction in scenes containing reflective or semi-transparent surfaces. A method is proposed that enables obtaining and separately storing the depth value to the complex surface itself and to the reflected or occluded object. The described method has been patented as an invention in the global WIPO PATENTSCOPE database and is also registered in the patent databases of many countries, including the Republic of Korea, the United States, and others. Chapter 4 tackles efficient reconstruction of high-precision, wide-range depth maps on low-precision hardware accelerators of end devices. The key feature of proposed method is a modification of the depth-estimation model architecture by adding outputs that separately predict the components of a two-dimensional Hilbert curve. The model outputs are then post-processed with a simple procedure to obtain wide-range depth maps. Experiments on open datasets demonstrate: - a significant reduction of the model quantization error, enabling its accurate inference on low-precision accelerators; - improved depth-map reconstruction quality, especially for fine structures; - increased effective bit-depth of the resulting depth values, expanding the operating range and depth accuracy; - reduced inference time and energy consumption of the resulting quantized model. The chapter also presents an analysis of the proposed approach’s limitations and outlines opportunities for further development. Scientific novelty of the obtained results: 1. The Neural Radiance Fields (NeRF) method was improved for dynamic lighting conditions by modifying the loss functions and introducing a temporal variable, which made it possible to enhance reconstruction quality for scenes with dynamic illumination and to expand existing datasets for complex scenes. 2. For the first time, a depth-reconstruction method was developed and patented that accounts for semi-transparent and reflective surfaces and separately stores the depth value to the surface plane itself and to the reflected/occluded object, thereby increasing reconstruction accuracy for complex scenes containing non-diffuse surfaces. 3. For the first time, a method was formulated and developed for depth-map prediction in which the model output is represented as components of a two-dimensional Hilbert curve. This enabled quantized models to extend the depth range, improve depth accuracy, and increase the energy efficiency of scene reconstruction on low-precision hardware accelerators (DSP/NPU) of end-user devices. Practical significance of the obtained results and their application. The results presented in this study were used within commercial and R&D projects of Samsung R&D Institute Ukraine LLC. The proposed methods have been applied in the visual intelligence domain for solving problems of 3D scene reconstruction for augmented reality and for spatial content creation/editing. 1. A method for depth-map reconstruction that accounts for semi-transparent and reflective surfaces and is aimed at improving the reconstruction quality of complex objects, including under dynamic lighting, is protected by a patent (US20240144503A1). The granted patent expands the company’s patent portfolio in the corresponding technological domain. 2. A method for predicting high-precision, wide-range depth maps on lowprecision devices, based on the use of two-dimensional Hilbert curves, enables: a 4.6× reduction in model quantization error, which improves depth-map reconstruction quality on DSP devices; an extension of the distance range by increasing the effective bit-depth from 8-bit to 10-bit; and a 1.5× reduction in inference time and energy consumption of the quantized model compared to the original model, while maintaining or improving depth-prediction quality. 3. The considered and proposed methods for on-device 3D scene reconstruction under limited computational resources were used in the development of commercial projects targeting spatial content creation/editing scenarios for the flagship smartphone model Samsung Galaxy S25. Furthermore, representing the model output based on a Hilbert curve, as proposed in the method for high-precision, wide-range depth-map prediction on lowprecision devices, can also be applied to improve the quality and efficiency of other computer-vision tasks based on machine-learning methods executed on low-precision hardware accelerators. | |
| dc.format.extent | 181 с. | |
| dc.identifier.citation | Савін, В. В. Математичні моделі та методи 3D реконструкції в доповненій реальності : дис. … д-ра філософії : 113 – Прикладна математика / Савін Володимир Вадимович. – Київ, 2026. – 181 с. | |
| dc.identifier.uri | https://ela.kpi.ua/handle/123456789/82243 | |
| dc.language.iso | uk | |
| dc.publisher | КПІ ім. Ігоря Сікорського | |
| dc.publisher.place | Київ | |
| dc.subject | машинне навчання | |
| dc.subject | глибинне навчання | |
| dc.subject | нейронна мережа | |
| dc.subject | комп’ютерний зір | |
| dc.subject | карта глибини | |
| dc.subject | 3D реконструкція | |
| dc.subject | Neural Radiance Fields | |
| dc.subject | квантування | |
| dc.subject | криві Гільберта | |
| dc.subject | виконання моделі на кінцевому пристрої | |
| dc.subject | генерація навчальних даних | |
| dc.subject | аугментація | |
| dc.subject | функція втрат | |
| dc.subject | DispNet | |
| dc.subject | Dense Prediction Transformer | |
| dc.subject | machine learning | |
| dc.subject | deep learning | |
| dc.subject | neural network | |
| dc.subject | computer vision | |
| dc.subject | depth map | |
| dc.subject | 3D reconstruction | |
| dc.subject | quantization | |
| dc.subject | Hilbert curves | |
| dc.subject | on-device inference | |
| dc.subject | training-data generation | |
| dc.subject | augmentation | |
| dc.subject | loss function | |
| dc.subject.udc | 004.8, 004.93 | |
| dc.title | Математичні моделі та методи 3D реконструкції в доповненій реальності | |
| dc.title.alternative | Mathematical models and methods of 3D reconstruction in Augmented Reality | |
| dc.type | Thesis Doctoral |
Файли
Контейнер файлів
1 - 1 з 1
Ліцензійна угода
1 - 1 з 1
Ескіз недоступний
- Назва:
- license.txt
- Розмір:
- 8.98 KB
- Формат:
- Item-specific license agreed upon to submission
- Опис: