Підвищення ефективності методів відновлення зображень на основі модифікованої згорткової мережі

dc.contributor.advisorМухін, Вадим Євгенійович
dc.contributor.authorЛиновський, Андрій Олексійович
dc.date.accessioned2026-08-28T12:56:01Z
dc.date.available2026-08-28T12:56:01Z
dc.date.issued2026
dc.description.abstractЛиновський А.О. Підвищення ефективності методів відновлення зображень на основі модифікованої згорткової мережі. - Кваліфікаційна наукова праця на правах рукопису. Дисертаційна робота на здобуття наукового ступеня доктора філософії за спеціальністю 122 «Компʼютерні науки». - Національний технічний університет України «Київський політехнічний інститут імені Ігоря Сікорського», 2026. Об’єктом дослідження є процес шумозаглушення медичних зображень, пошкоджених імпульсним SaP-шумом. Зокрема згорткові нейронні мережі та модулі уваги. Предметом дослідження є методи й засоби нейромережевого шумозаглушення, зокрема модифікації архітектури SeConvNet, а також їхній вплив на якість відновлення (PSNR), обчислювальні витрати та стійкість до різних рівнів SaP-шуму на реальних і синтетичних даних. У першому розділі здійснено всебічний та комплексний аналіз існуючих методів відновлення зображень після шумових спотворень. Досліджено еволюцію підходів, починаючи від класичних методів обробки у просторовій області (лінійні та нелінійні фільтри, зокрема медіанна фільтрація) та методів у перетворюючій області (вейвлет-перетворення, DCT). Встановлено, що класичні просторові фільтри схильні до надмірного згладжування контурів та втрати дрібних деталей при високій щільності імпульсного шуму. Сучасні нелокальні алгоритми, такі як BM3D та NL-Means, забезпечують вищу якість та добре відновлюють повторювані текстури, однак їх використання жорстко обмежене значною обчислювальною складністю. Детально проаналізовано застосування методів машинного та глибокого навчання (CNN, RNN, GAN, дифузійні імовірнісні моделі та трансформери) для усунення шуму. Згорткові нейронні мережі (наприклад, архітектура DnCNN) продемонстрували високу ефективність для гаусівського шуму, проте їх здатність обробляти складний кластерний імпульсний шум залишається обмеженою. Особливу увагу в розділі приділено специфіці імпульсного шуму типу SaP на медичних рентгенівських зображеннях та наслідкам його появи для діагностики. У другому розділі проведено глибокий аналіз базової моделі згорткової нейронної мережі SeConvNet. Виявлено її системні обмеження під час обробки медичних рентгенівських знімків, пошкоджених великими кластерними плямами SaP-шуму. Доведено, що через локальну природу SeConv-блоків та використання цільової функції мінімізації середньоквадратичної помилки (MSE) під час навчання, мережа втрачає глобальний контекст. Для великих зашумлених зон гіпотеза математичного «усереднення» дає меншу сумарну помилку, що неминуче спричиняє залишкові артефакти, втрату різкості анатомічних контурів та деградацію локальних контрастів. Для подолання цих критичних недоліків було розроблено та теоретично обґрунтовано модифіковану архітектуру SeConvNet + CBAM. Запропоновано стратегічну інтеграцію модуля канально-просторової уваги безпосередньо після операцій залишкового додавання у згорткових секціях мережі. Канальна увага фокусується на виділенні найбільш інформативних ознак через механізми глобального усереднення та максимізації, а просторова увага детально локалізує ці важливі області на площині. Це дозволило моделі адаптивно підсилювати релевантні структурні ознаки, відрізняючи корисний медичний сигнал від шуму. У третьому розділі детально розкрито інструментальні засоби, механізми реалізації та алгоритм роботи модифікованої моделі в умовах обмежених обчислювальних ресурсів. Описано формальну математичну модель запропонованої архітектури та поетапний процес відновлення зображень, що поєднує локальні й глобальні стратегії. На першому етапі відбувається первинне локальне заповнення пошкоджених пікселів каскадом із семи селективних згорток, розмір ядра яких поступово зростає від 3x3 до 15x15 пікселів. На другому етапі отримані карти ознак проходять через глибоку згорткову підсистему із прямими шунтувальними (залишковими) зв’язками для видобутку високорівневих ознак. На третьому етапі відбувається адаптивне зважування ознак за допомогою модулів уваги CBAM. Фінальний шар генерує залишкову корекцію, яка через жорстке маскування застосовується виключно до тих пікселів, що були початково пошкоджені, залишаючи чисті ділянки незмінними. У розділі також глибоко деталізовано специфіку процесу підготовки даних та навчання моделі. Навчальна вибірка формувалася шляхом масштабування, нарізки зображень на фрагменти та інтенсивного розширення даних у 8 разів за рахунок геометричних перетворень. Навчання оптимізовано за допомогою алгоритму Adam з поступовим зменшенням швидкості навчання. Проаналізовано вплив апаратних платформ (CPU, GPU, TPU) на ефективність тренування та розглянуто методи зниження витрат оперативної пам'яті (Gradient checkpointing, змішана точність). У четвертому розділі представлено результати експериментальних досліджень та здійснено ретельний порівняльний аналіз ефективності зменшення шуму оригінальної та модифікованої моделей. Тестування проводилося на наборі медичних даних NIH Chest X-rays із моделюванням екстремального рівня синтетичного SaP-шуму. Аналіз підтвердив покращення результатів: модифікована модель SeConvNet + CBAM забезпечила систематичне зростання середнього показника PSNR на 4.7%. На особливо критичних ділянках із сильною концентрацією кластерного шуму приріст PSNR сягав 5-8%. Візуальний аналіз відновлених фрагментів довів перевагу модифікованої моделі. Запропонована архітектура значно точніше відновлювала дрібні анатомічні структури, контури ребер та судинний малюнок, успішно мінімізуючи ефект зернистості та розмиття, що були притаманні оригінальній базовій мережі. Аналіз обчислювальної ефективності підтвердив практичну придатність розробленої моделі для роботи в клінічних умовах. Збільшення кількості параметрів та часу обробки одного зображення (з 0.42 с до 0.47 с на базовому процесорі CPU) є мінімальним і повністю виправдовується суттєвим підвищенням діагностичної якості медичних знімків. Наукова новизна отриманих результатів Вперше запропоновано метод підвищення ефективності відновлення зображень, пошкоджених імпульсним шумом, який відрізняється інтеграцією механізму канально-просторової уваги (CBAM) у структуру селективної згорткової мережі після залишкових зв’язків, що дозволяє адаптивно підсилювати важливі структурні ознаки та мінімізувати артефакти згладжування при відновленні кластерних шумових плям. Запропоновано модифіковану модель нейронної мережі SeConvNet, яка відрізняється спеціальним розміщенням блоків уваги для обробки сумарного сигналу прямого поширення та корекційної гілки, що дозволяє підвищити точність відновлення дрібних анатомічних деталей (зріст PSNR до 8% на складних ділянках) при збереженні обчислювальної ефективності для використання в ресурснообмежених середовищах. Практичне значення отриманих результатів полягає в покращенні якості медичних зображень: модифікована SeConvNet + CBAM дозволяє більш акуратно відновлювати дрібні анатомічні деталі при високій щільності SaP-шуму, що підвищує інформативність знімків для попереднього аналізу і візуальної інтерпретації. Невеликі апаратні вимоги що надає можливість запускати на не вимогливих засобах: додавання CBAM незначно збільшує кількість параметрів (в середньому на 5%), тож впровадження можливе навіть у системах з обмеженими ресурсами (клінічні робочі станції), а для більш продуктивного навчання передбачено перенесення на GPU-середовища. Вперше запропоновано модифіковану архітектуру SeConvNet + CBAM, яка поєднує селективні локальні SeConv-блоки з послідовним канально-просторовим механізмом уваги (CBAM), що дозволяє адаптивно підсилювати важливі канали й локалізувати інформативні області для ефективного придушення імпульсного SaPшуму без значного зростання обчислювальних витрат. Розроблено засоби підвищення достовірності діагностичних процедур на основі стратегічної інтеграції механізму уваги CBAM після операції резидуального додавання у згорткових секціях мережі. Таке архітектурне розміщення гарантує доступ маски уваги до комбінованого представлення - сумарного сигналу початкового шляху й корекційної гілки. В результаті в критичних тестах із кластерним шумом досягнуто приросту PSNR до 8%, що забезпечує помітне покращення візуальної якості та інформаційної цінності зображень. Отримані результати демонструють можливість точного відновлення медичних зображень із мінімізацією надмірного згладжування, що дозволяє зберегти важливі анатомічні деталі. Актуальність та наукова новизна результатів дослідження повною мірою підтверджується їх апробацією та публікацією у провідних фахових виданнях. Зокрема, базові концепції та засоби покращення якості візуальних даних висвітлено у журналі «Телекомунікаційні та інформаційні технології» (2023), де основну увагу було приділено особливостям знешумлення зображень за допомогою комплексного застосування згорткових і рекурентних нейронних мереж, що дозволило закласти фундамент для ефективного виявлення та усунення артефактів. Подальший розвиток та адаптація запропонованих алгоритмічних рішень відображені у виданні «Кібербезпека: освіта, наука, техніка» (2024). А також публікація в журналі «Проблеми інформатизації та управління» (2024), яка описує найбільш глибоко оптимізований варіант системи. Інтеграція в архітектуру залишкових зв’язків (residual connections) та спеціалізованого модулю уваги (attention module) дала змогу стабілізувати процес глибокого навчання мережі, змушуючи алгоритм прицільно фокусуватися на значущих структурних елементах зображення і максимально нівелювати вплив складних шумових завад.
dc.description.abstractotherLynovskyi A.O. Improving the Efficiency of Image Restoration Methods Based on a Modified Convolutional Neural Network Qualifying scientific work in manuscript form. Dissertation for the degree of Doctor of Philosophy in specialty 122 "Computer Sciences". - National Technical University of Ukraine "Igor Sikorsky Kyiv Polytechnic Institute", 2026. The object of the research is the process of denoising of medical images damaged by impulsive SaP-noise. In particular, convolutional neural networks and attention modules. The subject of the research is the methods and means of neural network denoising, in particular modifications of the SeConvNet architecture, as well as their influence on the quality of restoration (PSNR), computational costs, and stability to different levels of SaP-noise on real and synthetic data. In the first chapter, a comprehensive and complex analysis of existing methods for image restoration after noise distortions is carried out. The evolution of approaches is investigated, starting from classical methods of processing in the spatial domain (linear and nonlinear filters, in particular median filtering) and methods in the transform domain (wavelet transform, DCT). It is established that classical spatial filters are prone to excessive smoothing of contours and loss of fine details at a high density of impulse noise. Modern non-local algorithms, such as BM3D and NL-Means, provide higher quality and well restore repetitive textures, but their use is strictly limited by significant computational complexity. The application of machine and deep learning methods (CNN, RNN, GAN, diffusion probabilistic models, and transformers) for noise removal is analyzed in detail. Convolutional neural networks (for example, the DnCNN architecture) have demonstrated high efficiency for Gaussian noise, however, their ability to process complex cluster impulse noise remains limited. Special attention in the chapter is paid to the specifics of salt-and-pepper (SaP) impulse noise on medical X-ray images and the consequences of its appearance for diagnosis. In the second chapter, a deep analysis of the base model of the convolutional neural network SeConvNet is conducted. Its systemic limitations during the processing of medical X-ray images damaged by large cluster spots of SaP noise are revealed. It is proven that due to the local nature of SeConv blocks and the use of the objective function of mean squared error (MSE) minimization during training, the network loses global context. For large noisy zones, the mathematical "averaging" hypothesis gives a smaller total error, which inevitably causes residual artifacts, loss of sharpness of anatomical contours, and degradation of local contrasts. To overcome these critical shortcomings, a modified SeConvNet + CBAM architecture was developed and theoretically substantiated. The strategic integration of the channel-spatial attention module (CBAM) directly after the residual addition operations in the convolutional sections of the network is proposed. Channel attention focuses on extracting the most informative features through global averaging and maximization mechanisms, and spatial attention details and localizes these important areas on the plane. This allowed the model to adaptively amplify relevant structural features, distinguishing the useful medical signal from noise. The third chapter details the instrumental tools, implementation mechanisms, and operation algorithm of the modified model under conditions of limited computational resources. The formal mathematical model of the proposed architecture and the step-bystep process of image restoration, which combines local and global strategies, are described. At the first stage, the primary local filling of damaged pixels is performed by a cascade of seven selective convolutions, the kernel size of which gradually increases from 3x3 to 15x15 pixels. At the second stage, the obtained feature maps pass through a deep convolutional subsystem with direct shunt (residual) connections to extract highlevel features. At the third stage, adaptive weighting of features occurs using CBAM attention modules. The final layer generates a residual correction, which, through rigid masking, is applied exclusively to those pixels that were initially damaged, leaving clean areas unchanged. The chapter also deeply details the specifics of the data preparation and model training process. The training sample was formed by scaling, slicing images into patches, and intensively augmenting the data by 8 times through geometric transformations. Training is optimized using the Adam algorithm with a gradual learning rate decrease. The influence of hardware platforms (CPU, GPU, TPU) on training efficiency is analyzed, and methods for reducing RAM consumption (Gradient checkpointing, mixed precision) are considered. The fourth chapter presents the results of experimental research and carries out a thorough comparative analysis of the noise reduction efficiency of the original and modified models. Testing was conducted on the NIH Chest X-rays medical dataset with the simulation of an extreme level of synthetic SaP noise. The analysis confirmed the improvement of the results: the modified SeConvNet + CBAM model provided a systematic increase in the average PSNR index by 4.7%. In particularly critical areas with a strong concentration of cluster noise, the PSNR increase reached 5-8%. Visual analysis of the restored fragments proved the superiority of the modified model. The proposed architecture restored small anatomical structures, contours of ribs, and vascular patterns much more accurately, successfully minimizing the graininess and blurring effects inherent in the original base network. The analysis of computational efficiency confirmed the practical suitability of the developed model for work in clinical settings. The increase in the number of parameters and the processing time of one image (from 0.42 s to 0.47 s on a base CPU) is minimal and is fully justified by a significant increase in the diagnostic quality of medical images. Scientific novelty of the obtained results. For the first time, a method for increasing the efficiency of restoration of images damaged by impulse noise is proposed, which differs by the integration of the channel-spatial attention mechanism (CBAM) into the structure of a selective convolutional network after residual connections, which allows adaptively amplifying important structural features and minimizing smoothing artifacts when restoring cluster noise spots. A modified neural network model SeConvNet is proposed, which differs by a special placement of attention blocks for processing the combined forward propagation signal and the correction branch, which allows increasing the accuracy of restoring small anatomical details (PSNR increase up to 8% in complex areas) while maintaining computational efficiency for use in resource-constrained environments. The practical value of the obtained results lies in the improvement of the quality of medical images: the modified SeConvNet + CBAM allows restoring small anatomical details more accurately at a high density of SaP noise, which increases the informativeness of images for preliminary analysis and visual interpretation. Low hardware requirements, which provides the ability to run on undemanding devices: the addition of CBAM slightly increases the number of parameters (on average by 5%), so implementation is possible even in systems with limited resources (clinical workstations), and for more productive training, transferring to GPU environments is provided. For the first time, a modified SeConvNet + CBAM architecture is proposed, which combines selective local SeConv blocks with a sequential channel-spatial attention mechanism (CBAM), which allows adaptively amplifying important channels and localizing informative areas for effective suppression of impulse SaP noise without a significant increase in computational costs. The approach to selective filtering of impulse noise is improved through the strategic integration of the CBAM attention mechanism after the residual addition operation in the convolutional sections of the network. Such an architectural placement guarantees the access of the attention mask to the combined representation - the sum signal of the initial path and the correction branch. This allows forming a highly accurate context-dependent mask, which more effectively minimizes the excessive smoothing typical for SaP-oriented networks, and ensures the preservation of high-frequency anatomical details. In particular, in critical test scenarios with cluster noise, a PSNR increase of up to 8% is achieved. The relevance and scientific novelty of the research results are fully confirmed by their validation and publication in leading peer-reviewed journals. Specifically, the fundamental concepts and methods for enhancing visual data quality are detailed in the journal Telecommunication and Information Technologies (2023), where the primary focus was on the specifics of image denoising through the combined application of convolutional and recurrent neural networks, establishing the foundation for effective artifact detection and removal. Further development and adaptation of the proposed algorithmic solutions are reflected in the journal Cybersecurity: Education, Science, Technique (2024). As well as the publication in the journal Problems of Informatization and Management (2024), which describes the most highly optimized iteration of the system. The integration of residual connections and a specialized attention module into the architecture stabilized the network's deep learning process, forcing the algorithm to focus specifically on significant structural elements of the image and maximally neutralize the impact of complex noise interference.
dc.format.extent117 с.
dc.identifier.citationЛиновський, А. О. Підвищення ефективності методів відновлення зображень на основі модифікованої згорткової мережі : дис. … д-ра філософії : 122 Комп’ютерні науки / Линовський Андрій Олексійович. – Київ, 2026. – 117 с.
dc.identifier.urihttps://ela.kpi.ua/handle/123456789/82767
dc.language.isouk
dc.publisherКПІ ім. Ігоря Сікорського
dc.publisher.placeКиїв
dc.subjectзгорткові нейронні мережі
dc.subjectрекурентні нейронні мережі
dc.subjectrnn
dc.subjectзалишкова нейронна мережа
dc.subjectнелокальні операції
dc.subjectімпульсний шум «сіль і перець»
dc.subjectштучний інтелект
dc.subjectмашинне навчання
dc.subjectconvolutional neural networks
dc.subjectrecurrent neural networks
dc.subjectresidual neural network
dc.subjectnonlocal operations
dc.subjectsalt-and-pepper impulse noise
dc.subjectartificial intelligence
dc.subjectmachine learning
dc.subject.udc004.932:004.852
dc.titleПідвищення ефективності методів відновлення зображень на основі модифікованої згорткової мережі
dc.title.alternativeImproving the Efficiency of Image Restoration Methods Based on a Modified Convolutional Neural Network
dc.typeThesis Doctoral

Файли

Контейнер файлів
Зараз показуємо 1 - 1 з 1
Вантажиться...
Ескіз
Назва:
Lynovskyi_dys.pdf
Розмір:
4 MB
Формат:
Adobe Portable Document Format
Ліцензійна угода
Зараз показуємо 1 - 1 з 1
Ескіз недоступний
Назва:
license.txt
Розмір:
8.98 KB
Формат:
Item-specific license agreed upon to submission
Опис: