Модифицированная архитектура DeepLabV3+ с интеграцией глобального контекста и контрастивного обучения с учителем для семантической сегментации изображений сверхвысокого разрешения
https://doi.org/10.37661/1/1816-0301-2026-23-3-7-23
Аннотация
Цели. Целью исследования является разработка современного метода семантической сегментации видеокадров сверхвысокого разрешения (4К) в области задач дистанционного зондирования Земли (ДЗЗ) с помощью модификации сверточной нейронной сети DeepLabV3+.
Методы. Метод направлен на решение двух критических проблем: ограниченности рецептивного поля модели при работе с локальными фрагментами изображения в силу больших затрат видеопамяти графических процессоров и некачественного разделения классов со схожими цветовыми характеристиками и текстурой. Базовая архитектура была дополнена двумя модулями механизма внимания для улучшения локализации объектов, а стандартная функция потерь cross entropy алгоритмом контрастивного обучения с учителем (Supervised Contrastive Learning, SupCon) для лучшего разделения схожих классов. В Atrous Spatial Pyramid Pooling (ASPP)-модуль была встроена линейная модуляция (Feature-wise Linear Modulation, FiLM) для внедрения глобального контекста в виде признаков, полученных из исходного изображения.
Результаты. Результаты проведенных экспериментов показали, что предложенный подход успешно справляется с минимизацией артефактов на границах классов, обладает высокой способностью различать визуально схожие классы, а также повышает точность сегментации в условиях специфического набора данных. Предложенная архитектура превосходит базовую по метрике mean Intersection over Union на 0,45 %.
Заключение. Разработанная модификация DeepLabV3+ позволяет эффективно решать задачи семантической сегментации изображений сверхвысокого разрешения в области ДЗЗ, обеспечивая высокую точность при незначительном увеличении вычислительной сложности.
Об авторах
А. А. КозловБеларусь
Козлов Анатолий Анатольевич , аспирант кафедры веб-технологий и компьютерного моделирования
пр. Независимости, 4, Минск, 220030
С. В. Абламейко
Беларусь
Абламейко Сергей Владимирович , доктор технических наук, академик Национальной академии наук Республики Беларусь, профессор кафедры веб-технологий и компьютерного моделирования
пр. Независимости, 4, Минск, 220030
Список литературы
1. Цзян, Ч. Выявление структуры землепользования в зоне влияния Солигорского калийного комбината по данным дистанционного зондирования / Ч. Цзян, А. Н. Червань // Природопользование. – 2025. –№ 1. – С. 51–63.
2. Roche, C. Mine tailings storage: Safety is no accident / C. Roche, K. Thygesen, E. Baker // Rapid Response Assessment / United Nations Environment Programme, GRID-Arendal. – Arendal, 2017. – P. 6–10.
3. The 2019 Brumadinho tailings dam collapse: Possible cause and impacts of the worst human and environmental disaster in Brazil / L. H. S. Rotta, E. Alcântara, E. Park [et al.] // International Journal of Applied Earth Observation and Geoinformation. – 2020. – Vol. 90. – Art. 102119. – URL: https://www.sciencedirect.com/science/article/pii/S0303243420300192?via%3Dihub (date of access: 16.03.2026). – https://doi.org/10.1016/j.jag.2020.102119.
4. Santamarina, J. C. Why coal ash and tailings dam disasters occur / J. C. Santamarina, L. A. Torres-Cruz, R. C. Bachus // Science. – 2019. – Vol. 364, iss. 6440. – P. 526–528. – https://doi.org/10.1126/science.aax1927.
5. Mining and tailings dam detection in satellite imagery using deep learning / R. Balaniuk, O. Isupova, S. Reece // Sensors. – 2020. – Vol. 20, no. 23. – Art. 6936. – URL: https://www.mdpi.com/1424-8220/20/23/6936 (date of access: 16.03.2026). – https://doi.org/10.3390/s20236936.
6. Стельмах, В. И. Экологические проблемы добычи калийных солей и некоторые пути их преодоления / В. И. Стельмах // Обеспечение экономической безопасности Республики Беларусь: теория и практика : материалы Респ. науч.-практ. конф., Минск, 19 дек. 2019 г. / Акад. М-ва внутр. дел Респ. Беларусь. – Мн., 2019. – С. 103–105.
7. Fully convolutional networks for semantic segmentation / J. Long, E. Shelhamer, T. Darrell // Proc. of the IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), Boston, Massachusetts, USA, 7–12 June 2015. – Boston, 2015. – P. 3431–3440. – https://doi.org/10.1109/CVPR.2015.7298965.
8. Ronneberger, O. U-Net: Convolutional networks for biomedical image segmentation / O. Ronneberger, P. Fischer, T. Brox // Medical Image Computing and Computer-Assisted Intervention – MICCAI 2015 : 18th Intern. Conf., Munich, 5–9 Oct. 2015 / ed.: N. Navab [et al.]. – Cham, 2015. – Pt. III. – P. 234–241. – (Lecture Notes in Computer Science ; vol. 9351). – https://doi.org/10.1007/978-3-319-24574-4_28.
9. Pyramid scene parsing network / H. Zhao, J. Shi, X. Qi [et al.] // Proc. of the IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), Honolulu, Hawaii, USA, 21–26 July 2017. – Honolulu, 2017. – P. 2881–2890. – https://doi.org/10.1109/CVPR.2017.660.
10. Encoder-decoder with atrous separable convolution for semantic image segmentation / L. C. Chen, Y. Zhu, G. Papandreou [et al.] // Proc. of the European Conf. on Computer Vision (ECCV), Munich, Germany, 8–14 Sept. 2018. – Munich, 2018. – P. 801–818. – https://doi.org/10.1007/978-3-030-01234-2_49.
11. DeepLab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected CRFs / L. C. Chen, G. Papandreou, I. Kokkinos [et al.] // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2018. – Vol. 40, iss. 4. – P. 834–848. – https://doi.org/10.1109/TPAMI.2017.2699184.
12. Rethinking atrous convolution for semantic image segmentation / L.-C. Chen, G. Papandreou, F. Schroff, H. Adam. – 2017. – URL: https://arxiv.org/pdf/1706.05587 (date of access: 16.03.2026). – https://doi.org/10.48550/arXiv.1706.05587.
13. Encoder-decoder with atrous separable convolution for semantic image segmentation / L. C. Chen, Y. Zhu, G. Papandreou [et al.] // Proc. of the European Conf. on Computer Vision (ECCV), Munich, Germany, 8–14 Sept. 2018. – Munich, 2018. – P. 801–818. – https://doi.org/10.1007/978-3-030-01234-2_49.
14. An image is worth 16x16 words: Transformers for image recognition at scale / A. Dosovitskiy, L. Beyer, A. Kolesnikov [et al.] // Intern. Conf. on Learning Representations (ICLR), Vienna, Austria, 4 May 2021. – Vienna, 2021. – P. 1–21. – https://doi.org/10.48550/arXiv.2010.11929.
15. Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers / S. Zheng, J. Lu, H. Zhao [et al.] // Proc. of the IEEE/CVF Conf. on Computer Vision and Pattern Recognition (CVPR), Nashville, TN, USA, 20–25 June 2021. – Nashville, 2021. – P. 6881–6890. – https://doi.org/10.1109/CVPR46437.2021.00681.
16. Attention mechanisms in semantic segmentation of remote sensing images / V. V. Godase, S. Takale, R. Ghodake, A. Mulani // Journal of Advancement in Electronics Signal Processing. – 2025. – Vol. 2. – P. 45–58.
17. Hu, J. Squeeze-and-excitation networks / J. Hu, L. Shen, G. Sun // Proc. of the IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), Salt Lake City, UT, USA, 18–22 June 2018. – Salt Lake City, 2018. – P. 7132–7141. – https://doi.org/10.1109/CVPR.2018.00745.
18. CBAM: Convolutional block attention module / S. Woo, J. Park, J. Y. Lee, I. S. Kweon // Proc. of the European Conf. on Computer Vision (ECCV), Munich, Germany, 8–14 Sept. 2018. – Munich, 2018. – P. 3–19. – https://doi.org/10.1007/978-3-030-01234-2_1.
19. Hou, Q. Coordinate attention for efficient mobile network design / Q. Hou, D. Zhou, J. Feng // Proc. of the IEEE/CVF Conf. on Computer Vision and Pattern Recognition (CVPR), Nashville, TN, USA, 20–25 June 2021. – Nashville, 2021. – P. 13713–13722. – https://doi.org/10.1109/CVPR46437.2021.01350.
20. Big self-supervised models are strong semi-supervised learners / T. Chen, S. Kornblith, K. Swersky [et al.] // Advances in Neural Information Processing Systems (NeurIPS). – 2020. – Vol. 33. – P. 20735–20747. – https://doi.org/10.48550/arXiv.2006.10029.
21. A comprehensive survey on contrastive learning / H. Hu, X. Wang, Y. Zhang [et al.] // Neurocomputing. – 2024. – Vol. 610. – Art. 128645. – URL: https://www.sciencedirect.com/science/article/abs/pii/S0925231224014164?via%3Dihub (date of access: 16.03.2026). – https://doi.org/10.1016/j.neucom.2024.128645.
22. Supervised contrastive learning / P. Khosla, P. Teterwak, C. Wang [et al.] // Advances in Neural Information Processing Systems (NeurIPS). – 2020. – Vol. 33. – P. 18661–18673. – https://doi.org/10.48550/arXiv.2004.11362.
23. Deep residual learning for image recognition / K. He, X. Zhang, S. Ren, J. Sun // Proc. of the IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 27–30 June 2016. – Las Vegas, 2016. – P. 770–778. – https://doi.org/10.1109/CVPR.2016.90.
24. Comparative analysis of deep learning architectures for medical image classification / P.-N. Bui, D.-T. Le, J. Bum [et al.] // Bioengineering. – 2023. – Vol. 10, iss. 10. – Art. 1249. – URL: https://pmc.ncbi.nlm.nih.gov/articles/PMC10669434/ (date of access: 16.03.2026). – https://doi.org/10.3390/bioengineering10101249.
25. Kansal, K. ResNet-based deep learning approaches for histopathological breast cancer classification / K. Kansal, A. Singh, D. Srivastava, K. Kansal // 2025 Intern. Conf. on Artificial Intelligence and Emerging Technologies (ICAIET), Bhubaneswar, Odisha, India, 28–30 Aug. 2025. – Bhubaneswar, 2025. – P. 1–4. – https://doi.org/10.1109/ICAIET.2025.11210953.
26. Kordemir, M. A mask R-CNN approach for detection and classification of brain tumours from MR images / M. Kordemir, K. K. Cevik, A. Bozkurt // Computer Methods in Biomechanics and Biomedical Engineering: Imaging & Visualization. – 2024. – Vol. 11, iss. 7. – URL: https://www.tandfonline.com/doi/full/10.1080/21681163.2023.2301391 (date of access: 16.03.2026). – https://doi.org/10.1080/21681163.2023.2301391.
27. A comparative analysis of attention mechanisms in 3D CNN-based hyperspectral image super-resolution / M. S. Zitouni, M. Q. Alkhatib, N. Aburaed, H. Ahmad // 2024 14th Workshop on Hyperspectral Imaging and Signal Processing: Evolution in Remote Sensing (WHISPERS), Helsinki, Finland, 09–11 Dec. 2024. – Helsinki, 2024. – P. 1–5. – https://doi.org/10.1109/WHISPERS.2024.10876507.
28. A new semantic segmentation method for remote sensing images integrating coordinate attention and SPD-Conv / Z. Yang, Q. Wu, F. Zhang [et al.] // Symmetry. – 2023. – Vol. 15, iss. 5. – Art. 1037. – URL: https://www.mdpi.com/2073-8994/15/5/1037 (date of access: 16.03.2026). – https://doi.org/10.3390/sym15051037.
29. Li, Z. A comparative study of Contrastive Self-Supervised Learning (CSSL): Methods, technologies, and applications / Z. Li // Transactions on Computer Science and Intelligent Systems Research. – 2025. – Vol. 10. – P. 92–97. – https://doi.org/10.62051/2hgr2j26.
30. Wang, Y. Multi-label guided supervised contrastive learning for earth observation pretraining / Y. Wang, C. M. Albrecht, X. X. Zhu // 2024 IEEE Intern. Geoscience and Remote Sensing Symp. (IGARSS), Athens, Greece, 7–12 July 2024. – Athens, 2024. – P. 7568–7571. – https://doi.org/10.1109/IGARSS53475.2024.10642289.
31. Searching for MobileNetV3 / A. Howard, M. Sandler, B. Chen [et al.] // Proc. of the IEEE/CVF Intern. Conf. on Computer Vision (ICCV), Seoul, Korea (South), 27 Oct. – 02 Nov. 2019. – Seoul, 2019. – P. 1314–1324. – https://doi.org/10.1109/ICCV.2019.00140.
32. FiLM: Visual reasoning with a general conditioning layer / E. Perez, F. Strub, H. de Vries [et al.] // Proc. of the AAAI Conf. on Artificial Intelligence, New Orleans, Louisiana, USA, 2–7 Febr. 2018. – New Orleans, 2018. – Vol. 32, iss. 1. – P. 3942–3951. – https://doi.org/10.1609/aaai.v32i1.11823.
Рецензия
Для цитирования:
Козлов А.А., Абламейко С.В. Модифицированная архитектура DeepLabV3+ с интеграцией глобального контекста и контрастивного обучения с учителем для семантической сегментации изображений сверхвысокого разрешения. Информатика. 2026;23(3):7-23. https://doi.org/10.37661/1/1816-0301-2026-23-3-7-23
For citation:
Kozlov A.A., Ablameyko S.V. Modified DeepLabV3+ architecture with global context integration and supervised contrastive learning for semantic segmentation of ultra-high-resolution image. Informatics. 2026;23(3):7-23. (In Russ.) https://doi.org/10.37661/1/1816-0301-2026-23-3-7-23
JATS XML

















