Програмний модуль класифікації архітектурних елементів за зображенням

Loading...
Thumbnail Image

Date

Journal Title

Journal ISSN

Volume Title

Publisher

Тернопіль, ЗУНУ

Abstract

Метою роботи є розроблення та експериментальне оцінювання програмного модуля багатокласової класифікації архітектурних елементів за зображеннями із застосуванням згорткових нейронних мереж і перенесення навчання, а також забезпечення інтерпретованості результатів за допомогою Grad-CAM. Методами дослідження та розроблення обрано аналіз сучасних підходів комп’ютерного зору, проєктування архітектури програмного модуля, експериментальне моделювання з порівнянням сценаріїв навчання (базова CNN, VGG16 із замороженою базою, VGG16 з тонким налаштуванням), а також оцінювання якості за метриками accuracy, precision, recall, F1-score і аналізом матриці плутанини. У результаті виконання роботи реалізовано програмний модуль на Python із використанням TensorFlow/Keras та проведено порівняльні експерименти. Показано, що тонке налаштування VGG16 для входу 128×128 забезпечує найкращу точність на валідації 91,54% та приріст відносно базової CNN (81,45%) на +10,09 відсоткових пунктів. На тестовому наборі фінальна модель VGG16 finetune досягла accuracy 91,17% (loss 0,2793), macro-precision 0,89, macro-recall 0,91 та macro-F1 0,90, що свідчить про збалансовану якість розпізнавання; базова CNN демонструє нижчі показники (accuracy 68,09%, macro-F1 0,68). Аналіз GradCAM підтвердив фокус моделі на морфологічно значущих фрагментах архітектурних елементів, що підвищує інтерпретованість прогнозів і придатність модуля для прикладного використання. Результати роботи можуть бути використані під час цифрової інвентаризації та каталогізації об’єктів культурної спадщини, а також як складова програмних засобів візуальної аналітики (інференс із поясненням рішення моделі). The purpose of the work is to develop and experimentally evaluate a software module for multi-class image-based classification of architectural elements using convolutional neural networks and transfer learning, and to ensure interpretability of predictions using Grad-CAM. The research and development methods include analysis of modern computer vision approaches, software module architecture design, experimental modeling with comparison of training scenarios (baseline CNN, VGG16 with frozen base, VGG16 fine-tuning), and performance evaluation using accuracy, precision, recall, F1-score metrics and confusion matrix analysis. As a result, a Python-based module using TensorFlow/Keras was implemented and comparative experiments were conducted. It was shown that VGG16 fine-tuning for 128×128 input provides the best validation accuracy of 91.54% and improves over the baseline CNN (81.45%) by +10.09 percentage points. On the test set, the final VGG16 fine-tune model achieved 91.17% accuracy (loss 0.2793) with macro-precision 0.89, macro-recall 0.91 and macro-F1 0.90, while the baseline CNN yields lower results (accuracy 68.09%, macro-F1 0.68). Grad-CAM analysis confirms that the model focuses on morphologically relevant image regions, increasing interpretability and supporting practical use of the module. The results can be applied to digital inventory and cataloging of cultural heritage objects, as well as to visual analytics pipelines with explainable inference.

Description

Citation

Патраманська, А. В. Програмний модуль класифікації архітектурних елементів за зображенням = Software Module for Architectural Element Classification : кваліфікаційна робота : спец. 122 – комп’ютерні науки ; освітньо-професійна програма – комп’ютерні науки / Анастасія Василівна Патраманська ; наук. керівник д.т.н., доц. Х. В. Ліп’яніна-Гончаренко. Тернопіль : ЗУНУ, 2026. 56 с.

Endorsement

Review

Supplemented By

Referenced By