Mobile QR Code QR CODE

Journal of the Korea Concrete Institute

J Korea Inst. Struct. Maint. Insp.
  • Indexed by
  • Korea Citation Index (KCI)

  1. 정회원, 강원대학교 스마트인프라연구소 연구교수
  2. 정회원, 강원대학교 건설환경공학부 교수, 교신저자



Bounding box, CNN, Concrete damage, Grad-CAM, Spatial correspondence
경계 상자(Bounding box), 합성곱신경망(CNN), 콘크리트 손상, Grad-CAM, 공간 정합성

1. 서 론

콘크리트 구조물은 교량, 터널, 항만 등 주요 사회기반시설의 핵심 구성 요소로서, 장기 사용에 따라 균열(Crack), 백태(Efflorescence), 철근 노출(Rebar exposure) 등 다양한 형태의 손상이 발생한다. 이러한 손상은 구조물의 내구성과 안전성에 영향을 미칠 수 있으므로, 정기적인 점검과 신뢰성 있는 손상 평가가 필요하다. 그러나 기존 점검 방법은 주로 전문가의 육안 조사에 의존하고 있어 평가 결과의 주관성, 작업자의 숙련도에 따른 편차, 넓은 영역을 신속하고 일관되게 평가하기 어려운 한계가 있다(Asvitha and Ravi, 2023; Dorafshan et al., 2018; Roy et al., 2025).

최근에는 영상 기반 비파괴 평가 기술과 함께 딥러닝을 활용한 자동 손상 인식 연구가 활발히 수행되고 있다. 특히 합성곱신경망(convolutional neural networks(CNN))는 이미지의 공간적 특징을 효과적으로 학습할 수 있어 다양한 영상 분류 문제에서 높은 성능을 보이고 있으며, AlexNet의 제안 이후 대규모 이미지 분류 분야에서 그 가능성이 입증되었다(Krizhevsky et al., 2012). 이후 ResNet, GoogLeNet, MobileNet 계열 등 다양한 CNN 구조가 제안되었으며, 이들 모델은 성능 향상, 계산 복잡도 저감 및 모델 경량화를 목적으로 다양한 구조적 특성을 반영하고 있다(He et al., 2016; Howard et al., 2017; Szegedy et al., 2015).

최근에는 Vision Transformer, vision-language model 및 Segment Anything Model과 같은 foundation model의 발전에 따라 zero-shot 또는 prompt 기반 방식으로 구조물 손상을 인식하거나 분할하려는 연구도 수행되고 있다(Dosovitskiy et al., 2021; Ge et al., 2024; Kirillov et al., 2023; Radford et al., 2021). 한편, 대표 CNN 모델은 구조와 계산 복잡도가 다양하면서도 동일한 전이학습, 반복 학습 및 Grad-CAM 분석 절차를 적용할 수 있어, 분류 안정성과 판단 근거의 공간적 정합성을 통제된 조건에서 비교하기에 적합하다.

CNN 기반 모델은 콘크리트 구조물의 손상 인식 분야에도 널리 적용되어 왔으며, 기존 연구에서는 주로 모델 간 분류 성능 비교, 데이터 수에 따른 성능 변화, 하이퍼파라미터 설정의 영향 등이 분석되어 왔다(Kim et al., 2025a; Kim and Yang, 2026). 그러나 많은 연구가 단일 학습 결과 또는 평균 성능을 중심으로 모델을 평가하고 있어, 반복 학습에서 발생하는 성능 변동성과 안정성에 대한 검토는 상대적으로 부족하다. 딥러닝 모델은 초기 가중치, 데이터 셔플링 및 연산 과정의 확률적 요소에 따라 동일한 조건에서도 서로 다른 결과를 나타낼 수 있으므로, 평균 성능과 함께 반복 학습에 따른 변동성을 고려할 필요가 있다.

한편, 구조물 점검 분야에서 딥러닝 모델을 활용하기 위해서는 손상 유형을 정확히 분류하는 것뿐만 아니라, 모델이 실제 손상 위치를 근거로 판단하였는지를 확인하는 것이 중요하다. 이를 위해 딥러닝 모델의 의사결정 과정을 해석하는 방법으로 Grad-CAM(Gradient-weighted Class Activation Mapping)이 활용되고 있다. Grad-CAM은 특정 클래스 예측에 기여한 공간적 영역을 시각화함으로써 모델의 판단 근거를 직관적으로 확인할 수 있는 방법이다(Selvaraju et al., 2017). 기존 연구에서도 Grad-CAM을 활용한 시각적 검토가 수행되었으나, 많은 경우 대표 이미지 중심의 정성적 해석에 초점을 두었다(Kim et al., 2025b). 최근에는 설명 가능 인공지능(XAI)의 신뢰성과 정량 평가의 중요성이 강조되고 있으며, 재난위험관리 및 구조건전성 모니터링 분야에서도 모델 판단 근거의 투명성과 해석 신뢰성을 확보하기 위한 연구가 수행되고 있다(Cheng et al., 2025; Ghaffarian et al., 2023; Hu et al., 2024). 특히 높은 분류 성능을 보이는 모델이라도 손상 위치와 직접적으로 일치하지 않는 영역을 근거로 판단할 수 있으므로, 반복 학습에 따른 성능 변동성과 Grad-CAM 활성 영역의 공간적 정합성을 동일한 분석 체계에서 정량적으로 검토할 필요가 있다.

이에 본 연구에서는 콘크리트 구조물 손상 이미지 분류를 대상으로 ResNet-50, GoogLeNet 및 MobileNetV2의 분류 성능, 반복 학습 기반 안정성 및 Grad-CAM 기반 해석성을 통합적으로 분석하였다. 본 연구는 기존 CNN 기반 콘크리트 손상 분류 연구가 주로 분류 성능 비교 또는 단일 학습 결과를 중심으로 모델 성능을 평가한 것과 달리, random seed를 1–5로 적용한 5회 반복 학습을 통해 모델별 평균 성능과 변동성을 함께 검토하였다. 또한 기존 Grad-CAM 활용 연구가 대표 이미지 중심의 정성적 시각화에 초점을 둔 경우가 많았던 것과 달리, JSON annotation으로부터 추출한 bounding box 기반 참조 영역(reference region)과 Grad-CAM 활성 영역 간의 공간적 정합성을 IoU 및 CAM Precision으로 정량화하였다. 이를 통해 분류 성능뿐만 아니라 반복 학습 안정성, Grad-CAM 기반 공간 정합성 및 모델 복잡도를 함께 고려하는 CNN 기반 손상 분류 모델의 종합적 평가 관점을 제시하였다.

2. 분석 방법

2.1 사용 프로그램 및 분석 환경

본 연구의 모든 분석은 MATLAB R2025a 기반에서 수행되었으며, 콘크리트 구조물 손상 이미지의 분류와 Grad-CAM 기반 해석성 분석을 동일한 환경에서 수행하였다. 딥러닝 모델의 구성, 학습 및 평가에는 MATLAB Deep Learning Toolbox를 활용하였고, 데이터 입출력, 전처리 및 결과 분석은 MATLAB의 기본 기능을 기반으로 수행하였다.

모델 간 성능 비교의 신뢰성을 확보하기 위하여 모든 분석에서 동일한 소프트웨어 및 하드웨어 조건을 유지하였다. 분석에 사용된 하드웨어는 Intel i9 CPU, NVIDIA GPU, DDR5 RAM 및 SSD 저장 장치로 구성되었으며, 구체적인 사양은 Table 1에 정리하였다.

Table 1 Hardware specifications used in the analysis

PC parts

Specification

CPU

Intel Core i9-14900KF

RAM

DDR5 64GB (32GB×2)

GPU

NVIDIA RTX A5000 24GB

Storage

SSD 2TB

2.2 데이터셋 구성 및 전처리

본 연구에서는 AI-Hub에서 제공하는 콘크리트 구조물 손상 이미지 데이터를 활용하였다. 해당 데이터는 교량, 옹벽 및 건축물 등 다양한 실제 구조물을 대상으로 수집된 자료로, 조도 조건, 촬영 거리 및 표면 상태 등이 다양하게 포함되어 있어 실제 현장 환경을 일정 부분 반영하는 특징을 가진다.

다만 원시 데이터에는 손상과 직접적으로 관련되지 않은 배경 요소, 표면 오염 및 손상 여부가 불명확한 이미지가 포함되어 있다. 이러한 데이터는 학습 과정에서 노이즈로 작용하여 모델 성능 및 해석 결과의 신뢰도를 저하시킬 수 있다. 따라서 원시 데이터 중 콘크리트 손상으로 명확히 식별 가능한 이미지를 대상으로 연구자가 육안 검토를 통해 선별하여 데이터셋을 재구성하였다.

또한 Grad-CAM 결과의 정량적 검증을 위해 JSON 기반 annotation 파일로부터 bounding box 정보를 추출하고, 이를 이미지 경로 및 클래스 라벨 정보와 결합하여 CSV 형식의 데이터셋으로 변환하였다. 생성된 CSV 데이터셋은 각 이미지에 대해 파일 경로, 클래스 정보, 그리고 bounding box 좌표(x, y, width, height)를 포함하도록 구성하였다.

최종 분류 대상은 균열, 백태, 철근 노출의 세 가지 손상 유형으로 설정하였다. 데이터셋은 균열 3,000장, 백태 3,000장, 철근 노출 3,000장으로 구성되었으며, 총 9,000장의 이미지를 사용하였다.

구축된 데이터셋은 학습용 70%, 검증용 15%, 시험용 15%의 비율로 분할하였으며, 클래스별 분포가 유지되도록 계층적 무작위 분할을 적용하였다. 사용된 이미지의 예시는 Fig. 1에 나타내었다.

Fig. 1 Example images of concrete structural damage

../../Resources/ksm/jksmi.2026.30.4.126/fig1.png

2.3 CNN 모델 구성

본 연구에서는 구조적 특성과 모델 복잡도가 서로 다른 세 가지 CNN 모델을 선정하여 성능을 비교하였다. 적용된 모델은 ResNet-50, GoogLeNet, MobileNetV2이며, 모두 ImageNet 데이터셋으로 사전 학습된 가중치를 기반으로 구성된 대표적인 이미지 분류 모델이다.

각 모델은 서로 다른 구조적 특징과 계산 복잡도를 가진다. ResNet-50은 잔차 연결(residual connection)을 통해 깊은 네트워크에서도 안정적인 학습이 가능하도록 설계된 구조를 가지며, 높은 표현 능력을 갖는 대신 상대적으로 많은 파라미터 수와 연산량을 요구한다. GoogLeNet은 Inception 모듈을 활용하여 다양한 크기의 특징을 병렬적으로 추출하는 multi-scale 구조를 기반으로 하며, 중간 수준의 모델 복잡도를 가진다. MobileNetV2는 depthwise separable convolution과 inverted residual 구조를 적용한 경량 모델로, 파라미터 수와 연산량을 크게 줄이면서도 효율적인 특징 추출이 가능하다(Sandler et al., 2018).

이러한 모델 간 차이는 Table 2에 제시된 파라미터 수와 FLOPs를 통해 확인할 수 있다. 파라미터 수는 모델이 학습해야 하는 가중치의 총 개수를 의미하며, 모델의 규모와 표현 능력을 나타낸다. FLOPs는 모델이 수행하는 부동소수점 연산의 총량으로 계산 복잡도를 나타내는 지표이다. 일반적으로 두 값이 증가할수록 표현 능력은 향상될 수 있으나, 계산 비용과 추론 시간 또한 증가하는 경향을 보인다. 따라서 본 연구에서는 분류 성능과 함께 파라미터 수 및 FLOPs를 기반으로 모델의 구조적 계산 복잡도를 보조적으로 비교하였다.

모든 모델은 전이 학습(transfer learning) 기반으로 구성하였다. 사전 학습된 네트워크의 최종 분류 계층을 제거한 후, 본 연구의 세 가지 손상 클래스에 맞는 새로운 분류 계층을 추가하였다. 이후 전체 계층에 대해 fine-tuning을 수행하여 콘크리트 손상 이미지의 특성을 반영한 특징을 학습하도록 하였다.

Table 2 Summary of CNN model architectures

Model

Parameters (M)

FLOPs (G)

Characteristics

ResNet-50

25.6

4.1

Heavy/ High-capacity

GoogLeNet

7.0

1.5

Medium/ Multi-scale

MobileNetV2

3.4

0.3

Lightweight/ Efficient

2.4 데이터 증강 및 입력 이미지 전처리

모델의 일반화 성능을 향상시키기 위하여 학습 데이터에 한해 데이터 증강을 적용하였다. 데이터 증강에는 좌우 반전, 회전 및 이동 변환이 포함되었으며, 회전 범위는 ±10°, 수평 및 수직 이동 범위는 각각 ±10 pixels로 설정하였다.

이미지 해상도 및 종횡비 차이에 따른 영향을 최소화하기 위하여 분석에 사용한 입력 이미지는 사전 전처리 과정에서 padding을 적용하여 640×640 pixels의 정방형 이미지로 구성하였다. 이후 학습 단계에서는 각 CNN 모델의 입력 크기에 맞추어 224×224 pixels로 리사이즈하여 사용하였다.

검증 및 시험 데이터에는 데이터 증강을 적용하지 않았으며, 동일한 전처리 과정만 수행하여 모델 성능을 객관적으로 평가할 수 있도록 하였다.

2.5 하이퍼파라미터 설정

모델 간 비교의 공정성을 확보하기 위하여 모든 CNN 모델에 동일한 학습 조건을 적용하였다. 학습은 SGDM(Stochastic Gradient Descent with Momentum)을 기반으로 수행하였으며, 초기 학습률은 0.0001로 설정하였다. SGDM의 momentum은 MATLAB의 기본값인 0.9를 적용하였다. 에포크 수는 15, 배치 크기는 32로 설정하였으며, 과적합 방지를 위해 L2 정규화 계수는 0.0001을 적용하였다. 모든 조건에 동일한 하이퍼파라미터를 적용함으로써 모델 구조에 따른 성능 차이를 공정하게 비교하고자 하였다.

2.6 반복 학습 기반 실험 설계

딥러닝 모델은 초기 가중치 설정, 데이터 셔플링 및 연산 과정에서의 확률적 요소에 의해 동일 조건에서도 성능 차이가 발생할 수 있다. 이에 본 연구에서는 모델 성능을 보다 신뢰성 있게 평가하기 위하여 반복 학습 기반 실험을 수행하였다.

각 모델에 대해 random seed를 1–5로 변경하여 총 5회의 반복 학습을 수행하였다. 각 반복에서는 학습용 70%, 검증용 15%, 시험용 15%의 동일한 분할 비율을 유지하되, seed에 따라 클래스별 계층적 무작위 분할을 수행하여 데이터셋을 구성하였다. 동일한 반복 번호에서는 세 모델에 동일한 seed를 적용하여 모델 간 비교 조건의 일관성을 유지하였다. 각 반복 실험에서는 분류 성능 및 Grad-CAM 기반 해석성 지표를 산출하였으며, 이후 평균값과 표준편차를 계산하여 성능의 대표성과 변동성을 함께 평가하였다.

2.7 Grad-CAM 기반 해석성 분석

CNN 모델의 분류 결과에 대한 해석성을 확보하기 위하여 Grad-CAM 기법을 적용하였다. Grad-CAM은 특정 클래스 예측에 기여한 convolutional feature를 활용하여 모델이 주목한 영역을 시각화하는 방법이다(Selvaraju et al., 2017).

각 모델에서 마지막 convolutional feature layer를 기준으로 Grad-CAM score map을 생성하고, 이를 최소-최대 정규화를 통해 0과 1 사이로 변환하였다. 이후 임계값 0.60을 적용하여 활성 영역을 이진화하였다. Ullmann and Schür(2025)은 설명 맵 기반 결함 위치 분석에서 최대 활성값의 60%를 임계값으로 적용하였다. 이를 참고하여 본 연구에서도 모든 모델에 동일한 임계값 0.60을 적용하였다. 다만 해당 값은 일반화된 최적 임계값이 아니며, 임계값에 따라 IoU와 CAM Precision이 달라질 수 있으므로 본 연구 결과는 임계값 0.60 조건에서의 모델 간 상대 비교 결과로 해석하였다.

본 연구에서는 Grad-CAM 결과를 단순 시각화로 검토하는 데 그치지 않고, JSON annotation에서 추출한 bounding box 정보를 참조 영역으로 활용하여 모델 활성 영역의 공간적 정합성을 정량화하였다. 참조 영역은 CSV 파일에 포함된 bounding box 정보를 이용하여 생성하였으며, 입력 이미지 크기에 맞게 좌표를 조정하였다. 하나의 이미지에 여러 개의 bounding box가 존재하는 경우 이를 모두 포함하여 참조 영역을 구성하였다.

본 연구에서 bounding box를 적용한 목적은 균열의 폭이나 경계를 정밀하게 검출하기 위한 것이 아니라, CNN 분류 모델의 Grad-CAM 활성 영역이 annotation에 표시된 손상 위치와 공간적으로 대응하는지를 평가하기 위한 것이다. 또한 AI-Hub JSON annotation에서 균열, 백태 및 철근 노출에 공통으로 제공되는 bounding box를 이용하여 세 손상 유형에 동일한 참조 영역 생성 및 평가 절차를 적용하였다. 다만 bounding box는 손상 영역의 픽셀 단위 경계를 나타내는 segmentation mask가 아니라 실제 손상 부위와 주변 배경을 일부 포함하는 사각형 참조 영역이므로, 본 연구의 IoU와 CAM Precision은 정밀한 위치 검출 성능이 아니라 bounding box 기반 참조 영역과 Grad-CAM 활성 영역 간의 근사적 공간 정합성을 나타내는 상대적 비교 지표로 해석하였다.

2.8 성능 평가 지표

본 연구에서는 CNN 모델의 분류 성능과 Grad-CAM 기반 해석성을 함께 평가하기 위하여 다양한 정량적 지표를 적용하였다. 분류 성능 평가는 Macro F1-score를 기준으로 수행하였다. Macro F1-score는 클래스별 성능을 균형 있게 반영하는 지표이다.

Grad-CAM 기반 해석성 평가는 IoU(Intersection over Union)와 CAM Precision을 활용하였다. IoU는 활성 영역과 참조 영역 간의 중첩 정도를 나타내며, CAM Precision은 활성 영역 중 참조 영역 내부에 포함되는 비율을 의미한다. 여기서 참조 영역은 bounding box를 기반으로 실제 손상 위치를 포함하도록 구성한 영역이며, 활성 영역은 Grad-CAM을 통해 도출된 모델의 주목 영역을 의미한다. 본 연구에서는 두 영역 간의 공간적 정합성을 기반으로 Grad-CAM 해석성을 평가하였다. IoU와 CAM Precision은 각각 식 (1)식 (2)와 같이 정의하였다.

(1)
$IoU = \dfrac{|A \cap B|}{|A \cup B|}$
(2)
$CAM\ Precision = \dfrac{|A \cap B|}{|A|}$

여기서 A는 Grad-CAM 기반 활성 영역, B는 bounding box 기반 참조 영역이다. IoU는 활성 영역과 참조 영역 간의 전체적인 공간적 정합성을 평가하며, CAM Precision은 Grad-CAM 활성 영역 중 bounding box 기반 참조 영역 내부에 포함되는 비율을 나타낸다.

또한 각 이미지에 대해 모델의 softmax 예측 신뢰도(confidence)를 분석하였다. 예측 신뢰도는 모델의 softmax score 중 최댓값으로 정의하였으며, 0과 1 사이의 값을 가진다. 반복 학습 결과를 기반으로 각 지표의 평균값과 표준편차를 산출하여 성능과 안정성을 종합적으로 평가하였다. 전체 분석 조건은 Table 3에 정리하였다.

Table 3 Summary of experimental conditions

Item

Value

Classes

Crack, Efflorescence, Rebar exposure

Dataset

9,000 images (3,000 per class)

Models

ResNet-50, GoogLeNet, MobileNetV2

Input size

224 × 224 pixels

Initial learning rate

0.0001

Optimizer

SGDM

Momentum

0.9

Epochs

15

Mini-batch size

32

Repeated training

5 runs

Random seed

1-5

Grad-CAM threshold

0.60

Evaluation metrics

Macro F1-score, IoU, CAM Precision, Confidence

3. 결과 및 분석

3.1 CNN 모델의 분류 성능 및 안정성 분석

본 연구에서는 ResNet-50, GoogLeNet, MobileNetV2의 분류 성능과 반복 학습 기반 안정성을 분석하였다. 각 모델에 대해 동일한 학습 조건을 적용하고, random seed를 1–5로 변경하여 5회의 반복 학습을 수행하였다. 각 반복에서는 동일한 분할 비율에 따라 시험 데이터를 구성하였으며, 시험 데이터 기준 Macro F1-score의 평균, 표준편차, 최소값 및 최대값을 산출하였다. 결과는 Table 4에 정리하였다.

분석 결과, ResNet-50은 평균 Macro F1-score 0.9540으로 세 모델 중 가장 높은 값을 나타냈으며, 표준편차는 0.0062로 가장 낮았다. MobileNetV2는 평균 0.9523으로 ResNet-50과의 차이가 0.0017에 불과하여 매우 유사한 수준의 분류 성능을 보였다. 반면 GoogLeNet은 평균 0.9495로 세 모델 중 가장 낮은 값을 나타냈으며, 최소값과 최대값의 범위가 상대적으로 크게 나타났다.

한편 MobileNetV2는 표준편차가 0.0075로 가장 크게 나타났으나, 모든 반복에서 0.94 이상의 높은 Macro F1-score를 유지하였다. 세 모델 간 평균 Macro F1-score의 최대 차이는 0.0045로, 각 모델의 반복 학습 표준편차인 0.0062∼0.0075보다 작은 수준이었다. 따라서 본 연구 조건에서는 평균 분류 성능만으로 모델 간 명확한 우열을 판단하기 어렵다. 다만 MobileNetV2는 ResNet-50과 유사한 분류 성능을 유지하면서 파라미터 수와 FLOPs가 현저히 작으므로, 유사한 분류 성능을 확보해야 하는 계산 자원 제한 환경에서는 상대적으로 효율적인 대안이 될 수 있다.

딥러닝 모델의 성능은 데이터 분할, 초기화 및 학습 과정의 확률적 요소에 따라 달라질 수 있으므로, 작은 평균 성능 차이는 반복 학습의 변동성과 함께 해석할 필요가 있다(Bouthillier et al., 2021). GoogLeNet은 세 모델 중 상대적으로 낮은 평균값을 나타냈으나, ResNet-50과의 차이는 0.0045로 크지 않았으며 모든 반복에서 0.94 이상의 Macro F1-score를 유지하였다. 따라서 이를 데이터셋의 문제나 모델 구조 자체의 한계로 단정하기는 어렵다. 본 연구에서는 모델 간 공정한 비교를 위해 동일한 학습 조건을 적용하였으며 모델별 하이퍼파라미터 최적화는 수행하지 않았으므로, 본 결과는 공통 학습 조건에서 나타난 모델별 성능 차이로 해석하는 것이 적절하다.

Table 4 Performance and stability of models (Macro F1-score)

Model

Mean

Std

Min

Max

ResNet-50

0.9540

0.0062

0.9445

0.9603

GoogLeNet

0.9495

0.0071

0.9408

0.9599

MobileNetV2

0.9523

0.0075

0.9422

0.9599

3.2 Grad-CAM 해석성의 시각화 분석

본 연구에서는 CNN 모델의 분류 결과에 대한 해석성을 검토하기 위하여 Grad-CAM 기반 시각화 분석을 수행하였다. Fig. 2에는 각 모델별로 Grad-CAM 활성 영역과 bounding box 기반 참조 영역 간의 정합성이 높은 대표 사례(High IoU)와 낮은 대표 사례(Low IoU)를 제시하였다. Low IoU 사례는 softmax 예측 신뢰도가 높게 나타났음에도 활성 영역이 참조 영역과 거의 중첩되지 않는 경우를 포함한다. 각 사례에 대한 모델별 정량 지표는 Table 5에 정리하였다.

High IoU 사례에서는 세 모델 모두 Grad-CAM 활성 영역이 손상 위치와 비교적 잘 일치하는 경향을 나타냈다. Table 5에 따르면 High IoU 대표 사례에서는 모델별 IoU가 ResNet-50 0.7113, GoogLeNet 0.7550, MobileNetV2 0.7988로 나타나, Grad-CAM 활성 영역이 bounding box 기반 참조 영역과 비교적 높은 중첩을 보였다. CAM Precision 역시 ResNet-50 0.7959, GoogLeNet 0.9574, MobileNetV2 0.8017로 나타나, 해당 대표 사례에서는 활성 영역이 참조 영역 내부에 비교적 집중되는 경향이 확인되었다.

반면 Low IoU 대표 사례에서는 세 모델 모두 IoU와 CAM Precision이 0.0000으로 나타나, Grad-CAM 활성 영역이 bounding box 기반 참조 영역과 중첩되지 않았다. 해당 사례의 softmax 최대값은 ResNet-50 1.000, GoogLeNet 0.945, MobileNetV2 0.998로 높게 나타났다. 이러한 결과는 높은 softmax 최대값이 반드시 손상 위치에 근거한 공간적 판단을 의미하지는 않음을 보여준다. 현대 신경망의 softmax 출력은 실제 예측 정확도와 일치하지 않는 과도한 확률값을 나타낼 수 있으므로, 예측 확률만으로 판단 근거의 타당성을 평가하기에는 한계가 있다(Guo et al., 2017). 따라서 CNN 기반 손상 분류 모델의 평가에서는 분류 성능과 함께 Grad-CAM 기반 공간 정합성을 검토할 필요가 있다.

다만 Grad-CAM은 convolutional feature map을 기반으로 대략적인 활성 위치를 나타내는 방법이므로, 손상 영역의 정밀한 경계를 표현하는 데에는 한계가 있다(Selvaraju et al., 2017).

Fig. 2 Representative Grad-CAM visualization

../../Resources/ksm/jksmi.2026.30.4.126/fig2.png

Table 5 Quantitative metrics for representative Grad-CAM cases

Case

Model

IoU

CAM Precision

Confidence

High IoU

ResNet-50

0.7113

0.7959

1.000

GoogLeNet

0.7550

0.9574

0.999

MobileNetV2

0.7988

0.8017

0.930

Low IoU

ResNet-50

0.0000

0.0000

1.000

GoogLeNet

0.0000

0.0000

0.945

MobileNetV2

0.0000

0.0000

0.998

3.3 Grad-CAM 해석성의 정량적 분석

본 연구에서는 앞서 정의한 IoU와 CAM Precision을 활용하여 Grad-CAM 활성 영역과 bounding box 기반 참조 영역 간의 공간적 정합성을 정량적으로 분석하였다. 정량 평가는 이미지 단위 Grad-CAM 결과를 기반으로 수행하였으며, 모든 반복 실험 결과를 포함하여 모델별 평균값과 표준편차를 산출하였다. 전체 데이터 기준 Grad-CAM 정량 평가 결과는 Table 6에 정리하였으며, 이를 모델 간 비교가 용이하도록 Fig. 3에 시각화하였다. 손상 유형별 IoU 결과는 Table 7에 정리하였다.

분석 결과, ResNet-50은 IoU 0.2015±0.1288, CAM Precision 0.3022±0.2395로 세 모델 중 가장 높은 값을 나타냈다. 이는 ResNet-50에서 Grad-CAM 활성 영역과 참조 영역 간의 공간적 정합성이 상대적으로 높게 나타났음을 의미한다. GoogLeNet은 IoU 0.1776±0.1226, CAM Precision 0.2413±0.2110으로 ResNet-50보다 낮은 값을 나타냈으며, MobileNetV2는 IoU 0.1542±0.1182, CAM Precision 0.2164±0.2111로 가장 낮은 값을 나타냈다.

다만 ResNet-50이 세 모델 중 가장 높은 IoU와 CAM Precision을 나타냈음에도 불구하고, 절대적인 수치 수준은 각각 약 0.2 및 0.3 내외로 제한적이었다. 이는 모델 간 상대 비교에서는 ResNet-50의 공간 정합성이 가장 높게 나타났지만, Grad-CAM 활성 영역이 bounding box 기반 참조 영역과 충분히 정밀하게 일치한다고 보기는 어렵다는 점을 시사한다.

한편 손상 유형별 평균 분석(Table 7)에서는 균열의 IoU가 모든 모델에서 상대적으로 낮게 나타났다. 균열의 경우 ResNet-50 0.1847±0.1169, GoogLeNet 0.1527±0.0999, MobileNetV2 0.1404±0.1028로 확인되었다. 손상 유형별로는 GoogLeNet과 MobileNetV2에서 백태의 IoU가 각각 0.2041±0.1402 및 0.1832±0.1307로 각 모델 내 가장 높게 나타났으며, ResNet-50에서는 철근 노출의 IoU가 0.2185±0.1307로 가장 높게 나타났다. 이는 손상 유형의 형상, 크기 및 배경 특성이 Grad-CAM 기반 위치 정합성에 영향을 미칠 수 있음을 의미한다. 특히 균열은 폭이 좁고 불규칙하게 연장되는 선형 형상을 가지므로, 사각형 bounding box를 적용할 경우 참조 영역 내부에 비손상 배경이 상대적으로 많이 포함될 수 있다. 따라서 균열에서 나타난 낮은 IoU를 모델의 위치 추정 성능 저하로만 해석하기보다는, Grad-CAM의 주목 특성과 bounding box의 기하학적 한계를 함께 고려할 필요가 있다(Liu et al., 2021).

또한 모든 모델과 손상 유형에서 IoU의 표준편차가 비교적 크게 나타났으며, 이는 입력 이미지의 손상 형태, 크기 및 배경 복잡도에 따라 Grad-CAM 활성 영역의 위치와 범위가 달라질 수 있음을 보여준다. 따라서 Grad-CAM 기반 해석성 평가는 평균값뿐 아니라 표준편차와 대표 사례를 함께 고려하여 해석할 필요가 있다.

본 연구의 참조 영역은 픽셀 단위 segmentation mask가 아닌 bounding box 기반으로 생성되었기 때문에, Table 6의 IoU와 CAM Precision 및 Table 7의 IoU는 실제 손상 픽셀 단위의 정확한 일치도가 아니라 bounding box 기반 참조 영역과 Grad-CAM 활성 영역 간의 근사적 공간 정합성을 나타내는 지표로 해석하는 것이 적절하다. 따라서 본 연구의 Grad-CAM 정량 지표는 절대적 위치 검출 성능보다는 모델 간 상대 비교를 위한 공간 정합성 지표로 이해할 필요가 있다.

Table 6 Quantitative evaluation of Grad-CAM results

Model

IoU (mean±std)

CAM Precision (mean±std)

ResNet-50

0.2015±0.1288

0.3022±0.2395

GoogLeNet

0.1776±0.1226

0.2413±0.2110

MobileNetV2

0.1542±0.1182

0.2164±0.2111

Fig. 3 Comparison of Grad-CAM-based IoU and CAM Precision

../../Resources/ksm/jksmi.2026.30.4.126/fig3.png

Table 7 Class-wise Grad-CAM IoU

Model

Crack (mean±std)

Efflorescence (mean±std)

Rebar exposure (mean±std)

ResNet-50

0.1847±0.1169

0.2012±0.1361

0.2185±0.1307

GoogLeNet

0.1527±0.0999

0.2041±0.1402

0.1760±0.1189

MobileNetV2

0.1404±0.1028

0.1832±0.1307

0.1389±0.1141

3.4 종합 분석 및 실무 적용성 평가

본 연구에서는 CNN 모델의 분류 성능, 반복 학습 안정성 및 Grad-CAM 기반 해석성 결과를 통합적으로 분석하여 콘크리트 구조물 손상 분류 모델의 실무 적용성을 검토하였다. 기존 연구에서는 분류 성능, 데이터 규모, 하이퍼파라미터 조건 또는 Grad-CAM 기반 해석성을 각각 분석하는 데 초점을 두었으나, 실제 구조물 점검 환경에서는 분류 성능뿐 아니라 반복 학습에 따른 안정성과 판단 근거의 공간적 정합성을 함께 고려하는 것이 중요하다.

분류 성능 측면에서는 ResNet-50이 세 모델 중 가장 높은 평균 Macro F1-score와 가장 낮은 표준편차를 보였으나, MobileNetV2와의 평균 성능 차이는 0.0017로 매우 작았다. 따라서 본 연구 조건에서는 세 모델 간 분류 성능 차이가 크지 않았으며, MobileNetV2는 경량 구조에도 불구하고 높은 분류 성능을 유지한 것으로 판단된다. GoogLeNet은 세 모델 중 가장 낮은 평균 성능과 상대적으로 큰 최소-최대 범위를 보였다.

해석성 측면에서는 ResNet-50이 IoU와 CAM Precision에서 가장 높은 값을 나타내어, 손상 위치와의 공간적 정합성과 활성 영역 집중도 측면에서 상대적으로 높은 결과를 보였다. 반면 MobileNetV2는 분류 성능은 ResNet-50과 유사하였으나 해석성 지표에서는 상대적으로 낮은 값을 나타냈다. 즉, 세 모델 모두 0.94 이상의 높은 Macro F1-score를 보였으나, Grad-CAM 기반 IoU와 CAM Precision은 상대적으로 낮은 수준을 나타냈다. 이는 CNN 모델이 손상 유형을 정확히 분류하더라도, 그 판단 근거가 항상 bounding box 기반 참조 영역과 공간적으로 일치하지는 않을 수 있음을 보여준다.

시각화 기반 분석에서도 High IoU 사례에서는 모델이 손상 위치와 비교적 잘 일치하는 활성 영역을 나타냈으나, Low IoU 사례에서는 높은 softmax 예측 신뢰도에도 불구하고 bounding box 기반 참조 영역과 중첩되지 않는 영역에 주목하는 경우가 확인되었다. 이는 모델의 예측 결과만으로 판단 근거의 타당성을 충분히 평가하기 어렵다는 점을 의미한다.

따라서 구조물 손상 자동 분류 모델의 적용성을 검토하기 위해서는 단순 분류 성능뿐 아니라 반복 학습 기반 안정성, Grad-CAM 기반 해석성, 그리고 파라미터 수 및 FLOPs와 같은 계산 복잡도 지표를 함께 고려한 통합적 평가가 필요하다. 특히 구조물 유지관리와 같이 신뢰성이 중요한 분야에서는 예측 결과와 함께 판단 근거를 제시할 수 있는 XAI 기반 검토가 중요할 것으로 판단된다.

4. 결 론

본 연구에서는 ResNet-50, GoogLeNet 및 MobileNetV2를 대상으로 콘크리트 구조물 손상 이미지의 분류 성능, 반복 학습 기반 안정성 및 Grad-CAM 기반 해석성을 통합적으로 분석하였다.

분석 결과, ResNet-50은 세 모델 중 가장 높은 평균 Macro F1-score와 상대적으로 가장 높은 Grad-CAM 기반 해석성 지표를 나타냈다. 다만 분류 성능 측면에서는 MobileNetV2와의 차이가 크지 않았으며, MobileNetV2는 경량 구조에도 불구하고 높은 분류 성능을 유지하였다. GoogLeNet은 세 모델 중 가장 낮은 평균 Macro F1-score를 보였으며, 최소-최대 범위도 상대적으로 크게 나타났다.

Grad-CAM 분석에서는 일부 사례에서 높은 softmax 예측 신뢰도에도 불구하고 Grad-CAM 활성 영역이 bounding box 기반 참조 영역과 공간적으로 일치하지 않는 현상이 확인되었다. 또한 균열과 같이 폭이 좁고 불규칙한 선형 형상을 갖는 손상에서는 상대적으로 낮은 IoU가 나타나는 경향이 확인되었다.

따라서 CNN 기반 구조물 손상 분류 모델의 적용성을 검토하기 위해서는 분류 성능뿐 아니라 반복 학습 안정성, Grad-CAM 기반 해석성 및 모델 복잡도를 함께 고려할 필요가 있다. 다만 본 연구의 Grad-CAM 정량 평가는 bounding box 기반 참조 영역과 고정 임계값 0.60 조건에서 수행되었으므로, IoU와 CAM Precision은 실제 손상 픽셀의 정밀한 위치 검출 성능이 아니라 Grad-CAM 활성 영역과 참조 영역 간의 근사적 공간 정합성을 나타내는 지표로 해석할 필요가 있다.

감사의 글

이 논문은 2026년 정부(교육부)의 재원으로 한국연구재단의 지원을 받아 수행된 연구입니다(RS-2021-NR060132).

이 연구는 과학기술정보통신부의 재원으로 한국지능정보사회진흥원의 지원을 받아 구축된 “건물 균열 탐지 이미지”를 활용하여 수행된 연구입니다. 본 연구에 활용된 데이터는 AI 허브(aihub.or.kr)에서 다운로드 받으실 수 있습니다.

References

1 
Asvitha Valli, S., Ravi Kumar, M. S. (2023), Review on the mechanism and mitigation of cracks in concrete, Applications in Engineering Science, 16, 100154DOI
2 
Bouthillier, X., Delaunay, P., Bronzi, M., Trofimov, A., Nichyporuk, B., Szeto, J., Mohammadi Sepahvand, N., Raff, E., Madan, K., Voleti, V., Ebrahimi Kahou, S., Michalski, V., Arbel, T., Pal, C., Varoquaux, G., Vincent, P. (2021), Accounting for variance in machine learning benchmarks, Proceedings of Machine Learning and Systems, 3, 747-769.Google Search
3 
Cheng, Z., Wu, Y., Li, Y., Cai, L., Ihnaini, B. (2025), A comprehensive review of explainable artificial intelligence (XAI) in computer vision, Sensors, 25(13), 4166DOI
4 
Dorafshan, S., Thomas, R. J., Maguire, M. (2018), SDNET2018: An annotated image dataset for non-contact concrete crack detection using deep convolutional neural networks, Data in Brief, 21, 1664-1668.DOI
5 
Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., Houlsby, N. (2021), An image is worth 16×16 words: Transformers for image recognition at scale, International Conference on Learning RepresentationsGoogle Search
6 
Ge, K., Wang, C., Guo, Y. T., Tang, Y. S., Hu, Z. Z., Chen, H. B. (2024), Fine-tuning vision foundation model for crack segmentation in civil infrastructures, Construction and Building Materials, 431, 136573DOI
7 
Ghaffarian, S., Taghikhah, F. R., Maier, H. R. (2023), Explainable artificial intelligence in disaster risk management: Achievements and prospective futures, International Journal of Disaster Risk Reduction, 98, 104123DOI
8 
Guo, C., Pleiss, G., Sun, Y., Weinberger, K. Q. (2017), On calibration of modern neural networks, Proceedings of the 34th International Conference on Machine Learning, Proceedings of Machine Learning Research, 70, 1321-1330.Google Search
9 
He, K., Zhang, X., Ren, S., Sun, J. (2016), Deep residual learning for image recognition, Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 770-778.Google Search
10 
Howard, A. G., Zhu, M., Chen, B., Kalenichenko, D., Wang, W., Weyand, T., Andreetto, M., Adam, H. (2017), MobileNets: Efficient convolutional neural networks for mobile vision applications, arXiv preprint arXiv:1704.04861Google Search
11 
Hu, M., Yue, N., Groves, R. M. (2024), Damage classification of a bolted connection using guided waves and explainable artificial intelligence, Procedia Structural Integrity, 52, 224-233.DOI
12 
Kim, I. S., Choi, S. Y., Yang, E. I. (2025), Concrete damage classification using CNN models with small-scale images: performance analysis and comparison, Journal of the Korea Institute for Structural Maintenance and Inspection, 29(6), 30-38. (in Korean)Google Search
13 
Kim, I. S., Choi, S. Y., Yang, E. I. (2025), Analysis of performance and interpretability in CNN-based concrete damage classification using Grad-CAM, Journal of the Korea Institute for Structural Maintenance and Inspection, 29(6), 110-118. (in Korean)Google Search
14 
Kim, I. S., Yang, E. I. (2026), Effect of data size and hyperparameter settings on classification performance and computational efficiency in CNN-based concrete damage classification, Journal of the Korea Institute for Structural Maintenance and Inspection, 30(2), 52-60. (in Korean)Google Search
15 
Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A. C., Lo, W. Y., Dollár, P., Girshick, R. (2023), Segment anything, Proceedings of the IEEE/CVF International Conference on Computer Vision, 4015-4026.Google Search
16 
Krizhevsky, A., Sutskever, I., Hinton, G. E. (2012), ImageNet classification with deep convolutional neural networks, Advances in Neural Information Processing Systems (NeurIPS), 25, 1097-1105.Google Search
17 
Liu, H., Miao, X., Mertz, C., Xu, C., Kong, H. (2021), CrackFormer: Transformer network for fine-grained crack detection, Proceedings of the IEEE/CVF International Conference on Computer Vision, 3783-3792.Google Search
18 
Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., Sutskever, I. (2021), Learning transferable visual models from natural language supervision, Proceedings of the 38th International Conference on Machine Learning, PMLR, 139, 8748-8763.Google Search
19 
Roy, S., Yogi, B., Majumdar, R., Ghosh, P., Das, S. K. (2025), Deep learning‑based crack detection and prediction for structural health monitoring, Discover Applied Sciences, 7, 674DOI
20 
Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., Chen, L.-C. (2018), MobileNetV2: Inverted residuals and linear bottlenecks, Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 4510-4520.Google Search
21 
Selvaraju, R. R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., Batra, D. (2017), Grad-CAM: Visual explanations from deep networks via gradient-based localization, Proceedings of the IEEE International Conference on Computer Vision, 618-626.Google Search
22 
Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A. (2015), Going deeper with convolutions, Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 1-9.Google Search
23 
Ullmann, I., Schür, J. (2025), Explainable AI for reliable defect recognition and localization in non-destructive testing with millimeter-wave imaging, IEEE Access, 13, 160799-160809.DOI