Mobile QR Code QR CODE

Journal of the Korea Concrete Institute

J Korea Inst. Struct. Maint. Insp.
  • Indexed by
  • Korea Citation Index (KCI)

  1. 정회원, 강원대학교 스마트인프라연구소 연구교수
  2. 정회원, 강원대학교 건설환경공학부 교수, 교신저자



Computational efficiency, Convolutional Neural Network, Image classification, Training stability, Repeated training evaluation
계산 효율성, 합성곱신경망(CNN), 이미지 분류, 학습 안정성, 반복 학습 평가

1. 서 론

콘크리트 구조물은 교량, 터널, 항만 등 주요 사회기반시설의 핵심 구성 요소로서, 장기 사용에 따라 균열, 박락, 철근 노출 등 다양한 손상이 발생한다. 이러한 손상은 구조물의 내구성과 안전성을 저하시킬 수 있으므로 정기적인 점검과 정확한 평가가 필수적이다. 현재 구조물 점검은 주로 전문가의 육안 조사에 의존하고 있으나, 주관적 판단에 따른 편차와 대규모 구조물에 대한 신속한 평가의 한계를 가진다(Kim and Yang, 2026; Roy et al., 2025).

최근에는 영상 기반 비파괴 평가 기술과 함께 딥러닝을 활용한 자동 손상 인식 연구가 활발히 수행되고 있다. 특히 Convolutional Neural Networks (CNN)은 이미지의 공간적 특징을 효과적으로 학습할 수 있어 다양한 영상 인식 문제에서 높은 성능을 보이고 있으며, Alex Krizhevsky 등이 제안한 AlexNet을 통해 대규모 이미지 분류 분야에서 그 가능성이 입증되었다(Krizhevsky et al., 2012).

이후, 모델의 성능과 효율성을 개선하기 위해 ResNet, MobileNet, EfficientNet, GoogLeNet 등 다양한 CNN 구조가 제안되었다(He et al., 2016; Howard et al., 2017; Szegedy et al., 2015; Tan and Le, 2019). 이러한 모델들은 다양한 구조적 변형(예: ResNet-50, MobileNetV2, EfficientNet-B0 등)으로 구현되어 다양한 영상 분류 문제에 활용되고 있다(Kim et al., 2025a; Kim et al., 2025b).

이와 같은 CNN 기반 모델은 콘크리트 및 도로 구조물의 손상 인식 분야에서도 활발히 적용되고 있으며, CNN을 활용한 균열 검출에서 높은 성능을 보고하였다(Cha et al., 2017; Shin, 2025; Zhang et al., 2016).

그러나 기존 연구에서는 단일 학습 결과를 기준으로 모델 성능을 평가한 경우가 많아, 반복 학습에 따른 성능 변동성과 재현성은 정량적으로 충분히 검토되지 않았다. 동일한 조건에서도 가중치 초기화 및 데이터 셔플링 등에 따라 결과가 달라질 수 있으며, 이는 모델의 재현성과 신뢰성에 영향을 미친다. 일부 연구자들은 이러한 성능 변동성과 재현성 문제를 지적하며 반복 학습의 필요성을 제시하였다(Henderson et al., 2018; Recht et al., 2019).

또한 실제 구조물 점검 시스템에 적용하기 위해서는 분류 정확도뿐만 아니라 학습 시간, 추론 속도, 모델 크기와 같은 계산 효율성 또한 중요한 요소이다. 특히 현장 및 모바일 환경에서는 성능과 효율성 간의 균형을 종합적으로 고려할 필요가 있다.

따라서 본 연구에서는 EfficientNet, MobileNet, ResNet, GoogLeNet을 대상으로 콘크리트 손상 이미지 분류 성능을 비교하고, 반복 학습을 통해 평균 성능과 변동성을 함께 분석하여 모델의 재현성과 안정성을 평가하고자 한다. 또한 계산 효율성을 함께 고려하여 구조물 유지관리 환경에 적합한 CNN 모델 선택 기준을 제시하는 것을 목적으로 한다.

2. 분석 방법

2.1 사용 프로그램 및 분석 환경

본 연구에서는 콘크리트 구조물의 손상 이미지 분류를 위한 딥러닝 분석을 MATLAB R2025a 환경에서 수행하였다. 주요 분석 도구로는 Deep Learning Toolbox를 활용하였으며, 이미지 처리 및 데이터 전처리를 위해 Image Processing Toolbox를 병행 사용하였다. 또한 학습 과정에서 발생하는 데이터 분석 및 통계 처리를 위해 Statistics and Machine Learning Toolbox를 적용하였다.

모든 분석은 동일한 소프트웨어 및 하드웨어 환경에서 수행하여 모델 간 성능 비교의 일관성을 확보하고자 하였으며, 학습 및 추론 과정에서는 GPU를 활용한 병렬 연산 환경을 적용하여 연산 효율을 향상시켰다. 모델 학습에는 GPU가 NVIDIA RTX A5000(24GB)인 데스크톱 PC를 사용하였으며, 메모리는 DDR5 64GB, CPU는 Intel i9-14900KF, 저장 장치는 SSD 2TB를 적용하였다. 상세한 하드웨어 사양은 Table 1에 정리하였다.

Table 1 Desktop PC specification

PC parts

Specification

CPU

i9-14900KF

RAM

DDR5 64GB (32GB×2)

GPU

RTX A5000 24GB

STORAGE

SSD 2TB

2.2 데이터셋 구성 및 분류 대상

본 연구에서는 공공 데이터 플랫폼 AI-Hub에서 제공하는 콘크리트 구조물 손상 이미지 데이터셋을 활용하였다. 해당 데이터는 국내 교량, 옹벽 및 건축물 등 실제 구조물을 대상으로 드론 및 고해상도 촬영 장비를 통해 수집된 이미지로, 다양한 조도 조건, 배경 변화 및 표면 질감 특성을 포함하고 있다.

AI-Hub에서 제공하는 원시 데이터에는 손상과 직접적으로 관련되지 않은 배경 이미지, 표면 오염 등으로 인해 손상 여부를 명확히 판단하기 어려운 이미지가 다수 포함되어 있다. 이러한 데이터는 학습 과정에서 노이즈로 작용할 수 있다. 따라서 원시 데이터 중 콘크리트 손상으로 명확히 식별 가능한 이미지를 대상으로 연구자가 육안 검토를 통해 선별하고, 손상 특징이 불분명하거나 비손상 요소의 영향이 큰 이미지는 제외하였다.

본 연구의 분류 대상은 콘크리트 구조물 표면에서 발생하는 대표적인 손상 유형인 균열(crack), 백태(efflorescence), 철근 노출(rebar exposure)의 세 가지로 설정하였다. 클래스 간 데이터 불균형이 분류 성능에 미치는 영향을 배제하기 위하여 각 클래스는 동일한 수의 이미지로 구성하였다.

데이터 규모에 따른 모델 성능 변화를 분석하기 위하여 클래스당 이미지 수를 500장, 1,000장, 2,000장, 3,000장의 네 가지 수준으로 구분하여 분석을 수행하였다. 각 분석 조건에서는 클래스별로 동일한 수의 이미지를 추출한 후, 이를 학습용 70%, 검증용 15%, 시험용 15% 비율로 분할하였다. 성능 평가는 학습 과정에 사용되지 않은 시험 데이터를 기준으로 수행하였다. 사용된 이미지의 예시는 Fig. 1에 나타내었다.

Fig. 1 Example images of concrete damage

../../Resources/ksm/jksmi.2026.30.4.17/fig1.png

2.3 CNN 모델 구성

본 연구에서는 구조와 연산 특성이 서로 다른 네 가지 CNN 모델을 선정하여 분류 성능을 비교하였다. 적용된 모델은 EfficientNet-B0, MobileNetV2, ResNet-50, GoogLeNet이며, 이후 본문에서는 각각 EfficientNet, MobileNet, ResNet, GoogLeNet으로 표기한다. 이들 모델은 ImageNet 데이터셋으로 사전 학습된 대표적인 CNN 기반 이미지 분류 모델이다. 각 모델의 구조적 특징은 Table 2에 정리하였다.

Table 2 Summary of CNN model architectures

Model

Total layers

Parameters (M)

Feature

EfficientNet

237

5.3

Compound scaling

MobileNet

53

3.4

Lightweight model

ResNet

50

25.6

Residual connection

GoogLeNet

22

7.0

Inception module

모든 모델은 ImageNet 데이터셋으로 사전 학습된 가중치를 활용한 전이 학습(transfer learning) 방식으로 구성하였다. 최종 분류층은 본 연구의 분류 대상인 세 가지 손상 유형에 맞도록 재구성하였으며, 사전 학습된 네트워크의 모든 계층을 미세 조정하여 손상 이미지에 적합한 특징을 학습하도록 하였다. 또한 모델 간 비교의 일관성을 확보하기 위해 입력 이미지 크기 및 전처리 조건은 모든 모델에서 동일하게 적용하였다.

2.4 이미지 전처리 및 데이터 증강

이미지 해상도 및 촬영 조건의 차이에 따른 영향을 최소화하기 위하여 모든 입력 이미지는 동일한 크기로 정규화하여 사용하였다. 모든 이미지는 패딩을 적용한 후 640×640 픽셀 해상도로 정규화하여 원본 이미지의 종횡비 왜곡을 방지하였으며, 이후 각 CNN 모델의 입력 크기(224×224)에 맞추어 리사이즈하여 학습에 사용하였다.

또한 모델의 일반화 성능을 향상시키기 위하여 학습 데이터에 한해 데이터 증강을 적용하였다. 데이터 증강에는 회전, 수평 및 수직 방향 이동, 좌우 반전, 그리고 스케일 변환이 포함되었다. 구체적으로 회전 범위는 ±10°, 수평 및 수직 이동 범위는 각각 ±10픽셀, 스케일 변환 범위는 0.9∼1.1로 설정하였다. 이러한 증강기법은 실제 현장 촬영 조건에서 발생할 수 있는 위치 변화, 촬영 각도 변화 및 크기 차이를 일부 모사함으로써, 모델의 과적합을 완화하고 다양한 입력 조건에 대한 적응성을 향상시키기 위한 것이다. 반면, 검증 및 시험 데이터에는 데이터 증강을 적용하지 않아 모델 성능을 객관적으로 평가할 수 있도록 하였다.

2.5 하이퍼파라미터 설정

CNN 모델의 학습 성능에 영향을 미치는 주요 하이퍼파라미터로 초기 학습률(Learning rate), 에포크 수(Epochs), 배치 크기(Batch size)를 설정하였다. 초기 학습률은 0.001, 0.0003, 0.0001의 세 가지 수준으로 구성하였으며, 에포크 수는 15와 30, 배치 크기는 16과 32로 설정하였다.

본 연구에서 초기 학습률은 ImageNet 사전학습 모델을 콘크리트 손상 이미지에 미세조정하는 전이학습 조건을 고려하여 0.001 이하의 비교적 낮은 범위로 설정하였다. 또한 에포크 수와 배치 크기는 제한된 데이터 조건에서의 과적합 가능성, 학습 안정성 및 GPU 메모리 사용량을 함께 고려하여 각각 15와 30, 16과 32로 설정하였다. 본 연구에서는 모든 CNN 모델의 학습에 Adam optimizer를 동일하게 적용하였다. 이는 모델 간 성능 비교 시 optimizer 차이에 따른 영향을 배제하고, learning rate, epoch 및 batch size 변화에 따른 영향을 동일한 최적화 조건에서 비교하기 위한 것이다.

각 하이퍼파라미터 조합에 대해 격자 탐색(grid search) 방식을 적용하여 다양한 학습 조건에서의 성능 결과를 확보하였다. 이 결과는 이후 하이퍼파라미터 민감도 분석에 활용하였다.

2.6 반복 학습 기반 분석 설계

본 연구에서는 CNN 모델의 성능뿐 아니라 반복 학습에 따른 재현성과 안정성을 평가하기 위하여 반복 학습 기반 분석을 수행하였다. 단, 하이퍼파라미터 변화에 따른 성능 차이와 동일 조건에서의 학습 변동성을 구분하기 위하여 분석 절차를 두 단계로 구성하였다. 먼저 학습률, 에포크 수 및 배치 크기를 변화시키는 분석은 하이퍼파라미터 민감도 분석으로 설정하였다. 모든 분석에서 optimizer는 Adam으로 고정하였으며, 하이퍼파라미터 민감도 분석과 반복 학습 안정성 평가는 동일한 optimizer 조건에서 수행하였다. 이후 반복 학습 안정성 평가는 하이퍼파라미터를 고정한 상태에서 random seed만 변경하여 수행하였다.

반복 학습 안정성 평가에서는 클래스당 3,000장의 데이터 조건에서 학습률 0.0001, 에포크 수 15, 배치 크기 32 및 Adam optimizer 조건을 적용하였다. 또한 학습, 검증 및 시험 데이터 분할은 동일하게 고정하고, random seed만 1부터 10까지 변경하여 총 10회의 반복 학습을 수행하였다. Random seed 변화는 초기 가중치, mini-batch 구성 순서 및 데이터 증강 과정에 영향을 줄 수 있으므로, 동일한 학습 조건에서도 모델 성능에 일정 수준의 변동성이 발생할 수 있다. 따라서 본 연구에서는 10회 반복 학습 결과를 이용하여 평균값, 표준편차, 최소값, 최대값 및 성능 변동 폭을 산정하고, 이를 통해 각 CNN 모델의 평균적 분류 성능과 반복 학습 안정성을 함께 평가하였다.

하이퍼파라미터 변화에 따른 성능 영향을 검토하기 위하여 one-factor-at-a-time(OFAT) 방식의 분석을 수행하였다. 기존의 전체 조합 평균 비교 방식은 학습률, 에포크 수 및 배치 크기 변화가 동시에 포함되므로 각 변수의 독립적인 영향을 해석하는 데 한계가 있다. 따라서 본 연구에서는 baseline 조건을 고정한 상태에서 하나의 하이퍼파라미터만 변화시켜 모델 성능 변화를 비교하였다.

하이퍼파라미터 설정 범위는 학습률 0.001, 0.0003, 0.0001, 에포크 수 15와 30, 배치 크기 16과 32로 구성하였다. OFAT 분석의 baseline 조건은 클래스당 3,000장, 학습률 0.0001, 에포크 수 15, 배치 크기 32로 설정하였다. 학습률 영향 분석에서는 에포크 수 15와 배치 크기 32를 고정한 상태에서 학습률만 변화시켰고, 에포크 수 영향 분석에서는 학습률 0.0001과 배치 크기 32를 고정한 상태에서 에포크 수만 변화시켰으며, 배치 크기 영향 분석에서는 학습률 0.0001과 에포크 수 15를 고정한 상태에서 배치 크기만 변화시켰다. 각 조건은 동일한 데이터 분할과 동일한 학습 환경에서 수행된 3회 반복 결과의 평균값을 기준으로 비교하였다.

한편, 반복 학습 안정성 평가는 baseline 조건에서 random seed만 변경하여 10회 수행한 결과를 기준으로 분석하였으며, 하이퍼파라미터 영향 분석은 기존 3회 반복 하이퍼파라미터 조합 결과 중 baseline 조건을 기준으로 하나의 변수만 변화한 조건을 선별하여 OFAT 방식으로 재정리하였다. 이를 통해 동일 조건에서의 반복 학습 안정성 평가와 하이퍼파라미터 변화에 따른 성능 민감도 분석이 혼재되지 않도록 하였다.

2.7 성능 평가 지표

모델의 분류 성능 평가는 Macro F1-score를 중심으로 수행하였다. 또한 반복 학습 결과의 표준편차를 산정하여 모델 성능의 안정성과 민감도를 함께 평가하였다. Macro F1-score는 각 클래스별 F1-score의 평균값으로 정의되며, 클래스 간 데이터가 균형을 이루는 조건에서 모델의 분류 성능을 종합적으로 평가할 수 있는 지표이다.

또한 모델의 실무 적용 가능성을 고려하여 학습 시간, 추론 시간 및 파라미터 수를 바탕으로 계산 효율성을 비교하였다. 이는 분류 성능뿐만 아니라 실제 적용 환경에서 요구되는 연산 효율성과 활용 가능성을 함께 평가하기 위한 것이다. 전체 분석 조건은 Table 3에 정리하였다.

Table 3 Summary of analysis settings

Item

Value

Damage Types

Crack, Efflorescence, Rebar exposure

Number of Images

500, 1000, 2000, 3000

Model Types

EfficientNet, MobileNet, ResNet, GoogLeNet

Input Resolution

224 × 224 pixels (Resized from 640 × 640 pixels)

Hyperparameters

Epochs: 15, 30; Batch size: 16, 32; Learning rate: 0.001, 0.0003, 0.0001

Optimizer

Adam for all analyses

Repeated training for stability evaluation

10 runs with fixed split and random seeds 1–10

Fixed condition for 10-run analysis

Data per class: 3,000; learning rate: 0.0001; epoch: 15, batch size: 32

3. 결과 및 분석

3.1 고정 조건에서의 10회 반복 학습 결과

본 연구에서는 2.6절에서 정의한 baseline 고정 조건에서 random seed만 변경한 10회 반복 학습을 수행하였다. 따라서 본 절의 결과는 하이퍼파라미터 변화에 따른 성능 차이가 아니라, 동일한 데이터 분할과 학습 조건에서 random seed 변화에 의해 발생하는 모델별 성능 변동성을 나타낸다.

Table 4는 10회 반복 학습 결과의 평균, 표준편차, 최소값, 최대값 및 변동 폭을 나타내며, Fig. 2는 10개 seed에서 도출된 Test Macro F1의 최고값과 평균값을 모델별로 비교한 결과이다. EfficientNet은 Test Macro F1가 0.9566±0.0022로 가장 높은 평균 성능과 가장 낮은 표준편차를 보였으며, 성능 범위도 0.9525–0.9601로 제한적이었다. MobileNet은 0.9518±0.0061로 EfficientNet보다 평균 성능은 다소 낮았으나 높은 분류 성능과 비교적 낮은 변동성을 동시에 보였다. ResNet은 0.9434±0.0057로 안정적인 성능을 보였으나, 평균 성능은 EfficientNet 및 MobileNet보다 낮았다.

반면 GoogLeNet은 Test Macro F1가 0.4134±0.3417로 나타나 다른 모델에 비해 평균 성능이 낮고 변동성이 매우 크게 나타났다. 특히 최고값은 0.9371로 일부 seed에서는 높은 성능을 보였으나, 최소값은 0.1667로 나타나 seed에 따른 성능 차이가 매우 컸다. 이러한 결과는 단일 실행 결과만으로 CNN 모델의 성능을 평가할 경우 특정 seed에 따른 우연한 결과가 반영될 수 있으며, 반복 학습을 통한 평균 성능과 변동성 분석이 필요함을 보여준다.

Table 4 Repeated training results over 10 seeds

Model

EfficientNet

MobileNet

ResNet

GoogLeNet

Test M. F1 (mean±std)

0.9566 ±0.0022

0.9518 ±0.0061

0.9434 ±0.0057

0.4134 ±0.3417

Test M. F1 (min-max)

0.9525 -0.9601

0.9425 -0.9607

0.9309 -0.9505

0.1667 -0.9371

Range

0.0076

0.0183

0.0196

0.7704

Fig. 2 Maximum and mean Test Macro F1 over 10 seeds

../../Resources/ksm/jksmi.2026.30.4.17/fig2.png

3.2 반복 학습 기반 성능 안정성 분석

10회 반복 학습 결과의 표준편차를 기준으로 모델별 성능 안정성을 비교하였다. 동일한 학습 조건에서도 random seed 변화에 따라 학습 결과가 달라질 수 있으므로, 반복 학습 결과의 표준편차는 모델의 재현성과 안정성을 평가하는 지표로 활용하였다.

Table 4에 나타난 바와 같이 EfficientNet은 Test Macro F1의 표준편차가 0.0022로 가장 낮게 나타나 10회 반복 조건에서 가장 안정적인 성능을 보였다. ResNet과 MobileNet은 각각 0.0057 및 0.0061의 표준편차를 보여 비교적 안정적인 성능을 나타냈다. 반면 GoogLeNet은 표준편차가 0.3417로 크게 나타나 random seed 변화에 따른 성능 변동성이 매우 컸다. Fig. 3은 고정 학습 조건에서 10개 random seed에 따른 Test Macro F1의 분포를 나타낸 것으로, EfficientNet, ResNet 및 MobileNet은 비교적 좁은 범위에 분포한 반면 GoogLeNet은 0.1667에서 0.9371까지 넓은 범위에 분포하여 반복 학습 안정성이 낮게 나타남을 시각적으로 보여준다.

GoogLeNet의 경우 일부 seed에서는 높은 Macro F1를 보였으나, 다수 seed에서 특정 클래스 예측 편향이 성능 저하에 영향을 미친 것으로 판단된다. 특히 Macro F1가 0.1667 수준으로 나타난 경우는 세 클래스 중 일부 클래스에 대한 예측이 거의 이루어지지 않았음을 의미하며, 이는 평균 성능 저하가 클래스 예측 불균형과 수렴 불안정성의 영향을 크게 받았음을 시사한다. 따라서 GoogLeNet의 낮은 평균 성능은 모델 구조 자체의 일반적 한계로 단정하기보다, 본 연구의 데이터 구성, 전이학습 방식 및 고정 하이퍼파라미터 조건에서 random seed 변화에 따른 학습 불안정성이 크게 반영된 결과로 해석하였다.

이상의 결과는 CNN 모델 평가 시 단일 실행 결과만으로 모델의 대표 성능을 판단하기 어렵고, 반복 학습 기반 평균 성능과 변동성을 함께 고려할 필요가 있음을 보여준다.

Fig. 3 Distribution of Test Macro F1 over 10 seeds

../../Resources/ksm/jksmi.2026.30.4.17/fig3.png

3.3 데이터 규모에 따른 평균 성능 변화 분석

클래스당 데이터 수 변화가 모델의 평균 분류 성능에 미치는 영향을 분석하였다. 본 절의 결과는 데이터 규모 변화에 따른 민감도 분석으로, 고정 조건에서 random seed만 변경한 반복 학습 안정성 평가와 구분하여 해석하였다. 데이터 수는 클래스당 500장, 1,000장, 2,000장, 3,000장 조건으로 구성하였으며, 결과는 Table 5에 나타내었다. Table 5는 데이터 규모별 Test Macro F1를 하이퍼파라미터 조건별 집계 결과를 바탕으로 정리한 것이다. 평균값은 각 데이터 규모에서 하이퍼파라미터 조합별 평균 Test Macro F1를 평균한 값이며, 표준편차는 각 조합 내 반복 학습 결과의 표준편차를 평균한 값이다. 또한 최소값과 최대값은 하이퍼파라미터 조합별 평균 Test Macro F1의 범위를 나타낸다.

EfficientNet은 데이터 수 증가에 따라 평균 Macro F1가 0.9105±0.0222에서 0.9397±0.0072로 향상되었으며, MobileNet 역시 0.8905±0.0244에서 0.9355±0.0079로 증가하였다. ResNet 또한 0.8707±0.0294에서 0.9199±0.0077로 성능 향상을 보였다. 이들 세 모델은 데이터 규모 확대에 따라 평균 성능이 향상되고 표준편차가 감소하는 경향을 보였으며, 이는 다양한 손상 패턴의 학습과 일반화 성능 확보에 데이터 증가가 긍정적으로 작용했음을 의미한다. 특히 ResNet은 500장 대비 3,000장 조건에서 약 0.0492의 가장 큰 성능 향상을 보였으며, 표준편차도 크게 감소하여 데이터 증가에 따른 안정성 개선 효과가 상대적으로 뚜렷하게 나타났다.

반면 GoogLeNet은 500장 조건에서 평균 Macro F1가 0.3923±0.0270이었으나, 데이터 규모가 증가함에 따라 3,000장 조건에서는 0.2703±0.1162로 감소하였다. 또한 최소값은 모든 데이터 규모에서 0.1667로 나타났고, 최대값은 500장 조건의 0.9202에서 3,000장 조건의 0.6604로 감소하였다. 이는 GoogLeNet이 일부 조건에서는 비교적 높은 성능을 보일 수 있으나, 데이터 규모가 증가하더라도 낮은 성능 구간이 반복적으로 나타났음을 의미한다. 따라서 GoogLeNet의 성능 감소 경향은 모델 구조 자체의 일반적 한계로 단정하기보다는, 본 연구의 데이터 구성, 전이학습 방식 및 하이퍼파라미터 설정 범위에서 나타난 데이터 규모 변화에 대한 민감도와 수렴 불안정성이 함께 반영된 결과로 해석할 필요가 있다.

이상의 결과는 데이터 규모 증가가 모든 CNN 모델에서 동일한 성능 향상으로 이어지지는 않으며, 모델 구조와 학습 조건에 따라 데이터 활용 특성과 안정성 변화 양상이 달라질 수 있음을 보여준다. 따라서 본 연구에서는 GoogLeNet의 데이터 규모 증가에 따른 성능 저하를 일반적인 이미지 분류 성능의 한계로 해석하지 않고, 본 분석 조건에서 관찰된 모델별 민감도 차이로 제한하여 해석하였다.

Table 5 Effect of dataset size on Test Macro F1 performance

Model

Data per class

Test Macro F1 (mean±std)

Test Macro F1 (min-max)

EfficientNet

500

0.9105±0.0222

0.8176-0.9481

1,000

0.9189±0.0128

0.8267-0.9512

2,000

0.9199±0.0131

0.8516-0.9427

3,000

0.9397±0.0072

0.8837-0.9586

MobileNet

500

0.8905±0.0244

0.8222-0.9317

1,000

0.9114±0.0144

0.8570-0.9484

2,000

0.9139±0.0103

0.8505-0.9406

3,000

0.9355±0.0079

0.9077-0.9538

ResNet

500

0.8707±0.0294

0.7123-0.9362

1,000

0.8939±0.0175

0.7965-0.9408

2,000

0.9005±0.0083

0.8584-0.9344

3,000

0.9199±0.0077

0.8726-0.9540

GoogLeNet

500

0.3923±0.0270

0.1667-0.9202

1,000

0.3183±0.0375

0.1667-0.8957

2,000

0.2764±0.0832

0.1667-0.8943

3,000

0.2703±0.1162

0.1667-0.6604

3.4 하이퍼파라미터에 따른 성능 변화 분석

초기 학습률, 에포크 수 및 배치 크기가 모델 성능에 미치는 영향을 검토하기 위하여 2.6절에서 정의한 baseline 조건을 기준으로 OFAT 분석을 수행하였다. 각 분석에서는 하나의 하이퍼파라미터만 변화시키고 나머지 조건은 고정하였으며, optimizer는 모든 조건에서 Adam으로 동일하게 적용하였다 (Table 6).

학습률 변화는 검토한 하이퍼파라미터 중 성능에 가장 뚜렷한 영향을 미치는 변수로 나타났다. EfficientNet의 Test Macro F1는 학습률 0.001, 0.0003 및 0.0001 조건에서 각각 0.9150, 0.9483 및 0.9545로 증가하였으며, MobileNet도 0.9157, 0.9330 및 0.9514로 증가하였다. ResNet 역시 동일 조건에서 0.8892, 0.9326 및 0.9386으로 증가하였다. 이는 본 연구의 전이학습 조건에서 상대적으로 낮은 학습률이 안정적인 성능 확보에 유리하게 작용했음을 의미한다. Fig. 4에서도 에포크 수 15와 배치 크기 32를 고정한 조건에서 학습률이 감소할수록 EfficientNet, MobileNet 및 ResNet의 Test Macro F1가 증가하는 경향이 확인된다.

에포크 수 변화의 영향은 모델별로 상이하였다. ResNet은 에포크 수 15에서 0.9386, 에포크 수 30에서 0.9540으로 향상되었고, MobileNet은 0.9514에서 0.9538로 소폭 증가하였다. 반면 EfficientNet은 에포크 수 15와 30에서 각각 0.9545와 0.9544로 거의 차이가 없었다. 따라서 에포크 수 증가는 일부 모델에서 성능 향상에 기여할 수 있으나, 본 연구 범위에서는 모든 모델에서 일관된 성능 개선을 보장하지는 않는 것으로 판단된다.

배치 크기 변화에 따른 성능 차이는 학습률 변화에 비해 상대적으로 제한적이었다. EfficientNet과 ResNet은 배치 크기 16 조건에서 각각 0.9586과 0.9425로 배치 크기 32 조건보다 소폭 높은 성능을 보였으나, MobileNet은 배치 크기 32 조건에서 0.9514로 배치 크기 16 조건의 0.9429보다 높게 나타났다. 따라서 배치 크기의 영향은 모델 구조에 따라 달라질 수 있으며, 본 연구 조건에서는 학습률에 비해 상대적으로 보조적인 영향으로 해석된다.

GoogLeNet은 다른 모델과 달리 하이퍼파라미터 변화에 매우 민감한 경향을 보였다. 학습률 0.001 및 0.0003 조건에서는 Test Macro F1가 모두 0.1667로 저하되었으며, 학습률 0.0001 조건에서는 평균 성능이 0.6604로 증가하였으나 표준편차가 0.4276으로 매우 크게 나타났다. 또한 에포크 수 30 조건에서도 평균 성능이 0.4729로 감소하고 표준편차가 0.3429로 높게 나타났다. 이는 GoogLeNet이 본 데이터셋 및 학습 조건에서 학습률과 학습 반복 조건에 민감하게 반응하며, 동일 조건에서도 반복 학습 안정성이 낮을 수 있음을 시사한다.

종합하면, baseline 조건을 고정한 OFAT 분석을 통해 기존 전체조합 평균 분석에서 분리하기 어려웠던 하이퍼파라미터별 영향을 보다 명확히 확인할 수 있었다. 본 연구 조건에서는 학습률이 성능 변화에 가장 큰 영향을 미쳤으며, 에포크 수 및 배치 크기의 영향은 모델별로 차이를 보였으나 상대적으로 제한적이었다. 특히 GoogLeNet의 낮은 평균 성능과 높은 변동성은 단순히 데이터 규모의 영향만으로 해석하기보다는, 하이퍼파라미터 민감도와 반복 학습 안정성 측면에서 함께 검토할 필요가 있다.

Table 6 OFAT-based hyperparameter analysis

Model

Learning rate effect

Epoch effect

Batch size effect

EfficientNet

0.9150→0.9545 (+0.0395)

0.9545→0.9544 (-0.0001)

0.9586→0.9545 (-0.0041)

MobileNet

0.9157→0.9514 (+0.0357)

0.9514→0.9538 (+0.0024)

0.9429→0.9514 (+0.0085)

ResNet

0.8892→0.9386 (+0.0494)

0.9386→0.9540 (+0.0154)

0.9425→0.9386 (-0.0039)

GoogLeNet

0.1667→0.6604 (+0.4937)

0.6604→0.4729 (-0.1875)

0.3523→0.6604 (+0.3081)

Note: Learning rate effect indicates the change in Test Macro F1-score from learning rate 0.001 to 0.0001 under fixed epoch 15 and batch size 32. Epoch effect indicates the change from epoch 15 to 30 under fixed learning rate 0.0001 and batch size 32. Batch size effect indicates the change from batch size 16 to 32 under fixed learning rate 0.0001 and epoch 15.

Fig. 4 Effect of learning rate on Test Macro F1-score under fixed epoch and batch size conditions

../../Resources/ksm/jksmi.2026.30.4.17/fig4.png

3.5 계산 효율성 및 실무 적용성 평가

본 연구에서는 고정 조건에서의 10회 반복 학습 결과를 바탕으로 평균 성능, 반복 학습 안정성, 학습 시간, 추론 시간 및 파라미터 수를 종합적으로 고려하여 CNN 모델의 실무 적용 가능성을 평가하였다 (Table 7). EfficientNet은 평균 Macro F1 0.9566과 표준편차 0.0022로 가장 높은 성능과 가장 낮은 변동성을 보였으나, 평균 학습 시간은 344.69 min/run으로 가장 길고 추론 시간도 17.40 ms/image로 가장 크게 나타났다. MobileNet은 평균 Macro F1 0.9518, 표준편차 0.0061을 보여 EfficientNet보다 평균 성능은 다소 낮았으나, 학습 시간은 81.92 min/run으로 상대적으로 짧고 파라미터 수가 3.4M으로 작아 성능과 계산 효율성의 균형이 우수하였다.

ResNet은 비교적 안정적인 분류 성능과 빠른 추론 속도를 보였으나, 파라미터 수가 25.6M으로 가장 커 모델 경량화 측면에서는 불리하였다. 또한 MobileNet 대비 약 7.5배 많은 파라미터와 2배 이상의 학습 시간이 요구되었음에도 평균 Macro F1 향상은 크지 않아, 성능 대비 계산 효율성 측면의 우수성은 크지 않은 것으로 판단된다. 특히 추론 속도는 MobileNet보다 빠르게 나타났으나, 파라미터 수와 학습 시간을 종합적으로 고려할 때 전체적인 경량성은 MobileNet이 더 우수한 것으로 평가된다. GoogLeNet은 학습 시간 31.14 min/run 및 추론 시간 6.28 ms/image로 가장 빠른 수준을 보였으나, 평균 Macro F1이 0.4134이고 표준편차가 0.3417로 크게 나타나 반복 학습 안정성과 실제 적용성 측면에서는 제한적인 것으로 판단된다.

Fig. 5는 평균 성능과 추론 시간을 함께 비교한 결과로, EfficientNet은 가장 높은 분류 성능 영역에 위치하고, MobileNet은 성능 저하를 최소화하면서 계산 비용을 줄인 균형적 위치에 분포하였다. 높은 분류 성능이 우선되는 서버 기반 사후 분석 환경에서는 EfficientNet이 적합하며, 제한된 연산 자원을 고려한 현장 점검 이미지의 일괄 분류 환경에서는 MobileNet이 보다 적합할 수 있다. 한편 데이터 규모 증가에 따른 성능 향상 폭은 EfficientNet, MobileNet, ResNet에서 각각 0.0292, 0.0450, 0.0492로 나타났으나, 추가 데이터 확보에 따른 성능 개선 폭이 제한적인 경우에는 학습 시간, 추론 시간 및 파라미터 수를 함께 고려하여 성능 향상과 계산 비용 간의 trade-off를 검토할 필요가 있다. 다만 본 연구의 학습 시간과 추론 시간은 RTX A5000 GPU 기반 분석 환경에서 측정된 결과이므로, 모바일 CPU, 임베디드 장치 또는 드론 탑재 장비에서의 실시간 성능을 직접 보장하는 것은 아니며, 모델 간 상대적 계산 효율성을 비교하기 위한 자료로 해석할 필요가 있다.

Table 7 Overall evaluation of CNN models

Model

Macro F1 (mean±std)

Train time (min/run)

Inference time (ms/image)

Parameters (M)

EfficientNet

0.9566±0.0022

344.69

17.40

5.3

MobileNet

0.9518±0.0061

81.92

10.67

3.4

ResNet

0.9434±0.0057

238.50

7.43

25.6

GoogLeNet

0.4134±0.3417

31.14

6.28

7.0

Fig. 5 Performance–Efficiency comparison of models

../../Resources/ksm/jksmi.2026.30.4.17/fig5.png

4. 결 론

본 연구에서는 콘크리트 구조물 손상 이미지 분류를 대상으로 네 가지 CNN 모델의 반복 학습 기반 분류 성능 및 학습 안정성, 데이터 규모 및 하이퍼파라미터 영향, 계산 효율성을 종합적으로 비교⋅평가하였다. 단일 실행 결과 중심의 기존 평가 한계를 보완하기 위하여 고정된 학습 조건에서 random seed만 변경한 10회 반복 학습을 수행하고, 평균 성능과 변동성을 함께 분석하였다. 주요 결론은 다음과 같다.

1) 고정된 학습 조건에서 random seed만 변경한 10회 반복 학습 결과, EfficientNet은 Test Macro F1 0.9566±0.0022로 가장 높은 평균 성능과 가장 낮은 변동성을 보여 반복 학습 안정성이 가장 우수한 모델로 평가되었다. MobileNet과 ResNet은 각각 0.9518±0.0061 및 0.9434±0.0057로 비교적 안정적인 성능을 보였으며, GoogLeNet은 0.4134±0.3417로 seed 변화에 따른 성능 변동성이 크게 나타났다.

2) 일부 모델은 최고 성능과 평균 성능에서 상대적 순위 차이가 나타났다. 이는 단일 실행 결과만으로 모델을 평가할 경우 실제 대표 성능과 다른 결론에 도달할 수 있음을 보여주며, 반복 학습 기반 평균 성능과 변동성을 함께 고려할 필요가 있음을 나타낸다.

3) 데이터 규모 증가에 따라 EfficientNet, MobileNet, ResNet은 평균 성능이 향상되고 변동성은 감소하는 경향을 보였다. 반면 GoogLeNet은 데이터 규모 증가에 따른 성능 향상 효과가 확인되지 않았으며, 본 분석 조건에서는 평균 성능 감소와 변동성 증가가 나타났다. 다만 이는 GoogLeNet 구조 자체의 일반적 한계라기보다는 본 연구의 데이터 구성, 전이학습 방식 및 하이퍼파라미터 설정 범위에서 나타난 모델별 민감도 차이로 해석된다.

4) 하이퍼파라미터 영향 분석 결과, 본 연구 조건에서는 초기 학습률이 성능 변화에 가장 큰 영향을 미쳤다. EfficientNet, MobileNet 및 ResNet은 학습률이 0.001에서 0.0001로 감소할수록 Test Macro F1가 향상되는 경향을 보였으며, 에포크 수 및 배치 크기의 영향은 모델별로 상이하였으나 상대적으로 제한적이었다. GoogLeNet은 학습률 및 seed 변화에 민감하게 반응하여 본 분석 조건에서 반복 학습 안정성이 낮게 나타났다.

5) 계산 효율성 측면에서 MobileNet은 비교적 높은 성능과 우수한 경량성을 동시에 보여 실무 적용성이 높았으며, EfficientNet은 높은 분류 성능이 요구되는 환경에 적합한 것으로 판단된다.

CNN 기반 구조물 손상 분류에서 모델 선택은 최고 분류 성능뿐 아니라, 반복 학습 기반 안정성과 계산 효율성을 함께 고려하여 이루어질 필요가 있다.

또한 본 연구 결과는 CNN 기반 손상 분류 모델 평가 시 단일 실행 최고 성능만으로는 모델의 대표 성능과 재현성을 충분히 판단하기 어렵다는 점을 보여준다. 따라서 향후 관련 연구에서는 반복 학습을 통해 평균 성능과 변동성을 함께 제시하는 평가 방식이 보다 신뢰성 높은 모델 비교를 위한 방법으로 활용될 필요가 있다. 특히 GoogLeNet과 같이 초기 학습률에 대한 민감도가 크게 나타난 모델을 대상으로 Adam과 SGD 등 optimizer 조건, 학습률 스케줄링 및 단계적 미세조정 전략이 성능 변동성 완화에 미치는 영향을 추가로 검토할 필요가 있다.

감사의 글

이 논문은 2026년 정부(교육부)의 재원으로 한국연구재단의 지원을 받아 수행된 연구입니다(RS-2021-NR060132).

이 연구는 과학기술정보통신부의 재원으로 한국지능정보사회진흥원의 지원을 받아 구축된 “건물 균열 탐지 이미지”를 활용하여 수행된 연구입니다. 본 연구에 활용된 데이터는 AI 허브(aihub.or.kr)에서 다운로드 받으실 수 있습니다.

References

1 
Cha, Y.J., Choi, W.R., Büyüköztürk, O. (2017), Deep learning-based crack damage detection using convolutional neural networks, Computer-Aided Civil and Infrastructure Engineering, 32(5), 361-378.DOI
2 
He, K., Zhang, X., Ren, S., Sun, J. (2016), Deep residual learning for image recognition, Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 770-778.Google Search
3 
Henderson, P., Islam, R., Bachman, P., Pineau, J., Precup, D., Meger, D. (2018), Deep reinforcement learning that matters, Proceedings of the AAAI Conference on Artificial Intelligence, 32(1), 3207-3214.Google Search
4 
Howard, A. G., Zhu, M., Chen, B., Kalenichenko, D., Wang, W., Weyand, T., Andreetto, M., Adam, H. (2017), MobileNets: Efficient convolutional neural networks for mobile vision applications, arXiv preprint arXiv:1704.04861Google Search
5 
Kim, I.S., Yang, E.I. (2026), Effect of data size and hyperparameter settings on classification performance and computational efficiency in CNN-Based concrete damage classification, Journal of the Korea Institute for Structural Maintenance and Inspection, 30(2), 1-9. (in Korean)Google Search
6 
Kim, I.S., Choi, S.Y., Yang, E.I. (2025), Analysis of performance and interpretability in CNN-based concrete damage classification using Grad-CAM, Journal of the Korea Institute for Structural Maintenance and Inspection, 29(6), 110-118. (in Korean)Google Search
7 
Kim, I.S., Choi, S.Y., Yang, E.I. (2025), Concrete damage classification using CNN models with small-scale images: performance analysis and comparison, Journal of the Korea Institute for Structural Maintenance and Inspection, 29(6), 30-38. (in Korean)Google Search
8 
Krizhevsky, A., Sutskever, I., Hinton, G. E. (2012), ImageNet classification with deep convolutional neural networks, Advances in Neural Information Processing Systems (NeurIPS), 25, 1097-1105.Google Search
9 
Recht, B., Roelofs, R., Schmidt, L., Shankar, V. (2019), Do ImageNet classifiers generalize to ImageNet?, Proceedings of the 36th International Conference on Machine Learning (ICML), 5389-5400.Google Search
10 
Roy, S., Yogi, B., Majumdar, R., Ghosh, P., Das, S.K. (2025), Deep learning‑based crack detection and prediction for structural health monitoring, Discover Applied Sciences, 7, 674DOI
11 
Shin, H.K. (2025), A comparative study on the performance and inference speed of deep learning models for structure crack detection, Journal of the Korea Institute for Structural Maintenance and Inspection, 29(6), 199-206. (in Korean)Google Search
12 
Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A. (2015), Going deeper with convolutions, Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 1-9.Google Search
13 
Tan, M., Le, Q. (2019), EfficientNet: Rethinking model scaling for convolutional neural networks, Proceedings of the 36th International Conference on Machine Learning (ICML), 6105-6114.Google Search
14 
Zhang, L., Yang, F., Zhang, Y. D., Zhu, Y. J. (2016), Road crack detection using deep convolutional neural network, IEEE International Conference on Image Processing (ICIP), 3708-3712.Google Search