김일순
(Il Sun Kim)
1
양은익
(Eun Ik Yang)
2,*
-
정회원, 강원대학교, 스마트인프라연구소, 연구교수
-
정회원, 강원대학교, 건설환경공학부, 교수, 교신저자
Copyright Ⓒ 2026 by The Korea Institute for Structural Maintenance and Inspection
Keywords
Concrete damage classification, Convolutional neural network, Initial learning rate, Optimizer, Repeated training stability
핵심용어
콘크리트 손상 분류, 합성곱 신경망, 초기 학습률, 최적화 알고리즘, 반복 학습 안정성
1. 서 론
콘크리트 구조물은 공용 기간이 증가함에 따라 균열(crack), 백태(efflorescence), 철근 노출(rebar exposure) 등 다양한
표면 손상이 발생할 수 있으며, 이러한 손상은 구조물의 내구성, 사용성 및 유지관리 계획 수립에 중요한 영향을 미친다. 기존의 콘크리트 구조물 점검은
주로 육안조사와 전문가 판단에 의존해 왔으나, 이러한 방식은 조사자의 경험, 접근성 및 판단 기준에 따라 결과가 달라질 수 있다. 이에 따라 최근에는
이미지 기반 손상 탐지 및 분류 기술을 활용하여 콘크리트 구조물의 상태를 보다 객관적이고 효율적으로 평가하려는 연구가 활발히 수행되고 있다(Ali et al., 2021;
Cha et al., 2017;
Kim and Cho, 2020;
Yuan et al., 2024).
딥러닝 기반 영상 분석 기법은 손상 특징을 수작업으로 정의하지 않고 이미지로부터 자동으로 특징을 학습할 수 있다는 점에서 콘크리트 손상 분류 분야에
널리 적용되고 있다. CNN 기반 콘크리트 손상 분석 연구는 균열 탐지를 중심으로 발전해 왔으며, 최근에는 박리, 표면 결함 및 다중 손상 유형으로
분석 대상이 확대되고 있다(Diniz et al., 2023;
Kim and Cho, 2020;
Mazni et al., 2024;
Roy et al., 2025). 또한 전이학습 기반 CNN 모델은 제한된 손상 이미지 조건에서도 비교적 높은 분류 성능을 확보할 수 있는 방법으로 활용되고 있으며, 다양한 CNN
모델을 적용한 콘크리트 균열 및 손상 분류 연구가 수행되어 왔다(Islam et al., 2022;
Kim et al., 2025a;
Kim et al., 2025b;
Kim and Yang, 2026;
Philip et al., 2023;
Su and Wang, 2020).
그러나 기존 연구의 상당수는 특정 CNN 모델의 최종 정확도나 평균 성능을 중심으로 모델을 비교하는 데 초점을 두고 있으며, 학습 조건 변화에 따른
반복 안정성이나 특정 조건에서의 성능 저하 가능성을 충분히 검토하지 못한 경우가 많다. 딥러닝 모델의 학습 결과는 초기 가중치, 미니배치 구성 순서,
데이터 증강 과정 및 GPU 연산 특성 등 확률적 요인의 영향을 받을 수 있으며, 동일한 데이터와 하이퍼파라미터 조건에서도 난수 시드(random
seed)에 따라 성능 차이가 발생할 수 있다(Picard, 2021). Henderson et al.(2018)은 딥러닝 기반 성능 평가에서 반복 실험과 재현성 확보의 중요성을 지적하였으며, Recht et al.(2019)은 이미지 분류 모델의 성능 평가에서 데이터 및 평가 조건에 따른 일반화 성능 차이를 검토하였다. 따라서 단일 학습 결과만을 기준으로 모델 또는 학습
조건의 우수성을 판단할 경우, 특정 반복 학습 결과가 전체 성능으로 과대 또는 과소 해석될 가능성이 있다.
CNN 학습 성능은 모델 구조뿐 아니라 최적화 알고리즘(optimizer)과 학습률 조건에 의해서도 영향을 받을 수 있다. Optimizer와 초기
학습률은 가중치 갱신 과정, 수렴 특성 및 fine-tuning 안정성에 영향을 줄 수 있으며, optimizer 간 경험적 비교 결과는 모델 구조와
학습 조건에 따라 달라질 수 있다(Choi et al., 2019;
Wilson et al., 2017). 특히 실무 적용에서는 단일 학습 실행(trial)에서의 최고 성능보다 여러 학습 조건에서 안정적인 성능을 유지하는지, 특정 손상 유형에서 성능
저하가 발생하지 않는지, 학습 및 추론에 필요한 계산 시간이 적절한지를 함께 고려할 필요가 있다.
Kim and Yang(2026)은 CNN 기반 콘크리트 손상 분류에서 데이터 크기와 하이퍼파라미터 설정이 분류 성능 및 계산 효율성에 미치는 영향을 분석하였다. 반면 본 연구는
고정된 데이터 분할에서 모델–optimizer–초기 학습률의 전체 조합을 10개 난수 시드로 반복 평가하고, 평균 성능뿐 아니라 반복 변동성, 최소
성능 및 클래스별 성능 저하를 정량적으로 분석하였다는 점에서 차이가 있다.
이에 본 연구에서는 4개 CNN 모델, 3개 optimizer 및 3개 초기 학습률을 조합하고, 각 조합에서 난수 시드를 10회 변경하여 총 360회의
반복 학습을 수행하였다. 평균 Test Macro F1-score뿐 아니라 표준편차, 최소값, 변동계수, 손상 유형별 성능 및 계산 효율성을 함께
평가하였다.
본 연구의 차별성은 동일한 콘크리트 손상 데이터와 고정된 데이터 분할 조건에서 모델–optimizer–초기 학습률의 전 조합을 반복 평가함으로써,
단일 평균 성능만으로는 확인하기 어려운 조합별 반복 변동성과 최소 성능의 차이를 정량적으로 제시한 데 있다.
본 연구의 목적은 평균 성능이 유사한 조건에서도 모델–optimizer–초기 학습률 조합과 난수 시드에 따라 성능 저하가 발생할 수 있음을 확인하고,
반복 안정성과 최소 성능을 고려한 학습 조건 선정의 기초자료를 제시하는 데 있다. 본 연구에서 확인된 성능 경향은 적용한 데이터셋, 이미지 선별 기준
및 학습 조건에 한정하여 상대적으로 해석하였다.
2. 분석 방법
2.1 사용 프로그램 및 분석 환경
본 연구의 CNN 기반 콘크리트 손상 이미지 분류 분석은 MATLAB R2026a 환경에서 수행하였다. 딥러닝 모델의 구축, 학습, 검증 및 시험
성능 평가는 MATLAB Deep Learning Toolbox를 이용하였으며, 이미지 전처리, 학습 결과 저장 및 성능 지표 산정은 MATLAB
기반 분석 코드로 수행하였다. 모든 분석은 동일한 소프트웨어 및 하드웨어 환경에서 수행하였으며, 세부 하드웨어 사양은 Table 1에 제시하였다.
Table 1 Hardware specifications used in the analysis
|
Component
|
Specification
|
|
CPU
|
Intel Core i9-14900KF
|
|
RAM
|
DDR5 64 GB (32 GB×2)
|
|
GPU
|
NVIDIA RTX A5000 24 GB
|
|
Storage
|
SSD 2 TB
|
2.2 데이터셋 구성 및 전처리
본 연구에서는 AI-Hub의 콘크리트 구조물 손상 이미지 데이터를 기반으로 분석용 데이터셋을 구성하였다. 해당 데이터셋은 교량, 건축물 등 실제 콘크리트
구조물을 대상으로 취득된 이미지로 구성되어 촬영 거리, 조도, 표면 질감 및 배경 조건의 변동성을 포함한다. 본 연구에서는 각 손상 유형별 원시 이미지
중 균열, 백태 및 철근 노출 손상이 육안으로 비교적 명확하게 확인되는 이미지를 각각 3,000장씩 선별하여 총 9,000장의 데이터셋을 구성하였다.
이러한 선별은 모델 및 학습 조건을 동일한 이미지 품질 조건에서 비교하기 위한 것이지만, 손상 경계가 불명확하거나 원거리에서 촬영된 이미지 등 실제
현장의 어려운 사례가 상대적으로 적게 포함되었을 수 있다. 따라서 본 연구에서 산정된 절대적인 분류 성능은 실제 현장 조건보다 높게 나타났을 가능성이
있으며, 결과는 본 연구에서 구성한 데이터셋 내의 상대적 비교 결과로 해석하였다.
본 연구에서는 콘크리트 구조물 표면에서 발생하는 대표적인 손상 유형을 대상으로 CNN 기반 이미지 분류 분석을 수행하였다. 분류 대상 손상 유형은
균열, 백태, 철근 노출의 3개 클래스로 구성하였다. 각 이미지는 균열, 백태 및 철근 노출 중 대표 손상 유형에 따라 하나의 클래스로 분류하였으므로,
실제 구조물에서 여러 손상이 동시에 발생하는 복합 손상 특성은 직접 반영하지 않았다. 전체 데이터셋은 학습, 검증 및 시험 데이터로 분할하여 사용하였다.
데이터 분할은 학습 데이터 6,300장, 검증 데이터 1,350장, 시험 데이터 1,350장으로 구성하였다. 시험 데이터는 각 클래스별로 450장씩
동일하게 구성하여 클래스 불균형에 따른 평가 편향을 최소화하였다. 학습 데이터는 CNN 모델의 가중치 갱신에 사용하였고, 검증 데이터는 학습 과정에서
모델의 일반화 성능을 확인하는 데 사용하였다. 시험 데이터는 학습에 사용하지 않은 독립 데이터로 구성하여 최종 분류 성능 평가에 활용하였다.
본 연구에서 모든 모델에는 동일한 학습, 검증 및 시험 데이터 구성을 적용하여 모델 구조, optimizer 및 학습률 조건에 따른 성능 차이를 동일한
데이터 조건에서 비교하였다.
본 연구에 사용된 원본 이미지는 640×640 크기로 padding 처리된 상태에서 저장되었다. 이후 CNN 모델 입력 조건에 맞추어 224×224
크기로 조정하여 사용하였다. 학습 데이터에는 모델의 일반화 성능을 높이기 위하여 데이터 증강을 적용하였다. 증강 조건은 ±10° 범위의 무작위 회전,
±10 pixel 범위의 x축 및 y축 평행이동, 수평 반전을 포함하였다. 검증 및 시험 데이터에는 데이터 증강을 적용하지 않았으며, 학습 데이터와
동일하게 입력 크기 조정만 수행하였다. 사용된 이미지의 예시는 Fig. 1에 나타내었다.
Fig. 1 Example images of concrete damage
2.3 CNN 모델
콘크리트 손상 이미지 분류 성능을 비교하기 위하여 4개의 대표적인 전이학습 기반 CNN 모델을 사용하였다. 분석 대상 모델은 EfficientNet-B0,
GoogLeNet, MobileNetV2, ResNet-50이다. 해당 모델들은 이미지 분류 분야에서 널리 활용되는 구조로, 모델 복잡도, 합성곱
구조, 잔차 연결 여부 및 경량화 특성이 서로 다르기 때문에 콘크리트 손상 분류 조건에서 모델 구조별 성능 차이를 비교하기에 적합하다.
EfficientNet-B0는 복합 스케일링(compound scaling)을 기반으로 모델의 깊이, 너비 및 입력 해상도를 균형 있게 확장하는 구조이다(Tan and Le, 2019). ResNet-50은 잔차 연결(residual connection)을 통해 깊은 신경망의 학습 안정성을 개선한 모델이다(He et al., 2016). GoogLeNet은 Inception 모듈을 기반으로 다양한 크기의 합성곱 연산을 병렬적으로 적용하는 구조이며(Szegedy et al., 2015), MobileNetV2는 depthwise separable convolution과 inverted residual 구조를 활용한 경량 CNN 모델이다(Sandler et al., 2018).
각 CNN 모델의 최종 분류 계층을 본 연구의 손상 유형 수에 맞게 수정한 후, 동일한 데이터셋에 대해 전이학습을 수행하였다. 모든 모델은 동일한
데이터셋과 동일한 학습 조건에서 비교되도록 설정하였다.
2.4 Optimizer 및 학습률 조건
본 연구에서는 CNN 학습 성능에 영향을 미치는 주요 학습 조건으로 optimizer와 초기 학습률을 설정하였다. Optimizer는 Adam, RMSProp,
SGDM의 세 가지를 사용하였다. Adam은 adaptive moment estimation을 기반으로 각 파라미터의 학습률을 적응적으로 조정하는
방식이며(Kingma and Ba, 2015), RMSProp은 gradient 제곱 평균을 이용하여 파라미터별 학습률을 조정하는 방식이다. SGDM은 확률적 경사하강법에 momentum 항을
추가하여 진동을 완화하고 수렴 안정성을 개선하는 방식이다(Ruder, 2016).
초기 학습률은 0.001, 0.0003, 0.0001의 3개 수준으로 설정하였다. 이는 전이학습 기반 CNN fine-tuning 조건에서 과도한
가중치 변화로 인한 성능 저하를 방지하면서도 optimizer별 수렴 특성을 비교할 수 있도록 설정한 값이다. 에포크 수는 15로 고정하였고, 미니배치
크기는 32로 설정하였다. 또한 L2 정규화(L2 regularization)는 0.0001로 적용하였으며, 학습 중 조기 종료는 적용하지 않았다.
검증은 매 epoch마다 수행하였으며, 최종 시험 성능은 검증 성능이 가장 높은 시점이 아니라 15번째 epoch 종료 시점의 네트워크를 이용하여
산정하였다. 15 epoch는 전체 조합에 동일한 학습 예산을 적용하기 위한 조건이며, 모든 조합의 완전한 수렴을 보장하는 값은 아니다. 이에 대표적인
성능 저하 조합인 MobileNetV2–RMSProp–0.001에 대해서는 최대 epoch를 30으로 설정하여 별도 재학습하고, 학습 로그와 클래스별
혼동 결과를 이용하여 저성능 원인을 검토하였다.
본 연구의 전체 학습 조합은 CNN 모델 4개, optimizer 3개, 초기 학습률 3개 및 난수 시드 10개로 구성하였다. 따라서 총 학습 횟수는
4 × 3 × 3 × 10 = 360회이다. 즉, 본 연구에서는 총 360회의 CNN 학습을 수행하고, 각 조건별 반복 학습 결과를 이용하여 평균
성능과 학습 안정성을 평가하였다. 전체 분석 조건은 Table 2에 정리하였다.
Table 2 Training conditions and analysis variables
|
Variable
|
Level
|
|
CNN Model
|
EfficientNet-B0, GoogLeNet, MobileNetV2, ResNet-50
|
|
Optimizer
|
Adam, RMSProp, SGDM
|
|
Initial learning rate
|
0.001, 0.0003, 0.0001
|
|
Random seed
|
1-10
|
|
Max epochs
|
15
|
|
Mini-batch size
|
32
|
|
Number of classes
|
3
|
|
Dataset size
|
9,000 images (each 3,000 images)
|
|
Split ratio
|
70:15:15
|
|
L2 regularization
|
0.0001
|
2.5 반복 학습 기반 분석 설계
CNN 모델의 학습 결과는 초기 가중치, 미니배치 구성 순서, 데이터 증강 과정 및 GPU 연산 특성 등에 의해 동일 조건에서도 일부 변동될 수 있다.
따라서 단일 학습 결과만을 이용하여 모델 또는 optimizer의 우수성을 판단할 경우, 특정 난수 시드 조건에 의존한 결과가 전체 성능으로 해석될
가능성이 있다. 본 연구에서는 이러한 문제를 줄이기 위해 각 모델, optimizer 및 학습률 조합에 대해 난수 시드를 1부터 10까지 변경하면서
반복 학습을 수행하였다.
반복 학습에서는 데이터 분할 조건과 주요 학습 조건을 동일하게 유지하고, 난수 시드 변화에 따른 성능 변동을 분석하였다. 이를 통해 평균 성능뿐 아니라
표준편차, 최소값, 최대값 및 변동계수를 함께 산정하여 학습 조건별 안정성을 평가하였다. 본 연구에서 반복 학습 안정성은 특정 조합이 여러 난수 시드
조건에서 일관된 성능을 유지하는 정도로 정의하였다. 평균 성능이 높더라도 반복 결과의 표준편차가 크거나 특정 난수 시드에서 성능 저하가 크게 발생하는
경우, 해당 조합은 안정성이 낮은 것으로 판단하였다.
모든 학습 실행에서 학습, 검증 및 시험 데이터 분할은 동일하게 유지하였고, 반복 학습에서는 난수 시드만 변경하였다. 이를 통해 데이터 분할 차이에
따른 영향을 배제하고, 동일 학습 조건 내에서 난수 시드 변화에 따른 성능 변동성을 비교하였다.
분석 결과는 전체 학습 실행을 모델별, optimizer별, 학습률별 및 모델–optimizer–학습률 조합별로 집계하여 비교하였다. 이를 통해 평균
성능뿐 아니라 난수 시드 변화에 따른 반복 학습 안정성, 특정 조합에서의 성능 저하 가능성, 클래스별 F1-score 및 계산 효율성을 함께 검토하였다.
2.6 평가 지표
분류 성능 평가 지표로는 정확도(accuracy)와 macro F1-score를 사용하였다. 정확도는 전체 시험 이미지 중 올바르게 분류된 이미지의
비율을 의미한다. 그러나 정확도는 클래스별 성능 차이를 충분히 반영하지 못할 수 있으므로, 본 연구에서는 각 클래스의 F1-score를 동일한 가중치로
평균한 macro F1-score를 주요 평가 지표로 사용하였다.
각 클래스 i에 대한 F1-score는 정밀도와 재현율의 조화 평균으로 정의되며, Macro F1-score는 다음 식 (1)과 같이 계산된다.
여기서 $P_i$는 클래스 $i$의 정밀도, $R_i$는 클래스 $i$의 재현율, $C$는 클래스 수를 의미한다.
계산 효율성 평가는 학습 시간(training time)과 시험 이미지 1장당 평균 추론 시간(test inference time per image)을
기준으로 수행하였다.
2.7 안정성 및 계산 효율성 분석
반복 학습 안정성을 정량적으로 비교하기 위하여 각 조건별 test macro F1-score의 변동계수(coefficient of variation,
CV)를 산정하였다. 변동계수는 평균 성능 대비 표준편차의 상대적 크기를 나타내며, 다음 식 (2)와 같이 계산하였다.
여기서 $\sigma$는 동일 조건에서 10회 반복 학습한 test macro F1-score의 표준편차이고, $\mu$는 해당 조건의 평균 test
macro F1-score를 의미한다. CV 값이 작을수록 난수 시드 변화에 따른 성능 변동이 작아 학습 안정성이 높은 것으로 해석하였다.
Optimizer 및 초기 학습률 조건에 따른 Test Macro F1-score의 차이를 검토하기 위하여 Kruskal–Wallis 검정을 수행하였다.
전체 조건 간 차이가 통계적으로 유의한 경우에는 Dunn 사후검정을 수행하고, 다중 비교에 따른 제1종 오류를 제어하기 위하여 Holm 방법으로 p-value를
보정하였다. 통계적 유의수준은 0.05로 설정하였다. 또한 각 optimizer 및 초기 학습률 조건의 평균 Test Macro F1-score에
대한 95% 신뢰구간을 산정하였다(Demšar, 2006).
또한 모델별 추론 효율성을 비교하기 위하여 시험 이미지 1장당 평균 추론 시간을 산정하였다. 이미지 1장당 추론 시간은 전체 시험 데이터에 대한 추론
시간을 시험 이미지 수로 나누어 식 (3)과 같이 계산하였다.
여기서 $T_{image}$는 시험 이미지 1장당 평균 추론 시간, $T_{test}$는 전체 시험 데이터에 대한 총 추론 시간, $N_{test}$는
시험 이미지 수를 의미한다.
위 지표를 바탕으로 3장에서는 모델별, optimizer별, 학습률별 및 조합별 성능과 안정성을 비교하였다.
3. 분석 결과 및 고찰
3.1 전체 분석 결과
본 연구에서는 CNN 모델, optimizer 및 초기 학습률 조건에 따른 콘크리트 손상 이미지 분류 성능을 비교하기 위하여 총 360회의 반복 학습을
수행하였다. 분석 결과, 대부분의 조건에서 Test Macro F1-score가 0.94 내외의 높은 수준으로 나타났다. 이는 본 연구에서 사용한
전이학습 기반 CNN 모델들이 전체 평균 기준으로 콘크리트 손상 이미지에 대해 높은 분류 성능을 보였음을 의미한다.
다만 모델 및 optimizer 간 평균 성능 차이는 크지 않았으므로, 단일 평균 성능만으로 특정 모델 또는 optimizer의 우수성을 판단하기는
어렵다. 따라서 이후 절에서는 평균 성능과 함께 반복 학습 안정성, 최소 성능, 학습률 조건 및 계산 효율성을 종합적으로 검토하였다.
Table 3은 CNN 모델별 전체 성능을 나타낸 것이다. 각 모델별 결과는 3개 optimizer, 3개 학습률 및 10개 난수 시드 조건에서 수행한 총 90회의
학습 결과를 집계한 것이다. 평균 Test Macro F1-score는 EfficientNet-B0가 0.9463으로 가장 높았고, ResNet-50은
0.9455, MobileNetV2는 0.9432, GoogLeNet은 0.9431로 나타났다. 네 모델 모두 0.94 이상의 평균 Test Macro
F1-score를 보였으며, 최고 평균값과 최저 평균값의 차이는 약 0.0032로 크지 않았다. 다만 MobileNetV2는 일부 조건에서 낮은 최소값이
나타나 표준편차가 상대적으로 크게 증가하였다.
이 결과는 모델 선정 시 평균 성능뿐 아니라 반복 학습 안정성, 성능 저하 가능성 및 계산 효율성을 함께 고려해야 함을 보여준다.
Table 3 Overall classification performance by CNN model
|
Model
|
E.Net
|
G.Net
|
M.Net
|
R.Net
|
|
No. of trials
|
90
|
90
|
90
|
90
|
|
Test Macro F1
|
0.9463
|
0.9431
|
0.9432
|
0.9455
|
|
Std
|
0.0069
|
0.0131
|
0.0359
|
0.0086
|
|
Min
|
0.9256
|
0.8662
|
0.6105
|
0.9054
|
|
Max
|
0.9563
|
0.9599
|
0.9599
|
0.9600
|
|
Test Accuracy
|
0.9463
|
0.9432
|
0.9438
|
0.9455
|
|
Mean training time/run (s)
|
1387.28
|
282.34
|
429.76
|
510.79
|
|
Inference time/image (s)
|
0.0018
|
0.0011
|
0.0011
|
0.0013
|
* G.Net: GoogLeNet, R.Net: ResNet-50, M.Net: MobileNetV2, E.Net: EfficientNet-B0
* Training time is the mean per 15-epoch run over 90 runs/model (3 optimizers × 3
learning rates × 10 seeds).
3.2 Optimizer별 성능 및 안정성
Table 4는 optimizer 및 초기 학습률 조건별 전체 성능을 함께 정리한 것이다. 먼저 optimizer별 결과를 보면, 각 optimizer는 4개
CNN 모델, 3개 학습률 및 10개 난수 시드 결과를 포함하므로 optimizer별 총 학습 실행 수는 120회이다.
SGDM은 평균 Test Macro F1-score가 0.9471로 가장 높았고, 표준편차도 0.0056으로 가장 작았다. Adam은 평균 Test
Macro F1-score가 0.9455로 SGDM과 유사한 수준을 보였으며, 표준편차도 비교적 낮게 나타났다. 반면 RMSProp은 평균 Test
Macro F1-score가 0.9410으로 세 optimizer 중 가장 낮았고, 표준편차는 0.0329로 가장 크게 나타났다.
다만 optimizer 간 평균 성능 차이는 전반적으로 크지 않았다. SGDM과 Adam의 평균 Test Macro F1-score 차이는 약 0.0016
수준이며, 이는 실무적으로 큰 차이라고 보기 어렵다. 따라서 본 연구 결과를 통해 SGDM이 절대적으로 우수하다고 단정하기보다는, 본 분석 조건에서
SGDM이 평균 성능과 반복 안정성 측면에서 상대적으로 안정적인 경향을 보였다고 해석하는 것이 적절하다.
RMSProp의 경우 평균 성능이 상대적으로 낮았으며, 이는 특정 조건에서 성능 저하가 크게 발생하여 전체 표준편차가 증가한 영향으로 판단된다. 이는
optimizer의 효과가 독립적으로 작용하기보다 CNN 모델 구조 및 초기 학습률 조건과 함께 영향을 받는다는 점을 보여준다.
Kruskal–Wallis 검정 결과, optimizer 조건 간 Test Macro F1-score 차이는 통계적으로 유의하지 않았다(H(2)=3.0385,
p=0.2189). 따라서 SGDM의 평균 성능이 가장 높았지만, 이를 다른 optimizer보다 통계적으로 우수한 결과로 해석하기는 어렵다.
3.3 학습률에 따른 성능 경향
Table 4에서 초기 학습률 조건별 결과를 보면, 각 학습률 조건은 4개 CNN 모델, 3개 optimizer 및 10개 난수 시드 결과를 포함하므로 조건별
학습 실행 수는 120회이다.
평균 Test Macro F1-score는 학습률 0.0003 조건에서 0.9466으로 가장 높았고, 0.0001 조건은 0.9464로 거의 유사하였다.
반면 0.001 조건은 평균 Test Macro F1-score가 0.9405로 상대적으로 낮았으며, 표준편차도 0.0321로 가장 크게 나타났다.
0.0003과 0.0001 조건의 평균 성능 차이는 매우 작았으나, 0.0001 조건의 표준편차가 더 낮게 나타났다. 따라서 평균 성능만을 기준으로
하면 0.0003이 가장 높은 값을 보였지만, 반복 안정성까지 함께 고려하면 0.0001도 안정적인 학습 조건으로 볼 수 있다.
반면 0.001 조건에서는 일부 조합에서 높은 성능을 보였음에도 불구하고, 특정 모델–optimizer 조합에서 성능 저하가 발생하여 전체 변동성이
증가하였다. 이는 전이학습 기반 CNN fine-tuning 조건에서 초기 학습률이 과도하게 클 경우, 모델 또는 optimizer 조합에 따라 학습
안정성이 저하될 수 있음을 나타낸다.
학습률 조건 간 차이는 통계적으로 유의하였다(H(2)=9.9735, p=0.0068). 그러나 Dunn–Holm 사후검정에서 0.0003과 0.0001의
차이는 유의하지 않았으며(p=0.1904), 0.0003과 0.001의 차이만 유의하였다(p=0.0050). 따라서 0.0003과 0.0001은 유사한
성능 수준으로 해석할 수 있다.
Table 4 Performance by optimizer and initial learning rate
|
Factor
|
Optimizer
|
Initial learning rate
|
|
Level
|
SGDM
|
Adam
|
RMSProp
|
0.0001
|
0.0003
|
0.001
|
|
No. of trials
|
120
|
120
|
120
|
120
|
120
|
120
|
|
Test Macro F1
|
0.9471
|
0.9455
|
0.9410
|
0.9464
|
0.9466
|
0.9405
|
|
Std
|
0.0056
|
0.0075
|
0.0329
|
0.0065
|
0.0097
|
0.0321
|
|
Min
|
0.9319
|
0.9218
|
0.6105
|
0.9213
|
0.8662
|
0.6105
|
|
Max
|
0.9599
|
0.9600
|
0.9593
|
0.9600
|
0.9599
|
0.9599
|
|
95% CI for mean
|
0.9461-0.9481
|
0.9441-0.9468
|
0.9350-0.9469
|
0.9452-0.9475
|
0.9449-0.9484
|
0.9348-0.9463
|
3.4 조합별 성능 안정성 및 저하 조건 분석
모델별, optimizer별 및 학습률별 평균 성능 비교에서는 대부분의 조건이 높은 Test Macro F1-score를 보였으며, 평균 성능 차이는
크지 않았다. 그러나 각 요인을 개별적으로 집계할 경우 특정 조합에서 발생하는 성능 저하나 반복 학습 변동성이 충분히 드러나지 않을 수 있다. 따라서
본 절에서는 모델, optimizer 및 학습률을 함께 고려하여 조합별 성능 안정성과 저하 조건을 검토하였다.
Table 5는 전체 모델–optimizer–학습률 조합 중 평균 Test Macro F1-score가 높은 상위 조합과 반복 변동성 또는 성능 저하가 크게 나타난
대표 조합을 요약한 것이다. 전체 36개 모델–optimizer–초기 학습률 조합의 평균 Test Macro F1-score, 표준편차, 최소값,
최대값 및 변동계수는 Appendix Table A1에 제시하였다. GoogLeNet–SGDM–0.0003 조합은 평균 Test Macro F1-score 0.9521, 표준편차 0.0029, CV
0.0031로 가장 높은 평균 성능과 우수한 반복 안정성을 보였다. 이는 GoogLeNet이 모든 조건에서 낮은 성능을 보이는 모델은 아니며, 적절한
optimizer와 학습률 조건에서는 다른 CNN 모델과 유사하거나 더 높은 성능을 확보할 수 있음을 의미한다.
ResNet-50–SGDM–0.001 및 EfficientNet-B0–Adam–0.0001 조합도 각각 평균 Test Macro F1-score 0.9512와
0.9511로 높은 성능을 보였다. 특히 EfficientNet-B0–Adam–0.0001 조합은 표준편차가 0.0027로 낮아 평균 성능과 반복
안정성이 모두 우수한 조건으로 판단된다.
반면 일부 조합에서는 평균 성능 저하 또는 반복 학습 변동성 증가가 확인되었다. MobileNetV2–RMSProp–0.001 조합은 평균 Test
Macro F1-score가 0.9136으로 상대적으로 낮았고, 표준편차가 0.1068로 크게 나타났다. 또한 최소 Test Macro F1-score가
0.6105까지 낮아져 특정 난수 시드 조건에서 학습 안정성이 크게 저하된 것으로 판단된다. GoogLeNet–RMSProp–0.0003 조합 역시
평균 성능은 0.9358로 일정 수준을 유지하였으나, 다른 GoogLeNet 조합에 비해 표준편차와 CV가 증가하였다.
이러한 결과는 CNN 기반 콘크리트 손상 분류에서 모델 구조, optimizer 및 초기 학습률이 독립적으로 작용하기보다 상호 조합에 따라 성능과
안정성에 영향을 미칠 수 있음을 보여준다. 따라서 특정 모델의 성능을 단일 조건에서 판단하기보다는 다양한 optimizer 및 학습률 조건에서 반복
학습 결과를 함께 검토하는 것이 필요하다.
다만 조도 불균형, 표면 오염, 원거리 촬영 및 손상 경계가 불명확한 이미지가 포함될 경우 모델–optimizer–학습률 조합별 성능과 변동성 경향이
달라질 수 있으므로, 이에 대한 추가적인 검증이 필요하다.
MobileNetV2–RMSProp–0.001 조합의 최소 성능은 난수 시드 10에서 나타났다. 해당 학습곡선에서는 15번째 epoch의 validation
loss가 급증하고 validation accuracy가 약 66%로 감소하였으며, 철근 노출 이미지 450장 중 383장(85.1%)이 균열로 오분류되어
철근 노출 F1-score가 0.2420으로 낮아졌다. 따라서 해당 저성능은 학습 전반의 지속적인 underfitting보다 마지막 epoch의 검증
성능 저하와 특정 클래스 예측 편중의 영향을 받은 것으로 판단된다.
동일한 조건에서 최대 epoch를 30으로 설정하여 별도 재학습한 결과, 평균 Test Macro F1-score는 0.9502, 최소값은 0.9361로
개선되었고 표준편차와 CV도 각각 0.0054와 0.0057로 감소하였다(Table 6). 이에 기존 저성능은 해당 조합의 지속적인 결함이라기보다 특정 난수 시드와 고정된 학습 종료 시점에서 발생한 성능 저하로 해석하였다.
Table 5 Selected model–optimizer–learning rate combinations
|
Factor
|
Top-performing
|
Low/unstable
|
|
Model
|
G.Net
|
R.Net
|
E.Net
|
M.Net
|
G.Net
|
|
Optimizer
|
SGDM
|
SGDM
|
Adam
|
RMSProp
|
RMSProp
|
|
No. of trials
|
10
|
10
|
10
|
10
|
10
|
|
Learning rate
|
0.0003
|
0.001
|
0.0001
|
0.001
|
0.0003
|
|
Test Macro F1
|
0.9521
|
0.9512
|
0.9511
|
0.9136
|
0.9358
|
|
Std
|
0.0029
|
0.0046
|
0.0027
|
0.1068
|
0.0268
|
|
Min
|
0.9494
|
0.9414
|
0.9466
|
0.6105
|
0.8662
|
|
CV
|
0.0031
|
0.0048
|
0.0028
|
0.1168
|
0.0286
|
* G.Net: GoogLeNet, R.Net: ResNet-50, M.Net: MobileNetV2, E.Net: EfficientNet-B0
* Top-performing combinations represent the three combinations with the highest mean
Test Macro F1-scores among all 36 combinations. Low/unstable combinations represent
the two combinations with the highest coefficients of variation.
Table 6 Comparison of 15- and 30-epoch training results for MobileNetV2–RMSProp–0.001
|
Metric
|
15 epochs
|
30 epochs
|
|
Mean Test Macro F1
|
0.9136
|
0.9502
|
|
Standard deviation
|
0.1068
|
0.0054
|
|
Minimum Test Macro F1
|
0.6105
|
0.9361
|
|
Coefficient of variation
|
0.1168
|
0.0057
|
|
Seed 10 rebar exposure F1
|
0.2420
|
0.9733
|
|
Seed 10 Test Macro F1
|
0.6105
|
0.9548
|
|
Rebar images misclassified as crack
|
383/450
|
5/450
|
* The 30-epoch results were obtained from independent retraining using the same fixed
data split and random seeds.
3.5 손상 유형별 분류 성능
손상 유형에 따른 분류 성능 차이를 검토하기 위하여 전체 360회의 학습 실행 결과에서 산출된 클래스별 precision, recall 및 F1-score를
클래스별로 집계하였다. Table 7은 균열, 백태 및 철근 노출 클래스의 평균 성능을 나타낸 것이다.
전체 평균 기준으로 철근 노출 클래스의 F1-score는 0.9659로 가장 높았으며, 균열은 0.9386, 백태는 0.9290으로 나타났다. 철근
노출은 노출된 철근과 주변 콘크리트 사이의 색상 및 형상 대비가 비교적 명확한 반면, 백태는 표면 오염, 반사광 및 콘크리트 표면 질감과 유사한 면적⋅텍스처
특징을 가지므로 상대적으로 분류가 어려운 것으로 판단된다.
균열은 폭이 좁은 국부적 선형 특징이므로 반복적인 downsampling 과정에서 세부 정보가 약화될 수 있는 반면, 백태의 분류에는 비교적 넓은
공간 문맥과 채널 간 질감 정보의 통합이 중요할 수 있다. 이에 따라 GoogLeNet의 다중 스케일 특징 추출, ResNet-50의 잔차 연결,
EfficientNet-B0의 복합 스케일링 및 채널 특징 보정, MobileNetV2의 depthwise separable convolution과
경량화 구조는 손상 특징을 서로 다르게 표현할 가능성이 있다. 특히 MobileNetV2–RMSProp–0.001 조건에서 나타난 높은 반복 변동성은
경량화 구조와 학습 조건 간 상호작용의 영향을 받았을 가능성이 있다. 다만 Table 7은 전체 모델과 학습 조건을 통합한 결과이고 모델 구조에 대한 ablation analysis를 수행하지 않았으므로, 이러한 해석을 아키텍처와 클래스별
성능 간의 직접적인 인과관계로 단정하기는 어렵다.
다만 철근 노출 클래스의 최소 F1-score가 낮게 나타난 것은 해당 클래스 자체의 평균 분류 난이도가 높다는 의미라기보다, 특정 모델–optimizer–학습률
조합에서 전체 분류 성능이 저하되면서 class-wise F1-score에도 영향을 준 결과로 판단된다. 따라서 손상 유형별 성능 역시 평균값과 함께
최소값 및 표준편차를 함께 해석하는 것이 적절하다.
Table 7 Class-wise classification performance
|
Class
|
Crack
|
Efflorescence
|
Rebar exposure
|
|
Precision
|
0.9378
|
0.9327
|
0.9667
|
|
Recall
|
0.9410
|
0.9264
|
0.9667
|
|
F1-score
|
0.9386
|
0.9290
|
0.9659
|
|
Std of F1-score
|
0.0190
|
0.0107
|
0.0393
|
|
Min-Max F1-score
|
0.6702–0.9559
|
0.8475–0.9495
|
0.2420–0.9823
|
* Note: Values were calculated from all 360 training runs.
3.6 계산 효율성을 고려한 결과 해석
계산 효율성 측면에서는 Table 3에 제시한 바와 같이 모델 간 추론 시간보다 학습 시간의 차이가 더 뚜렷하였다. 평균 학습 시간은 GoogLeNet이 282.34 s로 가장 짧았고,
EfficientNet-B0는 1387.28 s로 가장 길었다. EfficientNet-B0는 평균 Test Macro F1-score가 가장 높았으나
학습 시간이 크게 증가한 반면, GoogLeNet은 평균 성능 차이가 제한적인 조건에서 가장 짧은 학습 시간을 보였고 SGDM–0.0003 조건에서는
높은 성능과 안정성을 나타냈다. 시험 이미지 1장당 평균 추론 시간은 모든 모델에서 0.0011–0.0018 s 수준으로 나타나 절대적인 차이는 크지
않았다. 따라서 본 분석 조건에서는 평균 성능뿐 아니라 반복 학습 안정성과 학습 시간을 함께 고려하여 모델 및 학습 조건을 선정하는 것이 적절하다.
4. 결 론
본 연구에서는 콘크리트 구조물 손상 이미지 분류를 위하여 4개 CNN 모델을 대상으로 optimizer와 초기 학습률 조건에 따른 분류 성능 및 반복
학습 안정성을 비교하였다. 주요 결론은 다음과 같다.
1) CNN 모델별 전체 평균 성능을 비교한 결과, 모든 모델에서 평균 Test Macro F1-score가 0.94 이상으로 나타나 전이학습 기반
CNN 모델이 콘크리트 손상 이미지 분류에 높은 성능을 보였다. EfficientNet-B0가 0.9463으로 가장 높은 평균 성능을 보였으나, 모델
간 평균 성능 차이는 약 0.0032 수준으로 크지 않았다. 따라서 본 분석 조건에서는 평균 성능만으로 특정 CNN 모델의 우수성을 판단하기보다 반복
안정성과 계산 효율성을 함께 고려하는 것이 적절하다.
2) Optimizer 및 초기 학습률 조건별 분석 결과, SGDM은 평균 Test Macro F1-score 0.9471과 표준편차 0.0056으로
상대적으로 높은 성능과 낮은 변동성을 보였다. 학습률의 경우 0.0003 조건에서 평균 성능이 가장 높았으나, 0.0001 조건도 유사한 성능과 더
낮은 표준편차를 나타냈다. 반면 RMSProp 및 0.001 학습률 조건에서는 일부 조합의 성능 저하로 인해 변동성이 증가하였다.
3) 모델, optimizer 및 학습률을 함께 고려한 조합별 분석 결과, 개별 요인별 평균 성능만으로는 특정 조건에서의 성능 저하나 반복 변동성을
충분히 설명하기 어려운 것으로 나타났다. 모델–optimizer–학습률 조합별 분석 결과, MobileNetV2–RMSProp–0.001에서는 15
epoch 조건에서 최소 Test Macro F1-score가 0.6105까지 감소하였다. 그러나 30 epoch 재학습에서는 최소값이 0.9361로
개선되고 변동성이 감소하였다. 따라서 15 epoch에서 나타난 저성능을 해당 조합의 지속적인 결함으로 일반화하기는 어려우며, 고정된 종료 시점과
특정 실행에서의 성능 저하가 결과에 영향을 준 것으로 판단된다.
4) 손상 유형별 분석에서는 철근 노출 클래스의 평균 F1-score가 0.9659로 가장 높았고, 백태 클래스는 0.9290으로 상대적으로 낮게
나타났다. 이는 백태가 표면 오염, 조도 변화 및 콘크리트 표면 질감과 시각적으로 유사하여 분류 난이도가 상대적으로 높았기 때문으로 판단된다. 계산
효율성 측면에서는 모델 간 추론 시간 차이는 크지 않았으나, 학습 시간은 GoogLeNet이 282.34 s로 가장 짧고 EfficientNet-B0가
1387.28 s로 가장 길게 나타났다.
본 연구의 의의는 동일한 콘크리트 손상 데이터와 고정된 데이터 분할 조건에서 모델–optimizer–초기 학습률의 전 조합을 반복 평가함으로써, 평균
성능이 유사하더라도 조합과 난수 시드에 따라 반복 변동성과 최소 성능이 달라질 수 있음을 정량적으로 제시한 데 있다. 따라서 구조물 점검용 CNN
모델과 학습 조건은 단일 실행의 평균 또는 최고 성능만으로 판단하기보다 반복 학습 안정성, 최소 성능, 손상 유형별 성능 및 계산 효율성을 함께 고려하여
선정할 필요가 있다.
감사의 글
이 논문은 2026년 정부(교육부)의 재원으로 한국연구재단의 지원을 받아 수행된 연구입니다(RS-2021-NR060132).
이 연구는 과학기술정보통신부의 재원으로 한국지능정보사회진흥원의 지원을 받아 구축된 “건물 균열 탐지 이미지”를 활용하여 수행된 연구입니다. 본 연구에
활용된 데이터는 AI 허브(aihub.or.kr)에서 다운로드 받으실 수 있습니다.
References
Ali, L., Alnajjar, F., Jassmi, H.A., Gocho, M., Khan, W., Serhani, M.A. (2021), Performance
evaluation of deep CNN-based crack detection and localization techniques for concrete
structures, Sensors, 21(5), 1688

Cha, Y.J., Choi, W.R., Büyüköztürk, O. (2017), Deep learning-based crack damage detection
using convolutional neural networks, Computer-Aided Civil and Infrastructure Engineering,
32(5), 361-378.

Choi, D., Shallue, C.J., Nado, Z., Lee, J., Maddison, C.J., Dahl, G.E. (2019), On
empirical comparisons of optimizers for deep learning, arXiv preprint arXiv:1910.05446

Demšar, J. (2006), Statistical comparisons of classifiers over multiple data sets,
Journal of Machine Learning Research, 7, 1-30.

Diniz, J.C.N., Paiva, A.C., Junior, G.B., Almeida, J.D.S., Silva, A.C., Cunha, A.M.T.S.,
Cunha, S.C.A.P.S. (2023), A method for detecting pathologies in concrete structures
using deep neural networks, Applied Sciences, 13(9), 5763

He, K., Zhang, X., Ren, S., Sun, J. (2016), Deep residual learning for image recognition,
Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 770-778.

Henderson, P., Islam, R., Bachman, P., Pineau, J., Precup, D., Meger, D. (2018), Deep
reinforcement learning that matters, Proceedings of the AAAI Conference on Artificial
Intelligence, 32(1), 3207-3214.

Islam, M.M., Hossain, M.B., Akhtar, M.N., Ali Moni, M., Hasan, K.F. (2022), CNN based
on transfer learning models using data augmentation and transformation for detection
of concrete crack, Algorithms, 15(8), 287

Kim, B.H., Cho, S.J. (2020), Automated multiple concrete damage detection using instance
segmentation deep learning model, Applied Sciences, 10(22), 8008

Kim, I.S., Choi, S.Y., Yang, E.I. (2025), Analysis of performance and interpretability
in CNN-based concrete damage classification using Grad-CAM, Journal of the Korea Institute
for Structural Maintenance and Inspection, 29(6), 110-118. (in Korean)

Kim, I.S., Choi, S.Y., Yang, E.I. (2025), Concrete damage classification using CNN
models with small-scale images: performance analysis and comparison, Journal of the
Korea Institute for Structural Maintenance and Inspection, 29(6), 30-38. (in Korean)

Kim, I.S., Yang, E.I. (2026), Effect of data size and hyperparameter settings on classification
performance and computational efficiency in CNN-based concrete damage classification,
Journal of the Korea Institute for Structural Maintenance and Inspection, 30(2), 52-60.
(in Korean)

Kingma, D.P., Ba, J. (2015), Adam: A method for stochastic optimization, International
Conference on Learning Representations

Mazni, M., Husain, A.R., Shapiai, M.I., Ibrahim, I.S., Zulkifli, R., Anggara, D.W.
(2024), Identification of concrete cracks using deep learning models: A systematic
review, Applications of Modelling and Simulation, 8, 1-25.

Picard, D. (2021), Torch.manual_seed(3407) is all you need: On the influence of random
seeds in deep learning architectures for computer vision, arXiv preprint arXiv:2109.08203

Philip, R.E., Andrushia, A.D., Nammalvar, A., Gurupatham, B.G.A., Roy, K. (2023),
A comparative study on crack detection in concrete walls using transfer learning techniques,
Journal of Composites Science, 7(4), 169

Recht, B., Roelofs, R., Schmidt, L., Shankar, V. (2019), Do ImageNet classifiers generalize
to ImageNet?, Proceedings of the 36th International Conference on Machine Learning,
5389-5400.

Roy, S., Yogi, B., Majumdar, R., Ghosh, P., Das, S.K. (2025), Deep learning-based
crack detection and prediction for structural health monitoring, Discover Applied
Sciences, 7, 674

Ruder, S. (2016), An overview of gradient descent optimization algorithms, arXiv preprint
arXiv:1609.04747

Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., Chen, L.C. (2018), MobileNetV2: Inverted
residuals and linear bottlenecks, Proceedings of the IEEE Conference on Computer Vision
and Pattern Recognition, 4510-4520.

Su, C., Wang, W. (2020), Concrete cracks detection using convolutional neural network
based on transfer learning, Mathematical Problems in Engineering, 2020, 7240129

Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke,
V., Rabinovich, A. (2015), Going deeper with convolutions, Proceedings of the IEEE
Conference on Computer Vision and Pattern Recognition, 1-9.

Tan, M., Le, Q. (2019), EfficientNet: Rethinking model scaling for convolutional neural
networks, Proceedings of the 36th International Conference on Machine Learning, 6105-6114.

Wilson, A.C., Roelofs, R., Stern, M., Srebro, N., Recht, B. (2017), The marginal value
of adaptive gradient methods in machine learning, Advances in Neural Information Processing
Systems, 30, 4149-4159.

Yuan, Q., Shi, Y., Li, M. (2024), A review of computer vision‑based crack detection
methods in civil infrastructure: progress and challenges, Remote Sensing, 16(16),
2910

Appendices
Appendix Table A1. Classification performance and repeated training stability for
all model–optimizer–initial learning rate combinations
|
Model
|
Optimizer
|
Initial learning rate
|
No. of trials
|
Mean Test Macro F1
|
Std
|
Min
|
Max
|
CV
|
|
EfficientNet-B0
|
Adam
|
0.0001
|
10
|
0.9511
|
0.0027
|
0.9466
|
0.9563
|
0.0028
|
|
EfficientNet-B0
|
Adam
|
0.0003
|
10
|
0.9442
|
0.0076
|
0.9273
|
0.9511
|
0.0081
|
|
EfficientNet-B0
|
Adam
|
0.0010
|
10
|
0.9461
|
0.0064
|
0.9384
|
0.9547
|
0.0068
|
|
EfficientNet-B0
|
RMSProp
|
0.0001
|
10
|
0.9483
|
0.0058
|
0.9372
|
0.9556
|
0.0061
|
|
EfficientNet-B0
|
RMSProp
|
0.0003
|
10
|
0.9478
|
0.0054
|
0.9365
|
0.9562
|
0.0057
|
|
EfficientNet-B0
|
RMSProp
|
0.0010
|
10
|
0.9452
|
0.0091
|
0.9256
|
0.9548
|
0.0097
|
|
EfficientNet-B0
|
SGDM
|
0.0001
|
10
|
0.9352
|
0.0028
|
0.9319
|
0.9400
|
0.0030
|
|
EfficientNet-B0
|
SGDM
|
0.0003
|
10
|
0.9488
|
0.0032
|
0.9422
|
0.9526
|
0.0033
|
|
EfficientNet-B0
|
SGDM
|
0.0010
|
10
|
0.9495
|
0.0026
|
0.9460
|
0.9541
|
0.0028
|
|
GoogLeNet
|
Adam
|
0.0001
|
10
|
0.9473
|
0.0047
|
0.9355
|
0.9518
|
0.0050
|
|
GoogLeNet
|
Adam
|
0.0003
|
10
|
0.9478
|
0.0058
|
0.9401
|
0.9563
|
0.0061
|
|
GoogLeNet
|
Adam
|
0.0010
|
10
|
0.9366
|
0.0087
|
0.9218
|
0.9505
|
0.0092
|
|
GoogLeNet
|
RMSProp
|
0.0001
|
10
|
0.9465
|
0.0101
|
0.9213
|
0.9577
|
0.0106
|
|
GoogLeNet
|
RMSProp
|
0.0003
|
10
|
0.9358
|
0.0268
|
0.8662
|
0.9548
|
0.0286
|
|
GoogLeNet
|
RMSProp
|
0.0010
|
10
|
0.9290
|
0.0146
|
0.8934
|
0.9438
|
0.0157
|
|
GoogLeNet
|
SGDM
|
0.0001
|
10
|
0.9448
|
0.0024
|
0.9407
|
0.9474
|
0.0026
|
|
GoogLeNet
|
SGDM
|
0.0003
|
10
|
0.9521
|
0.0029
|
0.9494
|
0.9599
|
0.0031
|
|
GoogLeNet
|
SGDM
|
0.0010
|
10
|
0.9482
|
0.0033
|
0.9445
|
0.9546
|
0.0035
|
|
MobileNetV2
|
Adam
|
0.0001
|
10
|
0.9455
|
0.0052
|
0.9397
|
0.9542
|
0.0055
|
|
MobileNetV2
|
Adam
|
0.0003
|
10
|
0.9466
|
0.0065
|
0.9368
|
0.9570
|
0.0068
|
|
MobileNetV2
|
Adam
|
0.0010
|
10
|
0.9484
|
0.0063
|
0.9382
|
0.9599
|
0.0067
|
|
MobileNetV2
|
RMSProp
|
0.0001
|
10
|
0.9467
|
0.0021
|
0.9431
|
0.9489
|
0.0022
|
|
MobileNetV2
|
RMSProp
|
0.0003
|
10
|
0.9462
|
0.0066
|
0.9321
|
0.9555
|
0.0070
|
|
MobileNetV2
|
RMSProp
|
0.0010
|
10
|
0.9136
|
0.1068
|
0.6105
|
0.9556
|
0.1168
|
|
MobileNetV2
|
SGDM
|
0.0001
|
10
|
0.9471
|
0.0053
|
0.9380
|
0.9577
|
0.0056
|
|
MobileNetV2
|
SGDM
|
0.0003
|
10
|
0.9478
|
0.0038
|
0.9424
|
0.9555
|
0.0040
|
|
MobileNetV2
|
SGDM
|
0.0010
|
10
|
0.9469
|
0.0062
|
0.9330
|
0.9532
|
0.0065
|
|
ResNet-50
|
Adam
|
0.0001
|
10
|
0.9481
|
0.0099
|
0.9337
|
0.9600
|
0.0104
|
|
ResNet-50
|
Adam
|
0.0003
|
10
|
0.9452
|
0.0070
|
0.9331
|
0.9535
|
0.0074
|
|
ResNet-50
|
Adam
|
0.0010
|
10
|
0.9387
|
0.0068
|
0.9259
|
0.9482
|
0.0072
|
|
ResNet-50
|
RMSProp
|
0.0001
|
10
|
0.9495
|
0.0052
|
0.9423
|
0.9593
|
0.0054
|
|
ResNet-50
|
RMSProp
|
0.0003
|
10
|
0.9502
|
0.0042
|
0.9404
|
0.9557
|
0.0044
|
|
ResNet-50
|
RMSProp
|
0.0010
|
10
|
0.9330
|
0.0110
|
0.9054
|
0.9429
|
0.0118
|
|
ResNet-50
|
SGDM
|
0.0001
|
10
|
0.9462
|
0.0036
|
0.9421
|
0.9540
|
0.0038
|
|
ResNet-50
|
SGDM
|
0.0003
|
10
|
0.9470
|
0.0054
|
0.9370
|
0.9578
|
0.0057
|
|
ResNet-50
|
SGDM
|
0.0010
|
10
|
0.9512
|
0.0046
|
0.9414
|
0.9578
|
0.0048
|
* Note: Values were calculated from 10 repeated training runs for each combination.
Std and CV denote the standard deviation and coefficient of variation of the Test
Macro F1-score, respectively.