RT-DETRv2 V4 학습 결과 보고서
Tunnel CCTV Anomaly Detection — RT-DETRv2 HGNetv2-L V4
정량 지표, 정성 검증, 그리고 정직한 한계 노출을 포함한 최종 학습 결과 보고서
Abstract
본 보고서의 핵심 결론 요약
본 시스템은 터널 CCTV 환경에서의 화재·연기 탐지를 목적으로 RT-DETRv2 HGNetv2-L을 채택하였다. 모델 선정의 유일한 기준은 오탐(false positive) 최소화와 화재 전조증상인 연기의 조기 탐지 능력이며, 단순 화재 탐지 성능이 목적이라면 YOLO 계열이 더 적합할 수 있음을 명시한다.
V4 최종 모델은 독립 테스트셋 test_300 기준 mAP@50 = 0.9267을 달성하였으며, 특히 carlight 클래스의 어노테이션을 V3 대비 +487% 보강함으로써 small 객체 AP를 4.6배 향상시키고 background→smoke 오탐률을 0.82 → 0.55로 감소시켰다.
정성 검증 4개 케이스(event 2, 13, 4, 6)에서 V4는 YOLOv8-l, YOLOv11-l 대비 일관되게 우수한 연기 탐지 능력을 보였으며, 특히 event 6(터널 내부 환경)에서 V4의 fire 미탐이라는 정직한 한계도 함께 노출한다. 이는 데이터셋 특성(실제 CCTV vs AI 생성 이미지)의 영향으로 추정되며, V5 개선 계획의 근거로 활용된다.
모델 채택 근거
RT-DETRv2 선정의 세 가지 정량적 근거
본 프로젝트의 채택 기준은 단순 mAP가 아니다.
오탐 억제와 연기 조기 탐지라는 두 가지 운영 요건에 부합하는 모델을 선택하는 것이 목적이다.
이 기준에서 RT-DETRv2는 다음 세 가지 근거로 채택되었다.
중요: 본 시스템의 목적이 단순 화재 탐지였다면 YOLO 계열이 속도 측면에서 더 적합했을 것이다.
오탐 억제와 연기 특화라는 요건이 없었다면 RT-DETRv2를 채택할 이유가 없었음을 명시한다.
V4 정량 성능
test_300 독립 평가 · Class-wise AP · F1 최적 Threshold
V4 최종 모델은 val 1,406장 기준 mAP@50 0.9441을 기록했으며, 독립 test_300에서는 mAP@50 0.9267을 달성했다. val과 test 간 편차는 val 셋 확장(133 → 1,406장)에 따른 난이도 증가에 기인하며, test_300 결과가 실서비스에 더 근접한 지표이다.
Table 1. V4 클래스별 성능 (test_300 기준)
Table 1. RT-DETRv2 V4 클래스별 성능 지표 (test_300, N=300, class-balanced)
Table 2. Object Size별 AP
Table 2. 객체 크기별 정밀도. Small 객체 성능은 V3(AP 0.050) 대비 4.6배 향상
Figure 1. Precision–Recall Curve

Figure 1. V4 PR Curve — 세 클래스 모두 상단 우측에 밀착. fire AP 0.983, smoke AP 0.943, carlight AP 0.914
Figure 2. Confusion Matrix (절대값 기준)

Figure 2. V4 Confusion Matrix — 클래스 간 오분류 사실상 0, background→smoke 오탐 대폭 감소
핵심 성과 ① — background → smoke 오탐 대폭 감소 (V3 대비)
V3에서 가장 큰 문제였던 background→smoke 오탐 비율이 0.82 → 0.55로 감소했다. 절대 건수 기준 629건.
carlight 데이터 보강만으로 이 개선이 달성되었다는 점은, 클래스 간 데이터 균형이 배경 오탐 억제에 간접적 효과를 가짐을 실증한다. 이는 본 시스템의 핵심 목표인 오탐 최소화에 대한 정량적 성과이다.
핵심 성과 ② — 클래스 간 오분류 사실상 0
fire↔smoke↔carlight 간 오분류가 모두 0건이다(smoke→fire 1건 예외). fire True 845건 중 오분류 0건, carlight True 624건 중 오분류 0건. 각 클래스의 시각적 특성이 명확히 분리 학습되었음을 의미한다.
관찰 — background → carlight 신규 오탐 (388건)
V4에서 신규 발생한 유일한 유의미한 오탐. background를 carlight로 오탐한 절대 건수 388건,
background 오탐 총량 대비 0.34의 비중. 자세한 원인과 대응은 12번 섹션 Limitation 2에서 다룬다.
Figure 3. F1–Confidence Curve

Figure 3. F1–Confidence Curve — 클래스별 실서비스 threshold 근거
학습 결과
Fine-tuning from V3 · 50 Epochs · Underfitting 관찰
V4는 V3 best.pth에서 Fine-tuning으로 학습되었다. Total Loss는 12.10 → 10.86으로 안정 감소했으나,
ep12 이후 val mAP는 plateau에 진입하는 underfitting 패턴이 관찰되었다.
이는 imgsz=640 기준의 구조적 상한에 근접했음을 시사하며, V5의 imgsz=1280 재학습 계획의 근거가 된다.
Table 3. 학습 설정
Table 3. V4 학습 하이퍼파라미터
Figure 4. Training Curves (results.png)

Figure 4. V4 학습 곡선 — Loss 안정 감소 (12.10 → 10.86), mAP@50 0.914 → 0.944 수렴 (ep12 이후 plateau)
Table 4. 에폭별 성능 추이
Table 4. V4 에폭별 성능 — best mAP@50 (0.9441) @ ep12, best mAP@50:95 (0.6372) @ ep20
4.1. 학습 단계별 분석
ep 0~12 — 빠른 적응 구간
Fine-tuning 초기, V3 사전학습 표현이 유지된 상태에서 carlight 신규 데이터 분포에 빠르게 적응하였다.
mAP@50 0.914 → 0.944로 상승.
ep 12~49 — Plateau 및 Underfitting
Train Loss는 12.0 → 10.86으로 계속 감소하였으나 val mAP는 상승을 멈추었다.
이는 imgsz=640 기준에서 모델이 학습 가능한 상한에 근접했음을 의미한다.
에폭 추가만으로는 성능 향상이 어려우며, 구조적 개선(고해상도 재학습)이 요구된다.
V3 → V4 정량 비교
test_300 동일 기준 — carlight 보강의 정확한 효과 측정
V3와 V4는 서로 다른 val 셋(133장 vs 1,406장)으로 학습되었기 때문에 val 지표의 직접 비교는 불가능하다.
두 버전을 공정하게 비교할 수 있는 유일한 기준은 독립 테스트셋 test_300이다.
test_300 결과, carlight AP@50이 +0.450 향상되었으며,
fire/smoke 성능은 유지되어기존 클래스 성능을 희생하지 않은 개선임이 확인되었다.
Table 5. test_300 동일 기준 V3 vs V4 비교
Table 5. test_300 독립 평가 결과. V3 val(133장, carlight 81개)이 carlight 성능을 과대평가했음이 드러남
5.1. Small Object AP 4.6배 향상
Table 6. 객체 크기별 AP 변화. carlight 데이터의 소형 bbox 특성이 small 객체 전반의 탐지력 향상에 기여
해석:carlight 클래스만 보강했음에도 소형 객체 AP 전반이 4.6배 향상되었다.
이는 클래스 간 데이터 균형이 모델의 표현 능력 전체에 영향을 미친다는 가설을 정량적으로 뒷받침한다.
5.2. Background 오탐률 변화
Table 7. Background 오탐률 변화. smoke 오탐 감소는 성과이나, carlight 신규 오탐은 V5 개선 대상
Threshold Sweep
실서비스 임계값 근거 — 클래스별 최적 threshold 산출
실서비스 배포를 위해 test_300 기준 Precision–Recall Threshold Sweep을 수행하였다. fire는 threshold 0.70까지 Recall 0.991을 유지하여 미탐 최소화가 가능하며, smoke는 0.60~0.70 구간에서 P/R 균형점을 형성한다. carlight는 0.80 이상에서 Recall이 급감하여 0.50~0.60이 실용 구간이다.
Table 8. Threshold Sweep 결과
Table 8. 클래스별 Precision/Recall Threshold Sweep (test_300)
Table 9. 클래스별 권장 Threshold
Table 9. 실서비스 권장 threshold. VLM 게이트 로직의 근거가 되는 수치
운영 함의:fire의 threshold 0.70까지 Recall 0.991 유지 특성은 안전 시스템에 이상적이다.
threshold를 높여 오탐을 줄여도 미탐이 발생하지 않는다는 것은,
화재 알림의 신뢰도와 완전성을 동시에 확보할 수 있음을 의미한다.
정성 검증 개요
4 Cases × 4 Models — 정량 지표를 넘어선 실증 분석
정량 mAP만으로 판단할 수 없는 실제 CCTV 환경 대응력을 검증하기 위해, 4개의 대표 케이스에 대해 YOLOv8-l, YOLOv11-l, RT-DETRv2 V3, RT-DETRv2 V4의 네 모델을 동일 입력으로 추론하여 비교하였다. 케이스 선정은 다양한 도메인 조건(주간/야간, 야외/터널, 근거리/원거리)을 커버하도록 큐레이션되었다.
Table 10. 정성 검증 케이스 개요
Table 10. 4 케이스는 순차적으로 난이도가 증가하며, event 6은 프로젝트의 최종 타깃 환경
각 케이스의 상세 분석은 08~11번 섹션에서 다룬다.
모든 케이스에서 모델 표시 순서는 YOLOv8-l → YOLOv11-l → RT-DETRv2 V3 → RT-DETRv2 V4로 통일하였다.
Case 2 — 호남지선 주간 야외 차량 화재
흐릿한 흰 연기 탐지 — 연기 특화의 기본 강점
화재 진압 이후의 흐릿한 흰 연기를 탐지하는 케이스이다. YOLO 계열은 양 모델 모두 smoke를 완전히 미탐했으며, RT-DETRv2 계열은 두 버전 모두 smoke를 정확히 탐지하였다. 특히 V4는 소방차와 주변 정상 차량을 carlight로 분리 인식하여오탐 억제와 정탐을 동시에 달성하였다.
8.1. 상황 개요
호남고속도로 지선에서 발생한 화물차 화재의 진압 완료 시점 CCTV 프레임이다. 화염은 진압되어 사라졌으나 저농도 흰 연기가 남아있으며, 주변에는 소방차 2대와 정상 주행 차량 다수가 존재한다. 이 조건은 조기 탐지가 아닌 사후 확인 단계에서의 연기 판별 능력을 검증한다.
8.2. Figure 5. 4모델 추론 비교




Figure 5. Case 2 4모델 추론 결과 비교
8.3. 관찰 및 해석
YOLO 계열의 미탐, 취약 :YOLOv8-l 연기를 탐지했으나 0.54의 낮은 신뢰도, YOLOv11-l 흐릿한 흰 연기를 완전히 놓쳤다. 이는 앵커 기반 지역 특징 탐지 방식이 경계가 불분명하고 배경 대비가 약한 객체에 취약함을 실증한다.
RT-DETRv2 V4의 이중 성과:smoke를 정확히 탐지함과 동시에 소방차 2대와 주변 정상 차량들을 carlight로 분리 인식하였다. 이는 화재 관련 객체(smoke)와 비화재 객체(carlight)를 명확히 구분하는 V4의 오탐 억제 능력을 보여준다.
Case 13 — 서해안선 원거리 폐기물 공장 화재
광역 확산 검은 연기 — 전역 문맥 파악의 우위 실증
고속도로 옆 폐기물 공장에서 발생한 대형 화재의 원거리 CCTV 프레임이다. 화염은 CCTV 시야 밖(공장 내부)에 있으며, 광역으로 확산된 검은 연기 기둥만이 탐지 대상이다. YOLOv11-l은 미탐, YOLOv8-l은 부분 탐지(bbox 부정확)했으나, RT-DETRv2 계열은 두 버전 모두 연기 전체 범위를 정확히 포착했으며 V4는 신뢰도 0.91로 최고 수준을 기록했다.
9.1. 상황 개요
서해안고속도로 고잔1교 인근 폐기물 공장 화재이다. 화염은 공장 건물 내부에서 발생하여 CCTV에 직접 노출되지 않으며, 대형 검은 연기 기둥만이 하늘을 뒤덮고 있다. 이 케이스는 본 시스템의 핵심 목적인 "화염 없이 연기만으로 재난을 조기 감지"하는 능력을 직접 검증한다.
9.2. Figure 6. 4모델 추론 비교




Figure 6. Case 13 4모델 추론 결과 비교
9.3. 관찰 및 해석
YOLOv8-l의 부분 탐지:연기를 탐지하기는 했으나 bbox가 연기 기둥의 일부만 포함하였다. 이는 국소 특징 탐지 방식이 광역 확산 객체의 전체 공간 범위를 파악하지 못함을 보여준다.
RT-DETRv2 V4의 공간 정확도:Transformer의 self-attention 메커니즘이 연기의 전체 공간 분포를 하나의 객체로 인식하였다. 신뢰도 0.91은 threshold 0.70 즉시 알림 조건을 여유롭게 충족하며, 확정 알림으로 즉각 발동될 수 있음을 의미한다.
Case 4 — 경부선 야간 타이어 공장 대형 화재
V3 → V4 개선 효과의 정성적 실증
야간 강발광 조건의 대형 화재 케이스이다. 이 케이스의 결정적 의의는 V3가 smoke를 미탐하던 조건에서 V4가 smoke 0.6으로 탐지에 성공했다는 점이다. 이는 carlight 데이터 보강이 다른 클래스의 탐지 능력까지 향상시킨다는 5.1절 정량 관찰(small AP 4.6배)의 정성적 실증이다.
10.1. 상황 개요
경부고속도로 금강1교 인근 타이어 공장에서 발생한 야간 대형 화재이다. 강한 화염 발광과 야간 조명 조건이 결합된 최악의 시각적 노이즈 환경이며, 좌측 하단에는 정상 주행 차량의 등화류가 존재한다. 이 케이스는 강발광 조건에서의 fire/smoke 분리 탐지 능력과 등화류-화염 혼동 억제를 동시에 검증한다.
10.2. Figure 7. 4모델 추론 비교




Figure 7. Case 4 4모델 추론 결과 비교
10.3. 핵심 관찰 — V3 → V4 개선 효과
V3의 미탐:RT-DETRv2 V3는 이 야간 강발광 조건에서 smoke를 완전히 미탐하였다. 이는 V3의 학습 데이터가 이러한 극단 조건을 충분히 커버하지 못했음을 시사한다.
V4의 개선:동일 입력에서 V4는 smoke 0.6으로 탐지에 성공하였다. carlight 데이터 보강만 이루어진 V4가 smoke 탐지 능력까지 개선한 것은, 클래스 간 데이터 균형이 표현 학습 전반에 미치는 영향을 실증한다. 이는 5.1절 Table 6의 small AP 4.6배 향상 관찰과 정합한다.
fire 신뢰도 0.28에 대한 정직한 노출:V4의 fire 탐지 신뢰도는 0.28로 실서비스 threshold(0.60~0.70) 아래에 위치한다. 그러나 본 시스템은 smoke를 화재 전조로 우선시하며, smoke 0.6이 threshold 0.60~0.70의 하한을 충족하므로 알림 발생 조건은 만족된다. fire와 smoke의 동시 탐지 자체는 카메라의 상황 인식이 정확히 이루어졌음을 의미한다.
Case 6 — 경부동탄터널 내 SUV 화재
본 프로젝트 타깃 도메인 + V4의 정직한 한계 노출
본 시스템의 최종 타깃 도메인인 터널 내부 환경에서 발생한 SUV 화재 케이스이다. YOLO 계열은 두 모델 모두 smoke를 미탐했으며, V3는 fire·smoke·carlight 3클래스를 모두 완벽히 구분 탐지하였다.그러나 V4는 smoke·carlight 탐지에는 성공했으나 fire를 미탐하였다. 이 관찰은 정직하게 노출되며, 원인 분석과 V5 개선 방향으로 연결된다.
11.1. 상황 개요
경부고속도로 경부동탄터널 내부에서 발생한 SUV 차량 화재이다. 화염은 명확히 노출되어 있으며, 검은 연기가 상승 확산 중이다. 뒤쪽에는 다수의 정상 주행 차량이 존재한다. 이 케이스는 프로젝트의 최종 운영 환경인 터널 내부 CCTV 조건에서의 종합 탐지 능력을 검증한다.
11.2. Figure 8. 4모델 추론 비교




Figure 8. Case 6 4모델 추론 결과 비교 — V3가 4모델 중 유일하게 3클래스 완전 탐지 달성
11.3. 정직한 한계 노출 — V4의 fire → carlight 오분류
관찰
Case 6에서 V4는 smoke를 정확히 탐지하고 뒤쪽 정상 차량들의 등화류를 carlight로 정확히 분리 인식하였다. 그러나 명확히 노출된 화염을 fire가 아닌 carlight(신뢰도 0.67)로 오분류(misclassification)하였다. 동일 조건에서 V3는 fire·smoke·carlight 3클래스를 모두 정확히 구분하였다. 이는 단순 미탐(false negative)보다 위험한 오분류로, 시스템이 화염을 "정상 차량 등화"로 확신할 위험이 있는 사례이다.
통계적 맥락 (중요)
test_300 전체 통계로는 fire → carlight 오분류가 0건이다. 즉 Case 6의 오분류는 V4 모델 전반의 편향이 아니라 특정 조건에서 발생한 edge case이다. Confusion Matrix(Figure 2) 기준 fire True 845건 중 오분류는 전무하며, background 오탐으로만 13건이 존재한다.
원인 분석 (Hypothesis)
V4는 실제 CCTV 촬영 이미지를 중심으로 학습되었다. 반면 본 test 이미지는 AI 생성 이미지(synthetic)로 판단되며, 화염의 색감·텍스처가 실제 CCTV 화염과 편차가 있다. 한편 V4는 carlight 어노테이션 +487% 보강으로 "차량 전면부의 밝은 광원" 패턴에 대한 표현이 강화되어 있어, synthetic 화염의 시각적 특성이 이 패턴과 유사하게 해석되며 오분류가 발생한 것으로 추정된다. V3는 상대적으로 다양한 소스의 학습 데이터를 포함하여 이 편차에 더 관용적일 수 있다.
시스템 안전성 관점의 해석
fire 오분류에도 불구하고 smoke가 정확히 탐지되었다는 점은 결정적이다. 본 시스템의 파이프라인은 smoke만으로도 알림을 발생시키며, VLM 재검증 단계에서 화재 상황임이 확정된다. 즉 이 케이스에서도 화재 알림은 정상적으로 발동된다. 단일 클래스 오분류가 시스템 실패로 이어지지 않도록 다층 방어가 설계되어 있다.
V5 개선 방향
이 관찰은 V5 학습 데이터 구성에 AI 생성 이미지와 실제 CCTV 이미지의 혼합 검토 및 fire↔carlight 경계 케이스의 hard example mining이 필요함을 시사한다. 이는 13번 섹션 V5 계획에서 구체화된다.
Known Limitations
V4에서 확인된 세 가지 한계 — 정직한 노출
V4 모델의 알려진 한계 세 가지를 명시한다. 이들은 은폐 대상이 아니라 V5 개선의 정확한 출발점이다. 한계를 정직하게 노출하는 것이 시스템 신뢰도의 근간임을 강조한다.
Limitation 1. Underfitting Pattern (imgsz=640 상한)
관찰: ep12 이후 train loss는 계속 감소(12.0 → 10.86)하나 val mAP는 plateau.
원인: imgsz=640 기준 모델이 학습 가능한 표현 상한에 근접.
영향: 원본 1920×1080 CCTV의 소형/원거리 객체 정보 손실.
V5 대응: imgsz=1280 재학습 + AMP=True.
Limitation 2. Background → carlight 신규 오탐 (388건)
관찰: V3에는 없던 항목. Confusion Matrix 기준 background를 carlight로 오탐한 절대 건수 388건, background 전체 오탐 대비 0.34의 비중을 차지한다.
원인: carlight val 데이터가 81 → 624개로 확장되며 다양한 배경 조건(야간 반사광, 터널 조명 등)에서의 오탐이 드러남. 이 한계 발견 자체가 val 셋 확장의 효과이다.
단기 관리: carlight threshold 0.60 이상으로 설정하여 다수 오탐을 필터링.
V5 대응: 야간 반사광 hard negative sampling으로 배경-carlight 경계 명시적 학습.
Limitation 3. 원거리 광범위 연기 미탐
관찰: event 21에서 배경에 존재하는 대형 연기 기둥을 V4가 미탐.
원인: 극단적 원거리·저해상도 연기 도메인의 학습 데이터 부족.
V5 대응: 검은 연기·광역 확산·저해상도 케이스 도메인 다양화 보강.

Figure 9. Limitation 3 실사례 — 원거리 대형 연기 기둥 미탐 (event 21)
V5 개선 계획
V4 한계와 1:1 매칭된 데이터 구성 전략
V5의 개선 방향은 V4에서 확인된 세 가지 한계를 학습 데이터 구성 전략으로 해결하는 것이다. 모델 구조를 바꾸기 전에 데이터로 잡을 수 있는 부분을 먼저 처리한다는 원칙에 따른다.
Table 11. V5 데이터 구성 전략
Table 11. V5 개선 전략 — 각 한계에 대응하는 정밀 타겟팅
13.1. carlight 클래스 활용 확장 구상
V4의 carlight 어노테이션 자산(6,210개)은 오탐 억제 목적을 넘어 교통 관제 기능 확장의 기반이 될 수 있다. V5 데이터 구성 단계에서 차량 밀집도·주행 패턴 조건을 함께 수집하면 다음 확장이 가능하다.
Table 12. carlight 자산의 단계적 확장 로드맵
결론
오탐 억제와 연기 특화 — 프로젝트 목적의 정합적 달성
본 보고서는 RT-DETRv2 V4의 학습 결과를 정량·정성 양면에서 종합하였다. 모델 채택의 유일한 기준은 오탐 최소화와 연기 조기 탐지였으며, 이는 test_300 정량 지표와 4개 케이스 정성 검증에서 일관되게 실증되었다. 한계는 은폐하지 않고 정직하게 노출하였으며, V5 개선 계획으로 연결된다.
14.1. 핵심 성과 요약
14.2. 프로젝트 목적과의 정합성
"단순 화재 탐지가 목적이었다면 우리는 RT-DETR을 택하지 않았다."
오탐 억제와 연기 특화라는 요건 위에서, V4는 그 방향의 정합적 결과이다.