RT-DETRv2 V4 학습 결과 보고서

Tunnel CCTV Anomaly Detection — RT-DETRv2 HGNetv2-L V4

정량 지표, 정성 검증, 그리고 정직한 한계 노출을 포함한 최종 학습 결과 보고서

01

Abstract

본 보고서의 핵심 결론 요약

Summary

본 시스템은 터널 CCTV 환경에서의 화재·연기 탐지를 목적으로 RT-DETRv2 HGNetv2-L을 채택하였다. 모델 선정의 유일한 기준은 오탐(false positive) 최소화화재 전조증상인 연기의 조기 탐지 능력이며, 단순 화재 탐지 성능이 목적이라면 YOLO 계열이 더 적합할 수 있음을 명시한다.

V4 최종 모델은 독립 테스트셋 test_300 기준 mAP@50 = 0.9267을 달성하였으며, 특히 carlight 클래스의 어노테이션을 V3 대비 +487% 보강함으로써 small 객체 AP를 4.6배 향상시키고 background→smoke 오탐률을 0.82 → 0.55로 감소시켰다.

정성 검증 4개 케이스(event 2, 13, 4, 6)에서 V4는 YOLOv8-l, YOLOv11-l 대비 일관되게 우수한 연기 탐지 능력을 보였으며, 특히 event 6(터널 내부 환경)에서 V4의 fire 미탐이라는 정직한 한계도 함께 노출한다. 이는 데이터셋 특성(실제 CCTV vs AI 생성 이미지)의 영향으로 추정되며, V5 개선 계획의 근거로 활용된다.

02

모델 채택 근거

RT-DETRv2 선정의 세 가지 정량적 근거

본 프로젝트의 채택 기준은 단순 mAP가 아니다.
오탐 억제와 연기 조기 탐지라는 두 가지 운영 요건에 부합하는 모델을 선택하는 것이 목적이다.
이 기준에서 RT-DETRv2는 다음 세 가지 근거로 채택되었다.

근거 ①전역 문맥 기반 오탐 억제
Transformer 기반 아키텍처는 국소 특징이 아닌 전역 문맥을 파악한다. 이는 등화류·반사광·화염을 구조적으로 구분하는 데 유리하며, YOLO 계열(앵커 기반 + NMS)에서 빈발하는 오탐을 근본적으로 줄인다.
근거 ②연기(smoke) 재현율 우위
화재의 전조증상인 smoke의 미탐(false negative)은 골든타임 상실로 직결된다. RT-DETRv2는 경계가 불분명하고 형태가 변화하는 연기 객체 탐지에서 YOLO 계열 대비 일관되게 높은 재현율을 보였다.
근거 ③운영 전략을 통한 속도 상쇄
RT-DETRv2는 YOLO 대비 추론 속도가 다소 느리다. 그러나 5FPS 다운샘플링과 채널 다중화(48FPS ÷ 5FPS = 22채널 동시 커버)로 실서비스 요건을 충족한다.

중요: 본 시스템의 목적이 단순 화재 탐지였다면 YOLO 계열이 속도 측면에서 더 적합했을 것이다.
오탐 억제와 연기 특화라는 요건이 없었다면 RT-DETRv2를 채택할 이유가 없었음을 명시한다.

03

V4 정량 성능

test_300 독립 평가 · Class-wise AP · F1 최적 Threshold

Summary

V4 최종 모델은 val 1,406장 기준 mAP@50 0.9441을 기록했으며, 독립 test_300에서는 mAP@50 0.9267을 달성했다. val과 test 간 편차는 val 셋 확장(133 → 1,406장)에 따른 난이도 증가에 기인하며, test_300 결과가 실서비스에 더 근접한 지표이다.

Table 1. V4 클래스별 성능 (test_300 기준)

Class
AP@50
AP@50:95
Best F1
Optimal Threshold
fire
0.9829
0.973
0.713
smoke
0.8931
0.900
0.676
carlight
0.9041
0.868
0.577
mAP (all)
0.9267
0.6408
0.912
0.611

Table 1. RT-DETRv2 V4 클래스별 성능 지표 (test_300, N=300, class-balanced)

Table 2. Object Size별 AP

Object Size
AP
AR
Small
0.2294
0.3250
Medium
0.5939
0.7183
Large
0.6811
0.8159

Table 2. 객체 크기별 정밀도. Small 객체 성능은 V3(AP 0.050) 대비 4.6배 향상

Figure 1. Precision–Recall Curve

V4 Precision-Recall Curve

Figure 1. V4 PR Curve — 세 클래스 모두 상단 우측에 밀착. fire AP 0.983, smoke AP 0.943, carlight AP 0.914

Figure 2. Confusion Matrix (절대값 기준)

V4 Confusion Matrix

Figure 2. V4 Confusion Matrix — 클래스 간 오분류 사실상 0, background→smoke 오탐 대폭 감소

핵심 성과 ① — background → smoke 오탐 대폭 감소 (V3 대비)

V3에서 가장 큰 문제였던 background→smoke 오탐 비율이 0.82 → 0.55로 감소했다. 절대 건수 기준 629건.
carlight 데이터 보강만으로 이 개선이 달성되었다는 점은, 클래스 간 데이터 균형이 배경 오탐 억제에 간접적 효과를 가짐을 실증한다. 이는 본 시스템의 핵심 목표인 오탐 최소화에 대한 정량적 성과이다.

핵심 성과 ② — 클래스 간 오분류 사실상 0

fire↔smoke↔carlight 간 오분류가 모두 0건이다(smoke→fire 1건 예외). fire True 845건 중 오분류 0건, carlight True 624건 중 오분류 0건. 각 클래스의 시각적 특성이 명확히 분리 학습되었음을 의미한다.

관찰 — background → carlight 신규 오탐 (388건)

V4에서 신규 발생한 유일한 유의미한 오탐. background를 carlight로 오탐한 절대 건수 388건,
background 오탐 총량 대비 0.34의 비중. 자세한 원인과 대응은 12번 섹션 Limitation 2에서 다룬다.

Figure 3. F1–Confidence Curve

V4 F1 Curve

Figure 3. F1–Confidence Curve — 클래스별 실서비스 threshold 근거

04

학습 결과

Fine-tuning from V3 · 50 Epochs · Underfitting 관찰

Summary

V4는 V3 best.pth에서 Fine-tuning으로 학습되었다. Total Loss는 12.10 → 10.86으로 안정 감소했으나,
ep12 이후 val mAP는 plateau에 진입하는 underfitting 패턴이 관찰되었다.
이는 imgsz=640 기준의 구조적 상한에 근접했음을 시사하며, V5의 imgsz=1280 재학습 계획의 근거가 된다.

Table 3. 학습 설정

Parameter
Value
Model
RT-DETRv2 HGNetv2-L
Initial Weights
V3 best.pth (Fine-tuning)
Epochs
50
Batch Size
8
Image Size
640×640
Optimizer
AdamW (lr=0.0001)
AMP
False
EMA
True
Hardware
NVIDIA RTX A4000 16GB

Table 3. V4 학습 하이퍼파라미터

Figure 4. Training Curves (results.png)

V4 Training Results

Figure 4. V4 학습 곡선 — Loss 안정 감소 (12.10 → 10.86), mAP@50 0.914 → 0.944 수렴 (ep12 이후 plateau)

Table 4. 에폭별 성능 추이

Epoch
mAP@50
mAP@50:95
Train Loss
0
0.914
0.597
12.103
5
0.939
0.627
12.307
10
0.942
0.634
12.075
12
0.9441
0.635
11.992
20
0.943
0.6372
11.737
30
0.943
0.634
11.395
49
0.939
0.632
10.858

Table 4. V4 에폭별 성능 — best mAP@50 (0.9441) @ ep12, best mAP@50:95 (0.6372) @ ep20

4.1. 학습 단계별 분석

ep 0~12 — 빠른 적응 구간

Fine-tuning 초기, V3 사전학습 표현이 유지된 상태에서 carlight 신규 데이터 분포에 빠르게 적응하였다.
mAP@50 0.914 → 0.944로 상승.

ep 12~49 — Plateau 및 Underfitting

Train Loss는 12.0 → 10.86으로 계속 감소하였으나 val mAP는 상승을 멈추었다.
이는 imgsz=640 기준에서 모델이 학습 가능한 상한에 근접했음을 의미한다.
에폭 추가만으로는 성능 향상이 어려우며, 구조적 개선(고해상도 재학습)이 요구된다.

05

V3 → V4 정량 비교

test_300 동일 기준 — carlight 보강의 정확한 효과 측정

Summary

V3와 V4는 서로 다른 val 셋(133장 vs 1,406장)으로 학습되었기 때문에 val 지표의 직접 비교는 불가능하다.
두 버전을 공정하게 비교할 수 있는 유일한 기준은 독립 테스트셋 test_300이다.
test_300 결과, carlight AP@50이 +0.450 향상되었으며,
fire/smoke 성능은 유지되어기존 클래스 성능을 희생하지 않은 개선임이 확인되었다.

Table 5. test_300 동일 기준 V3 vs V4 비교

Class
V3 AP@50
V4 AP@50
Δ
fire
0.9857
0.9829
−0.003
smoke
0.9171
0.8931
−0.024
carlight
0.4543
0.9041
+0.450
mAP@50
0.7857
0.9267
+0.141
mAP@50:95
0.5447
0.6408
+0.096
AR@100
0.6929
0.7761
+0.083

Table 5. test_300 독립 평가 결과. V3 val(133장, carlight 81개)이 carlight 성능을 과대평가했음이 드러남

5.1. Small Object AP 4.6배 향상

Size
V3 AP
V4 AP
×
Small
0.050
0.2294
× 4.6
Medium
0.57
0.5939
× 1.04
Large
0.73
0.6811
× 0.93

Table 6. 객체 크기별 AP 변화. carlight 데이터의 소형 bbox 특성이 small 객체 전반의 탐지력 향상에 기여

해석:carlight 클래스만 보강했음에도 소형 객체 AP 전반이 4.6배 향상되었다.
이는 클래스 간 데이터 균형이 모델의 표현 능력 전체에 영향을 미친다는 가설을 정량적으로 뒷받침한다.

5.2. Background 오탐률 변화

Background →
V3
V4
Δ
smoke
0.82
0.55
−0.27
carlight
0.34
신규
fire
0.13
0.11
−0.02

Table 7. Background 오탐률 변화. smoke 오탐 감소는 성과이나, carlight 신규 오탐은 V5 개선 대상

06

Threshold Sweep

실서비스 임계값 근거 — 클래스별 최적 threshold 산출

Summary

실서비스 배포를 위해 test_300 기준 Precision–Recall Threshold Sweep을 수행하였다. fire는 threshold 0.70까지 Recall 0.991을 유지하여 미탐 최소화가 가능하며, smoke는 0.60~0.70 구간에서 P/R 균형점을 형성한다. carlight는 0.80 이상에서 Recall이 급감하여 0.50~0.60이 실용 구간이다.

Table 8. Threshold Sweep 결과

Threshold
fire P/R
smoke P/R
carlight P/R
0.30
0.881 / 0.991
0.717 / 0.936
0.674 / 0.971
0.50
0.929 / 0.991
0.803 / 0.882
0.791 / 0.929
0.60
0.946 / 0.991
0.852 / 0.847
0.865 / 0.871
0.70
0.946 / 0.991
0.901 / 0.808
0.936 / 0.731
0.80
0.962 / 0.962
0.921 / 0.690
0.930 / 0.255
0.90
0.988 / 0.752
0.929 / 0.256
1.000 / 0.005

Table 8. 클래스별 Precision/Recall Threshold Sweep (test_300)

Table 9. 클래스별 권장 Threshold

Class
권장 Threshold
근거
fire
0.60~0.70
Recall 0.991 완전 유지 구간
smoke
0.60~0.70
P/R 균형 최적 구간 (조기 경보 중시)
carlight
0.50~0.60
0.80 이상 Recall 급감 방지

Table 9. 실서비스 권장 threshold. VLM 게이트 로직의 근거가 되는 수치

운영 함의:fire의 threshold 0.70까지 Recall 0.991 유지 특성은 안전 시스템에 이상적이다.
threshold를 높여 오탐을 줄여도 미탐이 발생하지 않는다는 것은,
화재 알림의 신뢰도와 완전성을 동시에 확보할 수 있음을 의미한다.

07

정성 검증 개요

4 Cases × 4 Models — 정량 지표를 넘어선 실증 분석

Summary

정량 mAP만으로 판단할 수 없는 실제 CCTV 환경 대응력을 검증하기 위해, 4개의 대표 케이스에 대해 YOLOv8-l, YOLOv11-l, RT-DETRv2 V3, RT-DETRv2 V4의 네 모델을 동일 입력으로 추론하여 비교하였다. 케이스 선정은 다양한 도메인 조건(주간/야간, 야외/터널, 근거리/원거리)을 커버하도록 큐레이션되었다.

Table 10. 정성 검증 케이스 개요

Case
위치
환경
입증 대상
event 2
호남지선 서대전휴게소
주간 야외 (진압 후)
흐릿한 흰 연기 탐지
event 13
서해안선 고잔1교
주간 야외 (원거리)
광역 검은 연기 공간 정확도
event 4
경부선 금강1교
야간 야외 (강발광)
V3→V4 개선 실증
event 6
경부선 경부동탄터널
주간 터널 (타깃 도메인)
터널 환경 + V4 한계 노출

Table 10. 4 케이스는 순차적으로 난이도가 증가하며, event 6은 프로젝트의 최종 타깃 환경

각 케이스의 상세 분석은 08~11번 섹션에서 다룬다.
모든 케이스에서 모델 표시 순서는 YOLOv8-l → YOLOv11-l → RT-DETRv2 V3 → RT-DETRv2 V4로 통일하였다.

08

Case 2 — 호남지선 주간 야외 차량 화재

흐릿한 흰 연기 탐지 — 연기 특화의 기본 강점

Summary

화재 진압 이후의 흐릿한 흰 연기를 탐지하는 케이스이다. YOLO 계열은 양 모델 모두 smoke를 완전히 미탐했으며, RT-DETRv2 계열은 두 버전 모두 smoke를 정확히 탐지하였다. 특히 V4는 소방차와 주변 정상 차량을 carlight로 분리 인식하여오탐 억제와 정탐을 동시에 달성하였다.

8.1. 상황 개요

호남고속도로 지선에서 발생한 화물차 화재의 진압 완료 시점 CCTV 프레임이다. 화염은 진압되어 사라졌으나 저농도 흰 연기가 남아있으며, 주변에는 소방차 2대와 정상 주행 차량 다수가 존재한다. 이 조건은 조기 탐지가 아닌 사후 확인 단계에서의 연기 판별 능력을 검증한다.

8.2. Figure 5. 4모델 추론 비교

YOLOv8-l
event2 YOLOv8-l
smoke 미탐 0.54
YOLOv11-l
event2 YOLOv11-l
smoke 미탐 ✗
RT-DETRv2 V3
event2 RT-DETRv2 V3
smoke 탐지 0.84 ✓
RT-DETRv2 V4
event2 RT-DETRv2 V4
smoke + carlight ×5 ✅

Figure 5. Case 2 4모델 추론 결과 비교

8.3. 관찰 및 해석

YOLO 계열의 미탐, 취약 :YOLOv8-l 연기를 탐지했으나 0.54의 낮은 신뢰도, YOLOv11-l 흐릿한 흰 연기를 완전히 놓쳤다. 이는 앵커 기반 지역 특징 탐지 방식이 경계가 불분명하고 배경 대비가 약한 객체에 취약함을 실증한다.

RT-DETRv2 V4의 이중 성과:smoke를 정확히 탐지함과 동시에 소방차 2대와 주변 정상 차량들을 carlight로 분리 인식하였다. 이는 화재 관련 객체(smoke)와 비화재 객체(carlight)를 명확히 구분하는 V4의 오탐 억제 능력을 보여준다.

09

Case 13 — 서해안선 원거리 폐기물 공장 화재

광역 확산 검은 연기 — 전역 문맥 파악의 우위 실증

Summary

고속도로 옆 폐기물 공장에서 발생한 대형 화재의 원거리 CCTV 프레임이다. 화염은 CCTV 시야 밖(공장 내부)에 있으며, 광역으로 확산된 검은 연기 기둥만이 탐지 대상이다. YOLOv11-l은 미탐, YOLOv8-l은 부분 탐지(bbox 부정확)했으나, RT-DETRv2 계열은 두 버전 모두 연기 전체 범위를 정확히 포착했으며 V4는 신뢰도 0.91로 최고 수준을 기록했다.

9.1. 상황 개요

서해안고속도로 고잔1교 인근 폐기물 공장 화재이다. 화염은 공장 건물 내부에서 발생하여 CCTV에 직접 노출되지 않으며, 대형 검은 연기 기둥만이 하늘을 뒤덮고 있다. 이 케이스는 본 시스템의 핵심 목적인 "화염 없이 연기만으로 재난을 조기 감지"하는 능력을 직접 검증한다.

9.2. Figure 6. 4모델 추론 비교

YOLOv8-l
event13 YOLOv8-l
smoke 부분탐지 ⚠
YOLOv11-l
event13 YOLOv11-l
smoke 미탐 ✗
RT-DETRv2 V3
event13 RT-DETRv2 V3
smoke 전체 포착 ✓
RT-DETRv2 V4
event13 RT-DETRv2 V4
smoke 0.91 최고 신뢰도 ✅

Figure 6. Case 13 4모델 추론 결과 비교

9.3. 관찰 및 해석

YOLOv8-l의 부분 탐지:연기를 탐지하기는 했으나 bbox가 연기 기둥의 일부만 포함하였다. 이는 국소 특징 탐지 방식이 광역 확산 객체의 전체 공간 범위를 파악하지 못함을 보여준다.

RT-DETRv2 V4의 공간 정확도:Transformer의 self-attention 메커니즘이 연기의 전체 공간 분포를 하나의 객체로 인식하였다. 신뢰도 0.91은 threshold 0.70 즉시 알림 조건을 여유롭게 충족하며, 확정 알림으로 즉각 발동될 수 있음을 의미한다.

10

Case 4 — 경부선 야간 타이어 공장 대형 화재

V3 → V4 개선 효과의 정성적 실증

Summary

야간 강발광 조건의 대형 화재 케이스이다. 이 케이스의 결정적 의의는 V3가 smoke를 미탐하던 조건에서 V4가 smoke 0.6으로 탐지에 성공했다는 점이다. 이는 carlight 데이터 보강이 다른 클래스의 탐지 능력까지 향상시킨다는 5.1절 정량 관찰(small AP 4.6배)의 정성적 실증이다.

10.1. 상황 개요

경부고속도로 금강1교 인근 타이어 공장에서 발생한 야간 대형 화재이다. 강한 화염 발광야간 조명 조건이 결합된 최악의 시각적 노이즈 환경이며, 좌측 하단에는 정상 주행 차량의 등화류가 존재한다. 이 케이스는 강발광 조건에서의 fire/smoke 분리 탐지 능력 등화류-화염 혼동 억제를 동시에 검증한다.

10.2. Figure 7. 4모델 추론 비교

YOLOv8-l
event4 YOLOv8-l
smoke 0.4대 ⚠
YOLOv11-l
event4 YOLOv11-l
smoke 0.4대 ⚠
RT-DETRv2 V3
event4 RT-DETRv2 V3
smoke 미탐 ✗
RT-DETRv2 V4
event4 RT-DETRv2 V4
smoke 0.6 + fire 0.28 ✅

Figure 7. Case 4 4모델 추론 결과 비교

10.3. 핵심 관찰 — V3 → V4 개선 효과

V3의 미탐:RT-DETRv2 V3는 이 야간 강발광 조건에서 smoke를 완전히 미탐하였다. 이는 V3의 학습 데이터가 이러한 극단 조건을 충분히 커버하지 못했음을 시사한다.

V4의 개선:동일 입력에서 V4는 smoke 0.6으로 탐지에 성공하였다. carlight 데이터 보강만 이루어진 V4가 smoke 탐지 능력까지 개선한 것은, 클래스 간 데이터 균형이 표현 학습 전반에 미치는 영향을 실증한다. 이는 5.1절 Table 6의 small AP 4.6배 향상 관찰과 정합한다.

fire 신뢰도 0.28에 대한 정직한 노출:V4의 fire 탐지 신뢰도는 0.28로 실서비스 threshold(0.60~0.70) 아래에 위치한다. 그러나 본 시스템은 smoke를 화재 전조로 우선시하며, smoke 0.6이 threshold 0.60~0.70의 하한을 충족하므로 알림 발생 조건은 만족된다. fire와 smoke의 동시 탐지 자체는 카메라의 상황 인식이 정확히 이루어졌음을 의미한다.

11

Case 6 — 경부동탄터널 내 SUV 화재

본 프로젝트 타깃 도메인 + V4의 정직한 한계 노출

Summary

본 시스템의 최종 타깃 도메인인 터널 내부 환경에서 발생한 SUV 화재 케이스이다. YOLO 계열은 두 모델 모두 smoke를 미탐했으며, V3는 fire·smoke·carlight 3클래스를 모두 완벽히 구분 탐지하였다.그러나 V4는 smoke·carlight 탐지에는 성공했으나 fire를 미탐하였다. 이 관찰은 정직하게 노출되며, 원인 분석과 V5 개선 방향으로 연결된다.

11.1. 상황 개요

경부고속도로 경부동탄터널 내부에서 발생한 SUV 차량 화재이다. 화염은 명확히 노출되어 있으며, 검은 연기가 상승 확산 중이다. 뒤쪽에는 다수의 정상 주행 차량이 존재한다. 이 케이스는 프로젝트의 최종 운영 환경인 터널 내부 CCTV 조건에서의 종합 탐지 능력을 검증한다.

11.2. Figure 8. 4모델 추론 비교

YOLOv8-l
event6 YOLOv8-l
smoke 미탐 ✗
YOLOv11-l
event6 YOLOv11-l
smoke 미탐 ✗
RT-DETRv2 V3
event6 RT-DETRv2 V3
fire+smoke+carlight 완벽 ✅
RT-DETRv2 V4
event6 RT-DETRv2 V4
fire → carlight 오분류 ⚠

Figure 8. Case 6 4모델 추론 결과 비교 — V3가 4모델 중 유일하게 3클래스 완전 탐지 달성

11.3. 정직한 한계 노출 — V4의 fire → carlight 오분류

관찰

Case 6에서 V4는 smoke를 정확히 탐지하고 뒤쪽 정상 차량들의 등화류를 carlight로 정확히 분리 인식하였다. 그러나 명확히 노출된 화염을 fire가 아닌 carlight(신뢰도 0.67)로 오분류(misclassification)하였다. 동일 조건에서 V3는 fire·smoke·carlight 3클래스를 모두 정확히 구분하였다. 이는 단순 미탐(false negative)보다 위험한 오분류로, 시스템이 화염을 "정상 차량 등화"로 확신할 위험이 있는 사례이다.

통계적 맥락 (중요)

test_300 전체 통계로는 fire → carlight 오분류가 0건이다. 즉 Case 6의 오분류는 V4 모델 전반의 편향이 아니라 특정 조건에서 발생한 edge case이다. Confusion Matrix(Figure 2) 기준 fire True 845건 중 오분류는 전무하며, background 오탐으로만 13건이 존재한다.

원인 분석 (Hypothesis)

V4는 실제 CCTV 촬영 이미지를 중심으로 학습되었다. 반면 본 test 이미지는 AI 생성 이미지(synthetic)로 판단되며, 화염의 색감·텍스처가 실제 CCTV 화염과 편차가 있다. 한편 V4는 carlight 어노테이션 +487% 보강으로 "차량 전면부의 밝은 광원" 패턴에 대한 표현이 강화되어 있어, synthetic 화염의 시각적 특성이 이 패턴과 유사하게 해석되며 오분류가 발생한 것으로 추정된다. V3는 상대적으로 다양한 소스의 학습 데이터를 포함하여 이 편차에 더 관용적일 수 있다.

시스템 안전성 관점의 해석

fire 오분류에도 불구하고 smoke가 정확히 탐지되었다는 점은 결정적이다. 본 시스템의 파이프라인은 smoke만으로도 알림을 발생시키며, VLM 재검증 단계에서 화재 상황임이 확정된다. 즉 이 케이스에서도 화재 알림은 정상적으로 발동된다. 단일 클래스 오분류가 시스템 실패로 이어지지 않도록 다층 방어가 설계되어 있다.

V5 개선 방향

이 관찰은 V5 학습 데이터 구성에 AI 생성 이미지와 실제 CCTV 이미지의 혼합 검토 및 fire↔carlight 경계 케이스의 hard example mining이 필요함을 시사한다. 이는 13번 섹션 V5 계획에서 구체화된다.

12

Known Limitations

V4에서 확인된 세 가지 한계 — 정직한 노출

Summary

V4 모델의 알려진 한계 세 가지를 명시한다. 이들은 은폐 대상이 아니라 V5 개선의 정확한 출발점이다. 한계를 정직하게 노출하는 것이 시스템 신뢰도의 근간임을 강조한다.

Limitation 1. Underfitting Pattern (imgsz=640 상한)

관찰: ep12 이후 train loss는 계속 감소(12.0 → 10.86)하나 val mAP는 plateau.
원인: imgsz=640 기준 모델이 학습 가능한 표현 상한에 근접.
영향: 원본 1920×1080 CCTV의 소형/원거리 객체 정보 손실.
V5 대응: imgsz=1280 재학습 + AMP=True.

Limitation 2. Background → carlight 신규 오탐 (388건)

관찰: V3에는 없던 항목. Confusion Matrix 기준 background를 carlight로 오탐한 절대 건수 388건, background 전체 오탐 대비 0.34의 비중을 차지한다.
원인: carlight val 데이터가 81 → 624개로 확장되며 다양한 배경 조건(야간 반사광, 터널 조명 등)에서의 오탐이 드러남. 이 한계 발견 자체가 val 셋 확장의 효과이다.
단기 관리: carlight threshold 0.60 이상으로 설정하여 다수 오탐을 필터링.
V5 대응: 야간 반사광 hard negative sampling으로 배경-carlight 경계 명시적 학습.

Limitation 3. 원거리 광범위 연기 미탐

관찰: event 21에서 배경에 존재하는 대형 연기 기둥을 V4가 미탐.
원인: 극단적 원거리·저해상도 연기 도메인의 학습 데이터 부족.
V5 대응: 검은 연기·광역 확산·저해상도 케이스 도메인 다양화 보강.

원거리 연기 미탐 사례

Figure 9. Limitation 3 실사례 — 원거리 대형 연기 기둥 미탐 (event 21)

13

V5 개선 계획

V4 한계와 1:1 매칭된 데이터 구성 전략

Summary

V5의 개선 방향은 V4에서 확인된 세 가지 한계를 학습 데이터 구성 전략으로 해결하는 것이다. 모델 구조를 바꾸기 전에 데이터로 잡을 수 있는 부분을 먼저 처리한다는 원칙에 따른다.

Table 11. V5 데이터 구성 전략

대응 한계
V5 전략
라벨링 방식
Underfitting (imgsz 640)
imgsz=1280 재학습, AMP=True
고해상도 bbox 재라벨링
Background→carlight 0.34
야간 반사광 Hard Negative 수집
V4 FP 프레임을 배경 라벨로 추가
원거리 광역 연기 미탐
검은 연기·저해상도 도메인 다양화
야외 저해상도 case 직접 수집
Case 6 fire 미탐 (synthetic 편차)
AI 생성 + 실 CCTV 이미지 혼합 학습 검토
혼합 데이터 라벨링
평가 신뢰도 강화
test 셋 확장 검토
다양한 조건 균등 분포로 큐레이션

Table 11. V5 개선 전략 — 각 한계에 대응하는 정밀 타겟팅

13.1. carlight 클래스 활용 확장 구상

V4의 carlight 어노테이션 자산(6,210개)은 오탐 억제 목적을 넘어 교통 관제 기능 확장의 기반이 될 수 있다. V5 데이터 구성 단계에서 차량 밀집도·주행 패턴 조건을 함께 수집하면 다음 확장이 가능하다.

단계
기능
상태
현재
오탐 억제 (네거티브 클래스)
V4 완료
V5
차량 밀집도 분석
데이터 병행 수집 계획
V5+
정체·혼잡 탐지
별도 모델 개발 검토
장기
사고 감지
장기 목표

Table 12. carlight 자산의 단계적 확장 로드맵

14

결론

오탐 억제와 연기 특화 — 프로젝트 목적의 정합적 달성

Summary

본 보고서는 RT-DETRv2 V4의 학습 결과를 정량·정성 양면에서 종합하였다. 모델 채택의 유일한 기준은 오탐 최소화연기 조기 탐지였으며, 이는 test_300 정량 지표와 4개 케이스 정성 검증에서 일관되게 실증되었다. 한계는 은폐하지 않고 정직하게 노출하였으며, V5 개선 계획으로 연결된다.

14.1. 핵심 성과 요약

0.9267
test_300 mAP@50
V3 대비 +0.141
+487%
carlight 어노테이션
직접 라벨링 보강
× 4.6
small object AP
0.050 → 0.2294
−0.27
background→smoke
오탐률 0.82 → 0.55

14.2. 프로젝트 목적과의 정합성

오탐 최소화
carlight 클래스의 정밀 학습으로 등화류-화염 혼동을 구조적으로 억제. background→smoke 오탐 0.82 → 0.55 감소.
연기 조기 탐지
전역 문맥 파악 아키텍처로 광역 확산 연기의 공간 정확도 확보. Case 2·13에서 YOLO 계열 대비 결정적 우위 실증.
타깃 도메인 대응
터널 내부 환경(Case 6)에서 smoke/carlight 정확 탐지. fire 미탐은 학습 데이터 특성으로 원인 파악, V5에서 해결 예정.
정직한 한계 노출
3가지 Known Limitation을 명시하고 V5 대응 계획을 데이터 구성 전략으로 구체화. 은폐가 아닌 개선의 출발점.

"단순 화재 탐지가 목적이었다면 우리는 RT-DETR을 택하지 않았다."

오탐 억제와 연기 특화라는 요건 위에서, V4는 그 방향의 정합적 결과이다.