FP32 기준 → AMP+EMA+GC
RESEARCH / SINGLE-GPU TRAINING
Improving Time-to-Target Performance in Text-Based Person Search
숭실대학교 컴퓨터학부
단일 GPU에서 텍스트 기반 인물 검색 모델을 학습할 때, 검색 구조를 바꾸지 않고도 목표 성능에 도달하는 시간과 GPU 메모리 사용량을 함께 줄일 수 있는지 살펴본 연구입니다. Edge AI의 자원 제약을 연구 동기로 삼았으며, 실험은 RTX 5070 Ti 한 대에서 진행했습니다.
CUHK-PEDES / VALIDATION ABLATION
세 기법을 결합해 시간과 메모리를 함께 줄였습니다.
FP32 기준과 AMP+EMA+GC의 최적 검증 체크포인트를 비교한 결과입니다. 학습 시간은 검증에 쓴 시간을 제외합니다.
70.1% 감소 · FP32 기준 대비
90.0% 감소 · FP32 기준 대비
학습 시간과 메모리는 서로 다른 병목입니다.
텍스트 기반 인물 검색은 사람이 쓴 설명으로 사진 속 인물을 찾는 작업입니다. 단일 GPU에서는 연산이 느려 목표 성능까지 오래 걸릴 수 있고, 모델이 학습 중 만드는 중간 정보가 GPU 메모리를 채울 수도 있습니다. 시간만 줄이거나 메모리만 낮추면 다른 제약이 남을 수 있어 두 비용을 함께 측정했습니다.
모델 구조와 학습 목표는 그대로 두고, AMP·EMA·Gradient Checkpointing을 개별적으로 그리고 함께 적용해 각 기법이 계산 시간, 좋은 체크포인트를 얻는 시점, activation 메모리에 어떤 영향을 주는지 비교했습니다.
각 기법이 줄이는 비용은 다릅니다.
AMP
가능한 연산을 FP16으로 수행해 업데이트 계산을 빠르게 합니다. FP32 모델 가중치는 유지하고 동적 loss scaling을 사용해 작은 기울기 값이 사라질 위험을 줄였습니다.
EMA
학습 가능한 가중치의 지수 이동 평균을 별도로 유지하고 검증과 체크포인트 선택에 사용합니다. 가중치 변동을 부드럽게 해 좋은 검증 체크포인트를 더 이른 시점에 얻도록 돕습니다. 개별 학습 업데이트나 epoch를 직접 빠르게 만드는 기법은 아닙니다.
Gradient Checkpointing
역전파에 필요한 중간 activation을 모두 저장하는 대신 일부만 남기고, 나머지는 역전파 중 다시 계산합니다. 그만큼 activation 메모리를 줄이지만 재계산 때문에 업데이트 시간이 늘어날 수 있습니다.
결합 구성은 낮은 메모리와 빠른 체크포인트를 함께 달성했습니다.
CUHK-PEDES 검증 ablation에서 FP32 기준은 t2i R@1 70.01%, 프로세스 최대 VRAM 14.15 GiB, 최적 검증 체크포인트까지 학습 8.54시간이었습니다. AMP+EMA+GC는 각각 71.06%, 4.23 GiB, 0.85시간이었습니다. 검증 R@1 차이는 1.05%p이며, VRAM은 70.1%, 학습 시간은 90.0% 줄었습니다.
FP32+EMA+GC · epoch 15
AMP+EMA · 최적 검증 체크포인트까지
GC를 더해 AMP+EMA보다 0.22시간 늘고, VRAM은 9.51에서 4.23 GiB로 감소
따라서 AMP+EMA+GC는 모든 지표에서 가장 좋은 구성이라기보다 시간과 메모리의 균형을 택한 구성입니다. 원고는 CUHK-PEDES 공식 test split에서 70.11% t2i R@1도 별도로 보고합니다. 이 페이지의 70.01%와 71.06%는 validation 결과이며, 70.11%와 서로 다른 분할의 수치입니다.
한 대의 GPU에서 동일한 학습 조건을 비교했습니다.
- GPU
- NVIDIA RTX 5070 Ti 한 대
- 모델
- OpenAI 사전 학습 가중치로 초기화한 OpenCLIP ViT-B/16, 이미지·텍스트 인코더 전체 미세 조정
- 데이터와 입력
- CUHK-PEDES 공식 train/validation/test 분할, 이미지 384×128, batch size 64
- 학습 설정
- AdamW, 최대 60 epoch, AMP 사용 시 FP16 autocast와 동적 gradient scaling
- 지표
- 검증 성능은 text-to-image Rank-1(t2i R@1), VRAM은 W&B 시스템 기록에 잡힌 실행 프로세스의 최대 GPU 메모리
- 시간 집계
- 표의 학습 시간은 validation을 제외합니다. end-to-end 시간에는 학습과 validation이 포함됩니다.
결과가 보여 주는 범위
- 연구 동기는 Edge 환경의 자원 제약이지만 실험은 단일 RTX 5070 Ti에서 진행했습니다. Jetson 등 Edge 장비에서 직접 측정한 결과는 아닙니다.
- 70.01%에서 71.06%로의 비교와 70.1%·90.0% 감소는 CUHK-PEDES ablation의 validation 체크포인트에 관한 수치입니다. 다른 데이터셋이나 하드웨어에서 같은 폭의 개선을 보장하지 않습니다.
- 연구는 학습 절차의 효율을 다루며 검색 모델 구조를 새로 제안하지 않습니다. 원고는 공식 test 결과를 validation 수치와 구분해 보고하고, IRRA 또는 RDE보다 검색 정확도가 높다고 주장하지 않습니다.