
AI
NVIDIA Dynamo: 차세대 분산 추론 프레임워크 리뷰
두줄요약
NVIDIA Dynamo는 분산 추론을 위한 오픈 소스 프레임워크로, Prefill·Decode 분리와 스마트 라우팅으로 성능을 높였습니다.\nKV cache 오프로딩과 NIXL 전송을 통해 GPU 자원 효율과 지연 시간 개선을 노렸습니다.
핵심 내용
- NVIDIA Dynamo는 GTC 2025에서 공개된 오픈 소스 분산 추론 프레임워크
- Triton Inference Server의 후속으로, TensorRT-LLM·vLLM·SGLang 등 주요 LLM 엔진을 백엔드로 지원
- Disaggregated Serving, 동적 GPU 스케줄링, LLM-aware 요청 라우팅, KV cache 오프로딩, NIXL 기반 데이터 전송 제공
구조와 흐름
- API Server, Dynamo Planner, Smart Router, KV Cache Manager, Disaggregated Serving, NIXL로 구성
- 요청 특성과 시퀀스 길이에 따라 Prefill·Decode 자원 배치와 라우팅 최적화
- KV cache 재사용과 전송 효율을 높여 분산 추론 흐름을 개선
성능/운영 포인트
- Prefill와 Decode 분리로 자원 간섭을 줄이고 TTFT, TPOT, Throughput 개선
- 스마트 라우팅으로 KV cache 재계산을 줄여 지연 시간 감소
- 오래된 KV cache를 CPU·SSD·오브젝트 스토리지로 오프로딩해 GPU 메모리 부족 완화
