
AI
LLM Knowledge Distillation 훑어보기 - part 2
두줄요약
지식 증류가 student 성능 개선뿐 아니라 LLM 추론 속도 향상에도 활용된다는 점을 정리했습니다. speculative decoding과 SKD 같은 최신 방법으로 성능과 효율을 함께 높이는 흐름을 설명했습니다.
핵심 내용
- 지식 증류의 장점이 student 성능 개선뿐 아니라 LLM 추론 속도 향상에도 있다는 점 정리
- speculative decoding의 동작 방식과, distillation으로 작은 모델과 큰 모델의 응답 유사도를 높여 속도 이득을 키우는 흐름 설명
- SKD 같은 하이브리드 기법으로 on-policy와 supervised KD의 장점을 결합하려는 최근 시도 소개
적용해볼 점
- 추론 효율이 중요한 경우 distillation과 decoding 전략을 함께 고려
- 성능, 컴퓨팅 리소스, 시간 리소스의 균형을 기준으로 online KD와 offline KD를 선택
