
AI
서버 없이도 가능하다! 온디바이스 음성인식 기술의 비밀
두줄요약
온디바이스 음성인식으로 서버 기반 처리의 지연과 비용 문제를 줄이는 방법을 다뤘습니다. EPD, FSA, ASR를 통합한 SDK와 모델 최적화 과정을 소개했습니다.
문제 상황
- 에이닷 통화 요약 서비스에서 서버 기반 음성인식의 지연 시간 문제
- 대규모 통화 처리에 따른 GPU 연산 비용 부담
- 모바일 환경에서 서버 수준 성능과 속도를 함께 맞춰야 하는 제약
해결 방법
- 음성을 기기에서 직접 처리하는 온디바이스 ASR SDK 도입
- EPD, FSA, ASR를 패키징한 통합 SDK와 callback API 구성
- 서버향과 동일한 구조에서 시작해 디코더 축소, 양자화, 지식 증류로 경량화
구조와 흐름
- LAS 기반 인코더-디코더 구조 적용
- 트랜스포머에서 컨포머, 브랜치포머, 강화된 브랜치포머로 인코더 구조 실험
- EPD로 음성 구간 검출 후 ASR 처리, FSA로 특정 단어 인식 보정
성능/운영 포인트
- 텍스트만 서버로 전송해 파일 업로드와 원본 음성 보관 부담 감소
- 라이브러리 14MB 미만, Android와 iOS용 패키지 제공
- 디코더 레이어 절반 축소로 약 20% 속도 개선, 지식 증류로 성능과 크기 동시 개선
