
AI
나야, 에이닷 음성모드
두줄요약
에이닷 3.1에 한국어 최적화 음성모드를 도입한 내용을 소개했습니다. 스트리밍 응답을 문장 단위로 나눠 TTS 지연을 줄인 구현 방식도 다뤘습니다.
핵심 내용
- 에이닷 3.1 버전에 음성으로만 대화를 이어가는 음성모드 도입
- 한국어에 최적화된 자연스러운 TTS와 단계별 음성 상태 UI 구성
- 캘린더, 뉴스, 라디오 등 Built-in 서비스와 음성모드의 연계 경험 강조
구조와 흐름
- 음성 입력에서 ASR 변환, LLM 응답 생성, TTS 출력까지의 처리 흐름 정리
- 채팅 기록 유지와 음성모드 종료 후 채팅 이어가기 지원
- Listening, Processing, Speaking, Pause 상태별 인터페이스 구분
성능/운영 포인트
- 스트리밍 응답을 그대로 TTS로 처리하기 어려운 지점 존재
- 응답 완료 후 일괄 TTS 방식은 지연 시간 증가 문제 발생
- 문장 단위 Chunking과 비동기 TTS 호출로 지연 시간 개선
