
AI
효과적인 LLM 품질 평가 : 도구, 기준, 그리고 적용기 톺아보기(SPeCTRA)
두줄요약
에이닷의 LLM 품질 평가 자동화와 SPeCTRA 기준 도입 사례를 소개했습니다. 사람 평가와 자동 평가를 병행해 QA 효율과 모델 개선 주기를 높였습니다.
핵심 내용
- 에이닷의 NLU 기반 서비스에서 LLM 기반 응답 체계로 전환하며 품질 평가 자동화 필요성 대두
- 사람 테스트의 시간 제약과 주관성을 보완하기 위해 LLM을 활용한 자동 평가와 휴먼 테스트 병행 구조 설계
- 다양한 LLM API와 실제 요청·응답 환경을 대상으로 평가를 수행하고, 기준표를 반복 정제해 SPeCTRA라는 품질 기준 수립
- 로컬 배포 툴과 CI 환경을 함께 구성해 QA, TE, 유관부서가 동일한 평가 도구를 사용하도록 확장
적용해볼 점
- 평가 대상, 시나리오, 프롬프트를 분리해 자동화 입력값을 체계적으로 관리
- 낮은 점수 사례만 휴먼 테스트로 재검증해 리소스 효율화
- 평가 결과를 이슈 티켓과 학습 반영으로 연결해 모델 개선 주기를 운영
