
AI
LLM 모델이 LLM 성능을 평가한다. LLM-as-a-judge 알아보기
두줄요약
LLM이 다른 LLM의 응답 품질을 평가하는 LLM-as-a-Judge 방법을 소개했습니다. 프롬프트를 단순화하고 평가 이유를 요구하면 인간 평가와의 일치도가 크게 높아졌습니다.
핵심 내용
- LLM-as-a-Judge로 다른 모델의 응답 품질을 LLM이 평가하는 방식 소개
- 인간 평가 데이터셋과의 상관관계를 통해 판단 성능을 확인
- 평가 프롬프트를 단순하고 명확하게 바꾸면 상관관계가 크게 개선됨
구조와 흐름
- 평가 대상과 기준 정의 후 프롬프트로 점수화
- 사람 평가 데이터와 LLM 평가 결과의 피어슨 상관관계 비교
- JUDGE_PROMPT와 IMPROVED_JUDGE_PROMPT 성능 차이 검증
선택 이유
- 사람 평가 대비 시간과 비용 절감 가능성
- 평가 이유를 함께 제시해 설명 가능성 확보
- 인간 선호와 높은 일치율로 신뢰성 기대
적용해볼 점
- 평가 항목과 점수 척도를 단순화한 프롬프트 설계
- 설명 필드를 포함한 평가 형식 도입
- RAG나 챗봇 응답 평가에 LLM-as-a-Judge 활용
