AI
VLM, LLM을 사용하여 멀티모달 학습 데이터 제작하기
두줄요약
VLM과 LLM을 활용해 멀티모달 학습 데이터를 만드는 방법을 소개했습니다. OCR, 프롬프트 엔지니어링, 후처리로 수작업 라벨링의 비용과 시간을 줄였습니다.
문제 상황
- 멀티모달 검색용 학습셋이 부족하고, 공개 데이터만으로는 가구처럼 도메인 특화 모델 품질 확보가 어려운 상황
- 기존 상품명·카테고리 중심 데이터만으로는 이미지의 세부 특징과 텍스트 관계를 충분히 담기 어려운 문제
- 사람 수작업 라벨링은 시간과 비용이 많이 들고, 상세 설명 수준의 대량 데이터 제작이 비효율적인 문제
원인 분석
- 멀티모달 학습에는 이미지와 텍스트의 정합성이 높은 상세 라벨이 필요하지만 확보 난도가 높음
- OCR 결과는 노이즈와 누락, 대표 이미지와 불일치한 정보 포함 가능성으로 바로 쓰기 어려움
- VLM/LLM도 도메인 특화 지식 부족, 추론 속도, 환각, 일관성 문제를 가짐
해결 방법
- 상품 상세 이미지에서 OCR로 텍스트를 추출하고, VLM으로 이미지와 OCR 결과의 정합성 검토
- 프롬프트 엔지니어링으로 역할 부여, Few-shot, Reasoning 등을 조합해 원하는 형식의 설명 생성
- Gemini는 Google Vertex AI와 Batch Prediction을 활용해 속도와 비용 효율을 확보하고, 후처리로 오류와 불일치 보정
성능/운영 포인트
- 대표 이미지와 텍스트가 어긋나는 사례, 관련 없는 인용, 표현 불일치 등은 후처리로 관리 필요
- Safety Settings, Chat Session, Batch Prediction을 통해 운영 비용과 응답 품질을 조정
- 모델 생성 데이터는 자동 생성만으로 끝내지 말고 평가와 정제 과정이 필수
