목록 보기
VLM, LLM을 사용하여 멀티모달 학습 데이터 제작하기
AI

VLM, LLM을 사용하여 멀티모달 학습 데이터 제작하기

SSG.COM
SSG.COM
2024년 12월 11일

두줄요약

VLM과 LLM을 활용해 멀티모달 학습 데이터를 만드는 방법을 소개했습니다. OCR, 프롬프트 엔지니어링, 후처리로 수작업 라벨링의 비용과 시간을 줄였습니다.

문제 상황

  • 멀티모달 검색용 학습셋이 부족하고, 공개 데이터만으로는 가구처럼 도메인 특화 모델 품질 확보가 어려운 상황
  • 기존 상품명·카테고리 중심 데이터만으로는 이미지의 세부 특징과 텍스트 관계를 충분히 담기 어려운 문제
  • 사람 수작업 라벨링은 시간과 비용이 많이 들고, 상세 설명 수준의 대량 데이터 제작이 비효율적인 문제

원인 분석

  • 멀티모달 학습에는 이미지와 텍스트의 정합성이 높은 상세 라벨이 필요하지만 확보 난도가 높음
  • OCR 결과는 노이즈와 누락, 대표 이미지와 불일치한 정보 포함 가능성으로 바로 쓰기 어려움
  • VLM/LLM도 도메인 특화 지식 부족, 추론 속도, 환각, 일관성 문제를 가짐

해결 방법

  • 상품 상세 이미지에서 OCR로 텍스트를 추출하고, VLM으로 이미지와 OCR 결과의 정합성 검토
  • 프롬프트 엔지니어링으로 역할 부여, Few-shot, Reasoning 등을 조합해 원하는 형식의 설명 생성
  • Gemini는 Google Vertex AI와 Batch Prediction을 활용해 속도와 비용 효율을 확보하고, 후처리로 오류와 불일치 보정

성능/운영 포인트

  • 대표 이미지와 텍스트가 어긋나는 사례, 관련 없는 인용, 표현 불일치 등은 후처리로 관리 필요
  • Safety Settings, Chat Session, Batch Prediction을 통해 운영 비용과 응답 품질을 조정
  • 모델 생성 데이터는 자동 생성만으로 끝내지 말고 평가와 정제 과정이 필수

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...