목록 보기
Multimodal LLM을 직접 학습시켜 보자!
AI

Multimodal LLM을 직접 학습시켜 보자!

데보션
데보션
2024년 11월 28일

두줄요약

공개 한국어 표 데이터와 InternVL2-1B로 멀티모달 LLM을 직접 학습한 사례를 소개했습니다. 작은 모델과 적은 데이터로도 표 이해 챗봇 시나리오를 검증할 수 있었습니다.

핵심 내용

  • 공개 멀티모달 한국어 데이터셋 Table-VQA-ko로 표 이미지를 이해하는 MLLM 채팅 모델 학습 사례 소개
  • 모델과 학습 파이프라인이 공개된 InternVL2-1B를 기반으로 선택하고, 한국어 성능을 고려해 fine-tuning 진행
  • json 데이터를 jsonl로 변환하고 누락 이미지를 제외한 뒤, 데이터 설정과 학습 스크립트를 수정해 학습 환경 구성
  • 학습 후 데모에서 표 설명과 후속 질문 응답을 확인하며 소규모 데이터와 모델로도 시나리오 수행 가능성 점검

적용해볼 점

  • 서비스 시나리오에 맞는 공개 데이터와 공개 학습 파이프라인 우선 탐색
  • GPU 자원에 맞춰 deepspeed stage와 학습 설정 조정
  • 작은 규모의 프로토타입으로 기능 검증 후 모델·데이터 확장 검토

댓글 0

댓글을 작성하려면 로그인이 필요합니다.

댓글을 불러오는 중...