
AI
Multimodal LLM을 직접 학습시켜 보자!
두줄요약
공개 한국어 표 데이터와 InternVL2-1B로 멀티모달 LLM을 직접 학습한 사례를 소개했습니다. 작은 모델과 적은 데이터로도 표 이해 챗봇 시나리오를 검증할 수 있었습니다.
핵심 내용
- 공개 멀티모달 한국어 데이터셋 Table-VQA-ko로 표 이미지를 이해하는 MLLM 채팅 모델 학습 사례 소개
- 모델과 학습 파이프라인이 공개된 InternVL2-1B를 기반으로 선택하고, 한국어 성능을 고려해 fine-tuning 진행
- json 데이터를 jsonl로 변환하고 누락 이미지를 제외한 뒤, 데이터 설정과 학습 스크립트를 수정해 학습 환경 구성
- 학습 후 데모에서 표 설명과 후속 질문 응답을 확인하며 소규모 데이터와 모델로도 시나리오 수행 가능성 점검
적용해볼 점
- 서비스 시나리오에 맞는 공개 데이터와 공개 학습 파이프라인 우선 탐색
- GPU 자원에 맞춰 deepspeed stage와 학습 설정 조정
- 작은 규모의 프로토타입으로 기능 검증 후 모델·데이터 확장 검토
