
AI
Gemma 3n 모델로 음성과 이미지도 입력해보자
두줄요약
Gemma 3n의 멀티모달 온디바이스 특징과 오디오·이미지 입력 예제를 소개했습니다. 다양한 입력 방식을 활용해 오프라인 환경에서도 응용할 수 있음을 보여주었습니다.
핵심 내용
- Gemma 3n의 텍스트, 이미지, 오디오 입력을 지원하는 멀티모달 온디바이스 특성 소개
- 5B, 8B 파라미터를 더 작은 메모리 사용량으로 실행하는 최적화와 MatFormer, KV 캐시 공유 설명
- PyTorch, Transformers, timm 설치 후 오디오·이미지 입력 예제로 실행하는 방법 제시
- 이미지 질문답변, 비교, 물체 인식, 분위기 설명, 비디오 분석 등 활용 가능성 언급
적용해볼 점
messages의 content 타입을 audio 또는 image로 바꿔 멀티모달 입력 구성max_new_tokens로 출력 길이 조절- 온디바이스 환경에서 민감 정보 보호와 오프라인 활용 고려
