
AI
RAG 시스템을 위한 문서 전처리 가이드: AI가 이해하기 쉬운 형태로 만들기
두줄요약
RAG 시스템에서 문서 전처리가 검색 정확도를 좌우한다는 점을 설명했습니다. HTML, PDF, Excel, 이미지별로 적절한 정제와 로더 선택 방법을 정리했습니다.
핵심 내용
- RAG의 검색 성능은 문서 전처리 품질에 크게 좌우되며, 의미 단위 분할과 적절한 overlap, 도메인 지식 기반 정제가 중요
- HTML, PDF, Excel, 이미지 문서는 원본 구조를 그대로 쓰기보다 마크다운 변환, 레이아웃 보존, 적절한 로더 선택이 필요
- 문서 유형별로 RecursiveCharacterTextSplitter, PyMuPDF, UnstructuredExcelLoader, OCR/메타데이터 결합 등 전처리 전략을 달리 적용
적용해볼 점
- 긴 문서는 글자 수보다 의미 단위와 문맥 연결 기준으로 청킹
- HTML은 불필요한 태그를 제거하고 마크다운으로 정리
- PDF는 표와 레이아웃 보존을 고려해 로더를 선택
