SMART CHUNKER
의미 단위 문서 분할
고정 길이가 아닌, 문서 구조를
이해하는 청킹.
RAG 파이프라인의 검색 정확도를
근본적으로 개선합니다.
같은 문서, 같은 임베딩 모델이라도
청킹 전략에 따라 검색 정확도가
2~3배 차이납니다.
MODES
분할 모드
chunkText
텍스트를 의미 단위로 분할합니다. 단순 길이가 아닌 문장/단락 경계를 인식합니다.
TextParagraph-aware
chunkFile
파일을 파싱한 뒤 의미 단위로 분할합니다. PDF, DOCX, HTML 등 다양한 포맷을 지원합니다.
FileMulti-format
chunkHierarchical
문서 구조(제목, 소제목, 단락)를 기반으로 계층적으로 분할합니다. 메타데이터가 자동 포함됩니다.
HierarchicalMetadata
FEATURES
핵심 특징
오버랩 보존
청크 경계에서 정보 손실을 방지하기 위해 인접 청크 간 일정 비율의 오버랩을 유지합니다.
메타데이터 자동 포함
각 청크에 원본 문서의 제목, 섹션명, 페이지 번호 등 메타데이터를 자동으로 포함시켜 컨텍스트를 보존합니다.
파일 파싱 내장
PDF, DOCX, HTML, Markdown 등 파일 포맷별 파서가 내장되어 있어 별도 전처리가 불필요합니다.