Chunking 2

한국어 문서 청킹 설계: 종결어미·임베딩 토큰 한도·회의 발화

검색 증강 생성 (Retrieval-Augmented Generation, RAG)에서 청킹 (Chunking, 문서를 검색 단위 조각으로 나누는 작업)은 가장 눈에 띄지 않으면서도 검색 품질에 큰 영향을 주는 단계입니다. 물론 파싱 품질, 원문 데이터, 임베딩, 질의 변환, 하이브리드 검색, 재순위화도 검색 품질을 좌우합니다. 다만 경계에서 손실된 문맥은 후단 검색기만으로 보완하기 어렵다는 점에서, 애초에 어떤 경계로 문서를 잘랐는지는 임베딩 (Embedding) 모델 선택과 함께 설계하되 검색기 (Retriever) 튜닝보다는 먼저 검증해야 하는 결정입니다.영어 중심 자료의 청킹 예제는 대부분 마침표와 공백으로 문장을 나누고 고정 토큰 수로 자르는 방식을 전제합니다. 한국어는 교착어 (Agglutin..

RAG 운영 설계: 멱등 인덱싱 (Idempotent Indexing)과 중복 Chunk 방지

검색 증강 생성 (Retrieval-Augmented Generation, RAG) 데모에서는 문서를 읽고 검색 단위 조각 (Chunk)으로 나눈 뒤 벡터 표현 (Embedding)을 저장하면 작업이 끝난 것처럼 보입니다.운영 환경에서는 같은 수집 작업이 반복됩니다.Worker가 Vector 저장 뒤 응답을 받기 전에 종료됩니다.Scheduler와 사용자의 수동 재처리가 동시에 실행됩니다.원본 문서가 수정됩니다.문서 해석기 (Parser) 또는 문서 분할기 (Chunker) 설정이 바뀝니다.Embedding 모델이 교체됩니다.삭제된 문서의 예전 Chunk가 검색됩니다.같은 파일이 다른 이름이나 경로로 다시 들어옵니다.이 상황에서 매 실행마다 새 UUID를 만들고 Vector Database에 insert..