Chromadb 2

음성에서 인사이트까지: 실시간 STT·RAG로 만드는 실제 데이터 파이프라인

동반편인 기업 데이터 파이프라인 참조 아키텍처은 데이터웨어하우스에서 마케팅·고객 충성도까지 이어지는 기업 데이터 파이프라인을 범용 참조 아키텍처로 개관했습니다. 이 글은 같은 목표(데이터에서 얻은 인사이트를 업무와 고객 활용으로 잇기)를, 필자가 실제로 운영하는 AI 스택에 다시 정박해 “어떻게”를 다룹니다.원천 데이터는 정형 테이블이 아니라 음성·회의 미디어입니다. 이것을 실시간·배치 음성 인식 (Speech-to-Text, STT)으로 전사하고, 화자 분리 (Speaker Diarization)로 정제하고, 임베딩·벡터 데이터베이스에 색인해 검색 증강 생성 (Retrieval-Augmented Generation, RAG)으로 인사이트를 만듭니다. 그 인사이트를 업무로 연결하는 것이 이 파이프라인의 ..

웹 리서치 RAG: 공개 웹 문서 추출·청킹·Semantic Search를 MCP로 제공하기

AI 에이전트에게 지식을 주는 방법은 하나가 아닙니다. 사내 회의 녹취를 검색 가능한 지식으로 만드는 파이프라인은 이전 글에서 다뤘습니다(회의 오디오 → RAG). 이 글은 성격이 전혀 다른 지식원, 즉 공개 웹 문서를 대상으로 한 검색 증강 생성 (Retrieval-Augmented Generation, RAG)을 다룹니다.이 글은 구현 회고가 아니라 설계 가이드입니다. 아래에 나오는 코드는 대부분 개념을 보여주기 위한 개념 코드이며, 특정 버전·실행 환경에서 측정한 검색 품질·성능 수치를 제시하지는 않습니다. 대신 "공개 웹을 지식원으로 붙일 때 무엇을 어떻게 결정해야 하는가"에 대한 설계 지침에 집중합니다.제안하는 파이프라인의 골격은 이렇습니다. 공개 웹 페이지를 수집(Crawl)하고, 본문을 추출..