STT 6

음성에서 인사이트까지: 실시간 STT·RAG로 만드는 실제 데이터 파이프라인

동반편인 기업 데이터 파이프라인 참조 아키텍처은 데이터웨어하우스에서 마케팅·고객 충성도까지 이어지는 기업 데이터 파이프라인을 범용 참조 아키텍처로 개관했습니다. 이 글은 같은 목표(데이터에서 얻은 인사이트를 업무와 고객 활용으로 잇기)를, 필자가 실제로 운영하는 AI 스택에 다시 정박해 “어떻게”를 다룹니다.원천 데이터는 정형 테이블이 아니라 음성·회의 미디어입니다. 이것을 실시간·배치 음성 인식 (Speech-to-Text, STT)으로 전사하고, 화자 분리 (Speaker Diarization)로 정제하고, 임베딩·벡터 데이터베이스에 색인해 검색 증강 생성 (Retrieval-Augmented Generation, RAG)으로 인사이트를 만듭니다. 그 인사이트를 업무로 연결하는 것이 이 파이프라인의 ..

화자 분리(Speaker Diarization) 설계: STT와는 다른 문제

회의록 제품에서 가장 자주 오해되는 지점 하나는, "음성 인식만 좋으면 화자 구분도 자연스럽게 따라온다"는 가정입니다.실제로는 그렇지 않습니다. 무엇을 말했는지를 맞히는 문제와 누가 언제 말했는지를 맞히는 문제는 같은 원음에서 출발할 수 있지만, 최적화 목표·출력·평가 지표가 다르며 대개 별도 모듈로 구현되고, 다른 방식으로 실패합니다. 두 결과를 하나의 자막으로 합치려면 별도의 정렬(alignment) 단계까지 필요합니다.이 글은 실시간 STT를 이미 갖춘 시스템에 화자 정보를 붙일 때, 화자 분리(Speaker Diarization)를 하나의 독립된 설계 대상으로 다루는 방법을 정리합니다. 그리고 순수 diarization에 그치지 않고, 익명 화자 라벨을 실제 참석자에 연결하는 화자 귀속(attri..

STT 정확도 보정과 도메인 적응: 용어 사전·교정 규칙·피드백 루프

STT(Speech-to-Text, 음성 인식)를 실서비스에 붙이면 가장 먼저 나오는 요구는 대개 하나입니다.“우리 회사 용어를 잘 못 알아들어요. 정확도를 올려 주세요.”이 요구를 “더 큰 모델로 바꾸자”거나 “파인튜닝을 하자”로 곧장 번역하면 대부분 실패합니다. 정확도는 하나의 손잡이가 아니라 여러 계층의 문제이기 때문입니다. 어떤 오류는 입력 오디오 문제이고, 어떤 오류는 파라미터로 해결되며, 어떤 오류는 인식 이후의 텍스트 교정으로만 안전하게 다룰 수 있습니다. 그리고 그중 일부만이 파인튜닝이 필요한 문제입니다.이 글은 인식 후 교정(post-recognition)을 중심으로, 거기서 필요해지는 디코딩 시점 힌트(용어 사전)와 파인튜닝까지 연결해 정확도를 끌어올리는 방법과 도메인 적응(Domain..

STT는 성공했는데 AI 요약은 왜 실패할까: 비동기 파이프라인 장애 진단

회의 음성 파일을 업로드했습니다.잠시 후 녹취록은 정상적으로 생성됐지만 AI 요약은 계속 나타나지 않습니다.이 상황에서 가장 먼저 떠올리기 쉬운 결론은 다음과 같습니다.“STT는 성공했으니 파일에는 문제가 없다.”“요약 모델이 실패한 것 같다.”하지만 두 문장 모두 아직 입증되지 않은 가설입니다.실제 회의 처리 시스템에서 STT (Speech-to-Text, 음성 인식)와 AI 요약은 하나의 함수가 아니라 서로 다른 입력·실행 환경·상태·저장소를 가진 단계입니다.Media Upload → STT → Transcript Finalization → Summary Request → Queue → Summary Worker → LLM Provider → Result Store → Read APIS..

실시간 STT 설계: 48kHz 리샘플링, Partial·Final 자막과 환각 억제

실시간 STT 설계: 48kHz 리샘플링, Partial·Final 자막과 환각 억제파일 하나를 끝까지 받은 뒤 처리하는 STT(Speech-to-Text, 음성 인식)는 입력 형식을 정규화하고 모델을 한 번 실행하면 됩니다.실시간 STT는 다릅니다.브라우저와 장치마다 실제 Sample Rate(샘플링 레이트)가 다를 수 있습니다.작은 Audio Block(오디오 블록)을 끊김 없이 모아야 합니다.네트워크가 밀리면 오래된 음성이 쌓입니다.아직 말이 끝나지 않은 문장은 계속 바뀝니다.침묵과 배경음에서 그럴듯한 문장이 생성될 수 있습니다.연결이 재시작되면 중복 자막과 시간 역행이 발생할 수 있습니다.따라서 실시간 자막 품질은 모델 정확도만으로 결정되지 않습니다. 입력 Audio Contract(오디오 계약)..

회의 음성에서 RAG까지: 녹취록·요약·검색·업무 연결 파이프라인

회의를 녹음하고 AI 요약을 생성하는 것만으로 회의 데이터가 조직의 지식이 되지는 않습니다.요약 문서는 회의 직후 내용을 빠르게 파악하는 데 유용하지만, 시간이 지나면 다시 찾기 어렵습니다. “지난 분기에 인증 방식 변경을 결정한 회의가 언제였지?”, “담당자가 이번 달까지 처리하기로 한 업무는 무엇이었지?” 같은 질문에 답하려면 여러 회의의 녹취록과 결정사항을 검색할 수 있어야 합니다.검색 결과가 실제 업무 시스템과 분리돼 있으면 사용자에게 또 다른 수작업이 생깁니다. 관련 회의를 찾은 뒤 이슈 관리 시스템을 열고, 담당자와 기한을 다시 입력해야 하기 때문입니다.회의 음성을 업무 자산으로 바꾸는 전체 흐름은 다음처럼 볼 수 있습니다.회의 음성 ↓STT·화자·시간 정보 ↓녹취록 정규화 ↓요약·..