실시간 STT 설계: 48kHz 리샘플링, Partial·Final 자막과 환각 억제파일 하나를 끝까지 받은 뒤 처리하는 STT(Speech-to-Text, 음성 인식)는 입력 형식을 정규화하고 모델을 한 번 실행하면 됩니다.실시간 STT는 다릅니다.브라우저와 장치마다 실제 Sample Rate(샘플링 레이트)가 다를 수 있습니다.작은 Audio Block(오디오 블록)을 끊김 없이 모아야 합니다.네트워크가 밀리면 오래된 음성이 쌓입니다.아직 말이 끝나지 않은 문장은 계속 바뀝니다.침묵과 배경음에서 그럴듯한 문장이 생성될 수 있습니다.연결이 재시작되면 중복 자막과 시간 역행이 발생할 수 있습니다.따라서 실시간 자막 품질은 모델 정확도만으로 결정되지 않습니다. 입력 Audio Contract(오디오 계약)..