연구노트
R&E 연구노트 ⑱ 목소리를 어떻게 알아듣는가, Transformer·Whisper·VAD
음성 인식의 안쪽. Transformer의 self-attention, Whisper의 로그-멜 스펙트로그램 처리와 모델 규모, 그리고 tiny·medium 이중 모델과 두 VAD를 병행한 발화 검출.
2026-05-07
Whisper 태그가 붙은 글 모음. BBlog 의 개발·대회·연구 기록 중 Whisper 와 관련된 글이 한 곳에 묶여 있습니다. 태그는 카테고리와 달리 한 글이 여러 개를 가질 수 있어, 서로 다른 시리즈의 글을 한 주제로 다시 묶는 역할을 합니다.
총 3개의 글
음성 인식의 안쪽. Transformer의 self-attention, Whisper의 로그-멜 스펙트로그램 처리와 모델 규모, 그리고 tiny·medium 이중 모델과 두 VAD를 병행한 발화 검출.
시각 기반 화자 분리의 벽을 우회해 Whisper로 실시간 음성 인식 파이프라인을 구성했다. WebSocket 스트리밍, tiny와 medium 이중 모델, Silero·WebRTC VAD 튜닝으로 저사양 환경에서 2~3초 내 주문 완료를 목표했다.
동기화 보정부터 ROI 추출, 특징 인코더, 마스킹, Whisper 텍스트 변환까지 음성 분리 파이프라인을 설계하고 직접 코딩했다. 그러나 기존 모델들은 이미 만들어진 영상만 처리한다는 한계에 부딪혔다.