연구노트
R&E 연구노트 ⑭ (2026) 실시간 음성·영상 인식 재도전
1년 차에 실시간의 벽에 막혔던 음성·영상 동시 인식에 다시 도전한다. OpenCV·PyAudio로 영상·음성을 동시에 수집하고 버퍼, 동기화, 멀티스레딩으로 묶어 PyQt GUI에 실시간 인식 결과를 띄운 과정.
2026-03-24
AVSR 태그가 붙은 글 모음. BBlog 의 개발·대회·연구 기록 중 AVSR 와 관련된 글이 한 곳에 묶여 있습니다. 태그는 카테고리와 달리 한 글이 여러 개를 가질 수 있어, 서로 다른 시리즈의 글을 한 주제로 다시 묶는 역할을 합니다.
총 3개의 글
1년 차에 실시간의 벽에 막혔던 음성·영상 동시 인식에 다시 도전한다. OpenCV·PyAudio로 영상·음성을 동시에 수집하고 버퍼, 동기화, 멀티스레딩으로 묶어 PyQt GUI에 실시간 인식 결과를 띄운 과정.
동기화 보정부터 ROI 추출, 특징 인코더, 마스킹, Whisper 텍스트 변환까지 음성 분리 파이프라인을 설계하고 직접 코딩했다. 그러나 기존 모델들은 이미 만들어진 영상만 처리한다는 한계에 부딪혔다.
시끄러운 매장에서 주문자의 목소리만 골라내는 문제. 입 모양과 음성을 함께 보는 audio-visual 접근과 Looking-to-Listen, VisualVoice 같은 화자 분리 모델을 조사했다.