인덱스로 건너뛰기

GLOSSARY

음성 인식(ASR)

말을 텍스트로 바꾸는 기술. 회의 전사, 음성 어시스턴트, 자막 도구의 기반으로, 깨끗한 오디오에선 사람에 가까운 정확도입니다.

현대 자동 음성 인식은 딥러닝 파이프라인입니다. (대개 Whisper 계열의) 오디오 인코더가 소리를 표현으로 사상하고, 디코더가 문장부호·대문자·화자 라벨까지 붙인 단어로 바꿉니다. 소음, 억양, 겹치는 화자, 도메인 용어가 여전히 정확도의 적입니다.

이 디렉터리에서 ASR은 한 제품 패밀리의 보이지 않는 엔진입니다. 회의 노트(Otter, Fireflies), 팟캐스트 편집(Descript), 자막 생성(VEED, Captions), 음성 인터페이스. 고르는 기준은 전사를 둘러싼 워크플로 — 요약·액션 아이템·편집입니다. 날것 정확도 차이는 극적으로 좁혀졌기 때문입니다.

관련 용어

이 기술을 사용하는 도구

관련 카테고리