인덱스로 건너뛰기

GLOSSARY

비전-언어 모델(VLM)

이미지도 텍스트처럼 읽는 모델. 스크린샷·차트·사진·다이어그램을 보내고 자연어로 질문합니다.

VLM은 언어 모델에 비전 인코더를 붙여 이미지를 텍스트 쪽과 같은 종류의 토큰으로 바꿉니다. 결과적으로 하나의 모델이 그림 묘사, 스크린샷 속 글자 읽기, 차트 해석, 청구서 필드 추출, '이 UI 어디가 문제인가요?' 답변까지 처리합니다 — 별도 파이프라인 없는 멀티모달 입력입니다.

이 능력은 이미 실제 제품을 떠받칩니다. 업로드된 스크린샷을 읽는 지원 도구, 지금 보고 있는 페이지를 이해하는 어시스턴트, 스캔 문서 데이터 추출. 약점도 남아 있습니다 — 잘은 글자, 정확한 세기, 공간 추론, 촘촘한 축의 차트는 여전히 모델을 넘어뜨리므로, 그런 출력은 다른 추출과 마찬가지로 검증이 필요합니다.

관련 용어

이 기술을 사용하는 도구

관련 카테고리